【发布时间】:2015-02-05 14:08:32
【问题描述】:
我正在考虑利用 Lucene 的 StandardTokenizer 在非 IR 上下文中进行词标记化。
我了解此标记器会删除标点符号。有人知道(或碰巧有经验)将标点符号作为单独的标记输出吗?
当前行为示例:
Welcome, Dr. Chasuble! => Welcome Dr. Chasuble
期望行为示例:
Welcome, Dr. Chasuble! => Welcome , Dr. Chasuble !
【问题讨论】:
-
您可以使用 Whitespace 分词器,后跟一个模式分词器,它在单词边界上拆分,即正则表达式
\b
标签: java solr lucene nlp tokenize