【发布时间】:2018-01-31 23:44:12
【问题描述】:
我们正在尝试选择一个标记器以在我们的注释管道中使用。目前,我正在用一些 twitter 文本测试 PTBTokenizer。 在我们的数据中,我们有一些文本在句子最后一个点之后没有空格:“这是一个测试。还有更多。” PTBTokenizer 不将“test”、“.”、“And”识别为单独的标记,而是将“test.And”作为单个标记。分词器中是否有任何选项或设置可以将句末标点符号识别为单个分词,即使它后面没有空格?
谢谢。
【问题讨论】:
-
在每个点之后自己添加一个空格怎么样?
-
并非所有的点都是最后的标点符号。比如“e.g., U.S., Corp., xxx.yy”等。所以,这是一个真正的NLP问题,需要一些努力来解决。这就是为什么我没有在点周围插入空格。谢谢。
标签: nlp stanford-nlp