【发布时间】:2016-04-06 02:36:41
【问题描述】:
Stanford CoreNLP 的tokenizer 中是否有防止令牌包含空格的选项?
例如如果句子是“我的手机是 617 1555-6644”,则子串“617 1555”应该是 Into two different tokens。
我知道选项normalizeSpace:
normalizeSpace:令牌(电话号码、分数)中的任何空格是否变成 U+00A0(不间断空格)。对于我们的大多数斯坦福 NLP 软件来说,关闭它是很危险的,因为它假定令牌中没有空格。
但我不希望标记包含任何空格,包括不间断空格。
【问题讨论】:
标签: nlp stanford-nlp tokenize