【问题标题】:Preventing tokens from containing a space in Stanford CoreNLP防止令牌在斯坦福 CoreNLP 中包含空格
【发布时间】:2016-04-06 02:36:41
【问题描述】:

Stanford CoreNLPtokenizer 中是否有防止令牌包含空格的选项?

例如如果句子是“我的手机是 617 1555-6644”,则子串“617 1555”应该是 Into two different tokens。

我知道选项normalizeSpace

normalizeSpace:令牌(电话号码、分数)中的任何空格是否变成 U+00A0(不间断空格)。对于我们的大多数斯坦福 NLP 软件来说,关闭它是很危险的,因为它假定令牌中没有空格。

但我不希望标记包含任何空格,包括不间断空格。

【问题讨论】:

    标签: nlp stanford-nlp tokenize


    【解决方案1】:

    您可以尝试将 tokenize.whitespace 选项设置为 true,但这将始终且仅在空白处进行标记。例如,“it's”将不再标记为“it's”。

    【讨论】:

    • 谢谢,只在空格上进行标记有点粗糙:/
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-03-17
    • 2020-05-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多