【问题标题】:Tokenize the words based on a list根据列表对单词进行标记
【发布时间】:2018-04-30 12:55:46
【问题描述】:

我需要根据特定的单词列表对句子中的单词进行分词。

wordlist = ["nlp - nltk", "CIFA R12 - INV"]

示例输入:这是nlp - nltk CIFA R12 - INV 的示例文本。

在使用 word_tokenize(Exapmle-input) 时,我需要 nlp - nltk 作为一个标记,CIFA R12 - INV 作为另一个标记。这是否可能而不是将nlp - CIFA 作为不同的令牌?

【问题讨论】:

    标签: python nltk tokenize


    【解决方案1】:

    对于那些将来来这里的人:-
    经过一番阅读,我发现 nltk.tokenize.mwe 模块是实现上述要求的选项。

    参考:http://www.nltk.org/api/nltk.tokenize.mwe.html

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-04-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-08-12
      • 2022-10-23
      • 2018-10-22
      相关资源
      最近更新 更多