【问题标题】:Part of speech for unknown and known words未知和已知单词的词性
【发布时间】:2013-05-20 05:15:14
【问题描述】:

未知词的词性标注和已知词的词性标注有什么不同。有没有什么工具可以预测词的词性标注..

【问题讨论】:

    标签: nlp stanford-nlp oov


    【解决方案1】:

    处理词汇外单词的一种常见方法是用标记 *RARE* 替换训练语料库中出现频率较低(例如频率 RARE*。

    更简单的方法是用多数标记标记每个词汇表外的单词。以下代码使用 nltk 工具包将每个看不见的单词标记为“NN”。

    tagger = nltk.UnigramTagger(trainingCorpus, backoff=nltk.DefaultTagger('NN'))

    【讨论】:

    • 如果 OP 没有在 python 下编码,则相关但不是很有用 =)
    【解决方案2】:

    TnT tagger's paper 提出了一种标记未知单词的有效方法。

    this article 中可以找到另一种使用词典来处理未知单词的方法。文章表明,与 TnT 相比,基于词典的方法在 13 种语言(包括保加利亚语、捷克语、荷兰语、英语、法语、德语、印地语、意大利语、葡萄牙语、西班牙语、瑞典语、泰语和越南语)上获得了有希望的未知单词标记结果.您还可以在 13 种语言上的 TnT 和其他两个 POS 和形态标记器的文章准确度结果(已知词和未知词)中找到。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-06-16
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-06-15
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多