【问题标题】:Is it possible to do lemmatization independently in spacy?是否可以在 spacy 中独立进行词形还原?
【发布时间】:2017-02-24 10:10:51
【问题描述】:

我正在使用 spacy 对数据进行预处理以进行情感分析。

我想做的是:

1) 词形还原
2) 词性词的词性标注

但是由于 spacy 在调用解析器时会同时执行所有过程,因此它会执行所有计算两次。是否有禁用非必需计算的选项?

【问题讨论】:

    标签: python machine-learning nlp spacy


    【解决方案1】:

    查看 Language.call 方法,了解如何按顺序应用各种流程。数量不多——基本上是:

    doc = nlp.tokenizer(text)
    nlp.tagger(doc)
    nlp.parser(doc)
    nlp.entity(doc)
    

    如果您需要不同的序列,您应该编写自己的函数以不同的方式将它们串在一起。

    不过,我不确定您的要求是否有意义。如果您将 POS 标记器应用于词形还原文本,则统计模型可能不会表现得很好。屈折变化后缀是重要的​​特征。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-12-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多