【问题标题】:Add domain-specific entities to spaCy or Stanford NLP training set将特定领域的实体添加到 spaCy 或斯坦福 NLP 训练集
【发布时间】:2018-11-14 02:32:33
【问题描述】:

在重新训练模型之前,我们希望将一些自定义实体添加到斯坦福 NLP 或 spaCy 的训练集中。我们愿意标记我们的自定义实体,但我们希望将这些添加到现有的训练集中,以免花费太多时间标记。

我们假设 NLP 模型是在一个大型标记数据集上训练的,其中包括标记为“O”(“其他”,即没有兴趣)的单词以及标记为“DATE”的单词的标签, “PERSON”、“ORGANIZATION”等。我们有一组自定义的 ORGANIZATION 词,但我们希望在重新训练模型之前将这些词添加到所有其他标记数据中。

这可能吗?我们应该怎么做?我们是否必须获得训练模型的标记数据集,以便我们可以添加自己的数据?如果是这样,我们该怎么做?

我们已经使用斯坦福 NLP 和 spaCy 构建了原型,因此任何一个的答案都适合我们。

【问题讨论】:

    标签: stanford-nlp spacy


    【解决方案1】:

    您可以使用 helkaroui 的 entity tagger tool 创建您自己的训练集。

    【讨论】:

      【解决方案2】:

      对于 spaCy,您应该可以致电 nlp.update()。这将根据当前权重进行权重更新,让您恢复训练。如果您想进行多次更新,您可能需要使用原始模型解析一些文本,并在您的训练中将其混合,以避免“灾难性遗忘”问题。

      【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-22
      • 1970-01-01
      • 2014-04-30
      • 1970-01-01
      • 2014-04-26
      • 1970-01-01
      相关资源
      最近更新 更多