【发布时间】:2018-11-14 02:32:33
【问题描述】:
在重新训练模型之前,我们希望将一些自定义实体添加到斯坦福 NLP 或 spaCy 的训练集中。我们愿意标记我们的自定义实体,但我们希望将这些添加到现有的训练集中,以免花费太多时间标记。
我们假设 NLP 模型是在一个大型标记数据集上训练的,其中包括标记为“O”(“其他”,即没有兴趣)的单词以及标记为“DATE”的单词的标签, “PERSON”、“ORGANIZATION”等。我们有一组自定义的 ORGANIZATION 词,但我们希望在重新训练模型之前将这些词添加到所有其他标记数据中。
这可能吗?我们应该怎么做?我们是否必须获得训练模型的标记数据集,以便我们可以添加自己的数据?如果是这样,我们该怎么做?
我们已经使用斯坦福 NLP 和 spaCy 构建了原型,因此任何一个的答案都适合我们。
【问题讨论】:
标签: stanford-nlp spacy