【发布时间】:2022-10-14 14:18:39
【问题描述】:
我是 NLP 新手。我正在寻找有关注释工具的建议,以从原始文本创建标记的 NER 数据集。
详细说明:
我正在尝试为特定类型的实体创建一个带标签的数据集,以便开发我自己的 NER 项目(首先基于规则)。 我以为会有一些友好的框架允许创建标记项目,标记文本数据,创建标记数据集,甚至共享项目,以便几个人可以在同一个项目上工作,但我很难找到一个(我承认“友好”或“直觉”是主观的,但这是我的经验)。
到目前为止,我已经尝试了几个框架:
- 我试过LightTag。它使标记本身变得快速和容易(即标记单词并给它们标签)但是创建有用数据集的整个过程并不像我预期的那样直观(即上传文本文件,拆分到不同的标记对象,保存标签, ETC。)
- 我已经安装并尝试了LabelStudio,发现它不如LightTag成熟(这里不是要判断:))
- 我还阅读了 spaCy 的 Prodigy,它提供了一个付费注释工具。我会考虑购买它,但他们的网站仅提供标记阶段的现场演示,如果他们的产品优于上述其他两种产品,我将无法访问。
即使在 StackOverflow 中,我在这件事上发现的 latest question 也是 5 年前的事了。
您对从原始文本创建带标签的 NER 数据集的工具有什么建议吗?
【问题讨论】:
标签: nlp annotations named-entity-recognition tagging prodigy