【问题标题】:Recommended annotation tool to create a Named Entities Recognition data set推荐的用于创建命名实体识别数据集的注释工具
【发布时间】:2022-10-14 14:18:39
【问题描述】:

我是 NLP 新手。我正在寻找有关注释工具的建议,以从原始文本创建标记的 NER 数据集。

详细说明:

我正在尝试为特定类型的实体创建一个带标签的数据集,以便开发我自己的 NER 项目(首先基于规则)。 我以为会有一些友好的框架允许创建标记项目,标记文本数据,创建标记数据集,甚至共享项目,以便几个人可以在同一个项目上工作,但我很难找到一个(我承认“友好”或“直觉”是主观的,但这是我的经验)。

到目前为止,我已经尝试了几个框架:

  • 我试过LightTag。它使标记本身变得快速和容易(即标记单词并给它们标签)但是创建有用数据集的整个过程并不像我预期的那样直观(即上传文本文件,拆分到不同的标记对象,保存标签, ETC。)
  • 我已经安装并尝试了LabelStudio,发现它不如LightTag成熟(这里不是要判断:))
  • 我还阅读了 spaCy 的 Prodigy,它提供了一个付费注释工具。我会考虑购买它,但他们的网站仅提供标记阶段的现场演示,如果他们的产品优于上述其他两种产品,我将无法访问。

即使在 StackOverflow 中,我在这件事上发现的 latest question 也是 5 年前的事了。

您对从原始文本创建带标签的 NER 数据集的工具有什么建议吗?

【问题讨论】:

    标签: nlp annotations named-entity-recognition tagging prodigy


    【解决方案1】:

    ⚠️ 免责声明

    我是 Acharya 的作者。我的回答仅限于问题中提出的要点。


    根据您的问题,Acharya 将帮助您创建项目并上传原始文本数据并对其进行注释以创建标记数据集。

    它允许您单独标记记录以在数据集中进行训练或测试,并提供以数据为中心的报告来识别和修复注释/标签错误。

    它允许您在项目中添加不同的算法(自带算法)并定期训练模型。一旦经过训练,它就可以从经过训练的模型对未标记数据给出注释建议,从而加快标记过程。

    如果您想在不同的设置中进行训练,它允许您以多种支持的格式导出标记的数据集。

    目前不支持项目共享。

    Acharya 社区版是 alpha 版本。 github页面(https://github.com/astutic/Acharya) 网站 (https://acharya.astutic.com/)

    Doccano 是另一个开源注释工具,您可以查看 https://github.com/doccano/doccano

    【讨论】:

      【解决方案2】:

      我使用过 DOCCANO (https://github.com/doccano/doccano) 和 BRAT (https://brat.nlplab.org/)。

      发现后者非常好,它支持更多的功能。两者都可以免费使用。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2015-04-26
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-05-18
        • 2013-10-19
        • 1970-01-01
        • 2020-09-24
        相关资源
        最近更新 更多