【问题标题】:Named Entity Recognition (Ner) - Organization Name Database命名实体识别 (Ner) - 组织名称数据库
【发布时间】:2016-04-01 08:10:46
【问题描述】:

我正在从事我当前的毕业项目,即土耳其语的命名实体识别。当我使用人名和位置(有时位置可以使用不同的语言,例如塔克西姆/伊斯坦布尔的希尔顿酒店)时,识别器应该能捕捉到土耳其语单词,我需要在我的数据集中添加“酒店”,其中充满了特定的位置标签,例如酒店、餐厅或购物中心。但是当涉及到组织名称标签时。我需要找到一个很好的乐队、产品、公司名称数据集,但不知道如何找到或收集这个数据集

在斯坦福 nlp 工具中:http://nlp.stanford.edu:8080/ner/process

当我输入 Facebook 、 Nike 、 Adidas 等时,它可以找到它的组织。那么有没有办法让该组织名称 Dataset ?

【问题讨论】:

    标签: nlp nltk stanford-nlp opennlp named-entity-recognition


    【解决方案1】:

    如果您对具有这些组织名称的数据资源感兴趣。您可以使用其中一种可用的知识库 KB,例如

    它们都有这些组织的名称,而且还有更多,您需要付出一些努力才能仅使用它们的类型来提取组织。例如,YAGO 具有可下载的文件,其中包含可能的实体及其类型。您可以对其进行过滤,然后您可以使用 hasMeaning 数据来获取所有可能的名称。

    Yago 和 BabelNet 已用于 NER 或命名实体消歧系统 AIDA 和 Babelfy。

    AIDA 提供了一个强大的可能实体名称数据集,可用于 NER。

    【讨论】:

    • 尊敬的 Mohammed 感谢您的回复,非常有帮助。我要使用 yago,因为它有一套不错的套装,我可以轻松管理它们。再次感谢。
    • 不客气...如果您打算使用 Yago .. 检查这些可能的名称 .. 它使它更适合您的任务。
    【解决方案2】:

    尝试从维基百科收集它们。它是一个巨大的来源。 您可以编写一个解析器,从 wiki 转储中收集特定类型实体的信息。 Wikipedia 具有对人员、位置和组织进行分类的层次结构。

    【讨论】:

    • 感谢您的回复,但维基百科(vikipedi)中的土耳其组织非常小。 en.wikipedia.org/wiki/List_of_companies_of_Turkey 。另外我不知道如何解析它们并只收集名称,如果它不会打断你的工作,我真的很想知道如何。你可以给我提示。再次感谢您
    • 如果您查看转储文件,它是一个巨大的 xml 文件。每个页面都是特定模式中的 xml 标记。如果您阅读每个 xml 页面级别节点中的前 2 行文本,它通常会说:XYZ 是一个做 ABC 的组织或一些您可以轻松解释的文本。如果你必须建立一个组织列表,你也可以看一下英文转储。 en.wikipedia.org/wiki/Wikipedia:Database_download
    • 如果您认为这回答了您的问题,请您将其标记为答案。
    猜你喜欢
    • 2017-06-19
    • 2012-04-20
    • 2020-11-04
    • 2021-06-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-03-17
    • 2020-04-03
    相关资源
    最近更新 更多