【问题标题】:Named entities extraction with Google NL API and Open Calais API使用 Google NL API 和 Open Calais API 提取命名实体
【发布时间】:2019-01-13 12:51:48
【问题描述】:

我正在尝试从文本中识别命名实体并将它们分类为人物、地点和组织。我正在使用 Google 的 Cloud Natural Language API 和 Open Calais API 来识别命名实体。

  1. 当我输入包含“中国”一词的文本时,Google NL API 将其识别为“人”类型。但是,它在文件中的上下文含义将其作为一个国家来处理。 Google NL API 是否能够根据文本上下文提供实体?如果是这样,请让我知道我错过了什么。

  2. 如果文本包含单词“obama”,则 google NL API 将“Obama”输出为 Person,而 Open Calais API 将“Barak Obama”识别为 Person。 为什么会这样?还有什么其他方法可以从文本中的术语中获取确切的命名实体,比如 Open Calais 返回的那个?

【问题讨论】:

    标签: semantics named-entity-extraction opencalais google-natural-language


    【解决方案1】:

    关于(1),你能分享一下你的句子吗?我尝试了一些句子,例如“我要去中国旅行”或“你认识中国的任何人”,它确实返回 Location 作为中国的类型(您可以在 https://cloud.google.com/natural-language/ 快速尝试)

    关于 (2),NL API 从文本中提取实体。所以,如果文本有“奥巴马”,它会提取“奥巴马”,如果它是“巴拉克奥巴马”,它会这样提取。但是,它将正确地将这两种情况解析到正确的维基百科页面,并为两种情况返回相同的 MID。因此,您也可以从中提取信息。

    【讨论】:

    • 我正在尝试的句子是-'紧随其后的是美国,然后是中国。[214]'对于这句话'中国'。被 Google NL API 识别为“PERSON”。如果我删除末尾括号中的数字字符串,那么它将“中国”归类为“组织”。
    • 另外,我试过这样的句子-'在 20 世纪,美国电动汽车的主要制造商是 Anthony Electric、Baker、Columbia、Anderson、Edison、Riker、Milburn、Bailey Electric 等. ' 并且我得到了 'Milburn' 的响应为 'PERSON' 而它应该是 'PLACE'。为什么这不被归类为适当的?
    • 对于“其次是美国,然后是中国。[214]”,问题似乎是“中国”之间没有空格。和下一个令牌。事实上,对于任何在一段时间后没有空间的东西,它都会将其与 PERSON 混淆。我会提交一个关于这个的错误。
    • 在第二句中,似乎很难判断这些名称是组织还是个人。所以,我对它犯了这个错误并不感到惊讶。
    猜你喜欢
    • 2021-04-05
    • 1970-01-01
    • 1970-01-01
    • 2014-04-12
    • 2021-08-24
    • 1970-01-01
    • 2021-01-19
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多