【发布时间】:2011-01-23 02:38:22
【问题描述】:
我有大量基于文本的文档(超过 100,000 个),我想从中提取专有名称(例如人名)。
谁能推荐对实现这一目标有用的技术和/或软件。我对低级文本解析不是特别感兴趣,但我对识别和/或排名等更高级的事情却很感兴趣。
【问题讨论】:
标签: parsing nlp information-retrieval
我有大量基于文本的文档(超过 100,000 个),我想从中提取专有名称(例如人名)。
谁能推荐对实现这一目标有用的技术和/或软件。我对低级文本解析不是特别感兴趣,但我对识别和/或排名等更高级的事情却很感兴趣。
【问题讨论】:
标签: parsing nlp information-retrieval
如果没有某种形式的Natural Language Processing,这样的事情就无法可靠地完成。几个常见问题:
也是常用词的名称:John Black
同一个词有多种语言和多种形式。
指代不同事物的名称。 Lily 可以是一个人、一个地方、一只猫或只是一朵花的名字。
NLP 可以使用周围的语法结构来区分其中一些情况。
也就是说,您可以尝试的一种简单(且幼稚)的技术是使用单词的大写。如果您在句子中间看到一个大写的首字母,它通常是某种名称。
您可以合理地假设任何这样的词指的是同一文档中的同一事物。一个序列中的两个这样的词可能是一个名字/姓氏组合等。
如果文档中的大小写不可信,您可以信任正确的单词表,而不是为了获得适用语言的正确名称列表。
【讨论】:
最好的办法可能是将每个单词与专有名词词典进行比较。
【讨论】:
如果您列出所有唯一单词,然后删除字典中的所有单词会怎样?
【讨论】: