【发布时间】:2011-02-22 09:42:49
【问题描述】:
我有一个数据集,在底层文本上具有多层注释,例如part-of-tags、chunks from a shallow parser、name entities,以及来自各种natural language processing (NLP) 工具的其他数据集。对于像The man went to the store 这样的句子,注释可能如下所示:
我想使用 Lucene 为一堆带有此类注释的文档编制索引,然后跨不同层执行搜索。一个简单查询的示例是检索所有将 Washington 标记为 person 的文档。虽然我并不绝对使用这种表示法,但从语法上讲,最终用户可能会按如下方式输入查询:
查询:Word=Washington,NER=Person
我还想做更复杂的查询,涉及跨不同层的注释顺序,例如查找所有带有 person 字样、后跟 arrived at 字样以及带有 location 字样的字词的文档。这样的查询可能如下所示:
查询:"NER=Person Word=arrived Word=at NER=Location"
用 Lucene 解决这个问题的好方法是什么?是否有索引和搜索包含结构化标记的文档字段?
有效载荷
一个建议是尝试使用 Lucene payloads。但是,我认为有效载荷只能用于调整文档的排名,而不是用于选择返回的文档。
后者很重要,因为对于某些用例,包含模式的文档数量正是我想要的。
此外,仅检查与查询匹配的术语的有效负载。这意味着 payloads 甚至只能帮助第一个示例查询的排名,Word=Washington,NER=Person,因此我们只想确保术语 Washingonton 被标记为Person。但是,对于第二个示例查询"NER=Person Word=arrived Word=at NER=Location",我需要检查未指定且因此不匹配的术语上的标签。
【问题讨论】:
-
您找到满意的解决方案了吗?
标签: java lucene nlp data-mining text-mining