【发布时间】:2011-05-25 09:13:15
【问题描述】:
我的问题是,给定 document d1 on the web and a document d2 我如何判断 d1 和 d2 在语义上相关。是否有一些 API 可以进行一定数量的自然语言处理,这可能会给我一个提示,即 d1 可能与 d2 相关联。
我急需它。请帮助!
【问题讨论】:
标签: semantic-web semantic-markup semantic-analysis
我的问题是,给定 document d1 on the web and a document d2 我如何判断 d1 和 d2 在语义上相关。是否有一些 API 可以进行一定数量的自然语言处理,这可能会给我一个提示,即 d1 可能与 d2 相关联。
我急需它。请帮助!
【问题讨论】:
标签: semantic-web semantic-markup semantic-analysis
您可以使用特殊的微格式。更多信息请访问http://microformats.org/
简单示例:
<a href="http://creativecommons.org/licenses/by/2.0/" rel="license">cc by 2.0</a>
Rel-License 是多种微格式之一。通过将 rel="license" 添加到超链接,页面指示该超链接的目标是当前页面的许可证。
【讨论】:
对于语义相关的文档,您可以使用 SKOS 等特殊词汇表并将它们关联到一个本体中。或者,您可以直接在文档中使用(如 silex 所述)微格式。
对于自然语言处理,存在可以提取信息的不同工具,例如 GATE。但这不是一项简单的任务。
也许你可以细化你想做的事?您要定义哪些文档是相关的吗?或者您是否想要一个软件来找出可能相关的文档?
【讨论】:
您需要研究“named entity extraction”,即自然语言处理以提取两个文档共有的可能实体。这些通常是人、地点、事件、时间、组织。
查看 OpenCalais http://www.opencalais.com/,了解此类技术的一些实际应用。
【讨论】: