【问题标题】:Scalable solution for extracting semantic data from websites?从网站提取语义数据的可扩展解决方案?
【发布时间】:2017-01-11 13:14:19
【问题描述】:

假设我的磁盘上有(相当多)数量的网站,从例如普通爬行。我对 HTML 结构没有先验知识,假设每个页面的结构都不同(通常是这种情况)。我想从它们中的每一个中提取一些语义信息(预先知道),例如带有元数据(日期、作者、标签、cmets 等)的文章/帖子。

一个简单的方法是为每个网站编写一个简单的解析器,鉴于那里有高质量的解析库,它应该很容易。但这种方法显然无法扩展。这个问题有更聪明的解决方案吗?我将如何进行,这项任务的实际难度是什么?

如果存在类似的服务,您可以包括付费服务。如果您知道获取此类数据的任何更好方法(关于特定主题;而不是手动抓取/通用抓取),请也包括在内。

【问题讨论】:

标签: web-scraping nlp html-parsing semantic-web


【解决方案1】:

试试这个?

https://www.w3.org/2002/08/extract-semantic

此工具由 XSLT 样式表驱动,尝试从 HTML 语义丰富的文档中提取一些信息。它仅使用通过良好使用 HTML4 或 XHTML 1 中定义的语义获得的信息。此工具不考虑 HTML5 添加的新语义,特别是不识别微数据、微格式或 RDFa。

【讨论】:

  • 它已从网络上退役。不再可用
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-12-20
  • 1970-01-01
  • 1970-01-01
  • 2017-04-27
  • 2016-06-04
相关资源
最近更新 更多