【发布时间】:2017-01-11 13:14:19
【问题描述】:
假设我的磁盘上有(相当多)数量的网站,从例如普通爬行。我对 HTML 结构没有先验知识,假设每个页面的结构都不同(通常是这种情况)。我想从它们中的每一个中提取一些语义信息(预先知道),例如带有元数据(日期、作者、标签、cmets 等)的文章/帖子。
一个简单的方法是为每个网站编写一个简单的解析器,鉴于那里有高质量的解析库,它应该很容易。但这种方法显然无法扩展。这个问题有更聪明的解决方案吗?我将如何进行,这项任务的实际难度是什么?
如果存在类似的服务,您可以包括付费服务。如果您知道获取此类数据的任何更好方法(关于特定主题;而不是手动抓取/通用抓取),请也包括在内。
【问题讨论】:
-
This question is not suited to SO。也就是说,my employer 产生了一个你可能想尝试的工具——Virtuoso Sponger——你可以在URIBurner 看到它的实际应用。
-
github.com/ldspider/ldspider 有 RDFa 提取器
标签: web-scraping nlp html-parsing semantic-web