【发布时间】:2012-05-27 06:09:09
【问题描述】:
我最近开始寻找 apache nutch。我可以进行设置并能够使用 nutch 抓取我感兴趣的网页。我不太了解如何读取这些数据。我基本上想将每个页面的数据与一些元数据(现在是一些随机数据)相关联并将它们存储在本地,稍后将用于搜索(语义)。我需要同样使用 solr 或 lucene 吗?我对所有这些都是新手。据我所知,Nutch 是用来抓取网页的。它可以做一些额外的功能,比如将元数据添加到爬取的数据中吗?
【问题讨论】:
-
嗨 CRS,由于您使用“语义网”标记了您的问题,我假设您想从要抓取的页面中提取一些结构化数据(微格式、RDFa 和/或微数据)。如果是这种情况,那么查看 Any23 (incubator.apache.org/any23) 将节省大量时间(它可能与 Nutch 集成,并且可能有人已经在尝试这样做或已经这样做了)。
-
感谢您的回复。我会看看Any23。我实际上是在抓取“普通”网页。它不与任何元数据相关联。我们有一些算法可以从这些网页的文本中计算元数据。此元数据应添加到网页的本地副本中。所以我正在寻找一个爬虫,它可以抓取网页并提取内容,然后将元数据插入到网页的本地副本中。
标签: solr lucene web-crawler semantic-web nutch