【问题标题】:Nutch: Data read and adding metadataNutch:数据读取和添加元数据
【发布时间】:2012-05-27 06:09:09
【问题描述】:

我最近开始寻找 apache nutch。我可以进行设置并能够使用 nutch 抓取我感兴趣的网页。我不太了解如何读取这些数据。我基本上想将每个页面的数据与一些元数据(现在是一些随机数据)相关联并将它们存储在本地,稍后将用于搜索(语义)。我需要同样使用 solr 或 lucene 吗?我对所有这些都是新手。据我所知,Nutch 是用来抓取网页的。它可以做一些额外的功能,比如将元数据添加到爬取的数据中吗?

【问题讨论】:

  • 嗨 CRS,由于您使用“语义网”标记了您的问题,我假设您想从要抓取的页面中提取一些结构化数据(微格式、RDFa 和/或微数据)。如果是这种情况,那么查看 Any23 (incubator.apache.org/any23) 将节省大量时间(它可能与 Nutch 集成,并且可能有人已经在尝试这样做或已经这样做了)。
  • 感谢您的回复。我会看看Any23。我实际上是在抓取“普通”网页。它不与任何元数据相关联。我们有一些算法可以从这些网页的文本中计算元数据。此元数据应添加到网页的本地副本中。所以我正在寻找一个爬虫,它可以抓取网页并提取内容,然后将元数据插入到网页的本地副本中。

标签: solr lucene web-crawler semantic-web nutch


【解决方案1】:

有用的命令。

开始抓取

bin/nutch crawl urls -dir crawl -depth 3 -topN 5

获取已抓取网址的统计信息

bin/nutch readdb crawl/crawldb -stats

读取段(从网页中获取所有数据)

bin/nutch readseg -dump crawl/segments/* segmentAllContent

读取段(仅获取文本字段)

bin/nutch readseg -dump crawl/segments/* segmentTextContent -nocontent -nofetch -nogenerate -     noparse -noparsedata

获取每个 URL 的所有已知链接列表,包括链接的源 URL 和锚文本。

bin/nutch readlinkdb crawl/linkdb/ -dump linkContent

获取所有已抓取的 URL。还提供其他信息,例如是否已获取、获取时间、修改时间等。

bin/nutch readdb crawl/crawldb/ -dump crawlContent

第二部分。即添加新字段,我打算使用 index-extra 插件或编写自定义插件。

参考:

thisthis

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-07-31
    • 1970-01-01
    • 2022-11-21
    • 1970-01-01
    • 2018-09-02
    • 2020-04-09
    • 1970-01-01
    相关资源
    最近更新 更多