【问题标题】:Nutch 2.x: Passing information from one WebPage to another for indexing with elasticsearchNutch 2.x:将信息从一个网页传递到另一个网页以使用弹性搜索进行索引
【发布时间】:2018-06-06 23:40:26
【问题描述】:

我正在使用 Nutch 2.x 来抓取一个域,其中每个 html 页面都有一个指向 pdf 文档的链接。

  1. 对于每个 html 页面,我使用插件来提取信息并将其添加到元数据中。
  2. 对于每个 pdf 文档,tika 解析器都会提取文本。

我想做的是将html页面中提取的数据和相应pdf文档的文本结合起来,并用elasticsearch对其进行索引。

我想在解析或索引 pdf 时通过访问相应 html 页面的网页来执行此操作,但我找不到执行此操作的方法。

这可行吗?如果不是,我将不胜感激任何建议。

谢谢!

【问题讨论】:

    标签: elasticsearch nutch


    【解决方案1】:

    我在使用 Nutch 1.x(但使用图像)时遇到了类似的问题,我的方法基本上是编写一个自定义的 ScoringFilter,它从 HTMl 获取信息并将其分发到外链的 CrawlDatum (就我而言,仅用于指向图像的外链)。

    在 Nutch 2.x 中有些不同,但我认为可以在 ScoringFilterdistributeScoreToOutlinks 方法中完成类似的操作。在这种情况下,您无权访问外链的 WebPage 对象,但您可以访问 ScoreDatum 对象。

    【讨论】:

    • 感谢您为我指明正确的方向。我曾想过使用外链作为最后一个选项,但事实证明这是可行的方法:) 对于面临同样问题的任何人,您需要构建一个自定义评分插件:1) 在 ScoringFilter 的distributeScoreToOutlinks 方法中,您可以访问网页,您可以将其元数据复制到每个外链的 ScoreDatum 的 Meta。 2) 在 updateScore 方法中,您可以访问每个内链的 ScoreDatum。您可以简单地检查 Meta 以找到您之前存储数据的位置并将其复制到网页的 Metadata 中。
    猜你喜欢
    • 1970-01-01
    • 2016-08-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-18
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多