【发布时间】:2018-06-06 23:40:26
【问题描述】:
我正在使用 Nutch 2.x 来抓取一个域,其中每个 html 页面都有一个指向 pdf 文档的链接。
- 对于每个 html 页面,我使用插件来提取信息并将其添加到元数据中。
- 对于每个 pdf 文档,tika 解析器都会提取文本。
我想做的是将html页面中提取的数据和相应pdf文档的文本结合起来,并用elasticsearch对其进行索引。
我想在解析或索引 pdf 时通过访问相应 html 页面的网页来执行此操作,但我找不到执行此操作的方法。
这可行吗?如果不是,我将不胜感激任何建议。
谢谢!
【问题讨论】:
标签: elasticsearch nutch