【发布时间】:2015-09-24 09:44:04
【问题描述】:
我是 Nutch 的新手并且会爬行。我已经安装了 Nutch 2.0,通过遵循一些基本教程,使用 Solr 4.5 对数据进行了爬网和索引。现在我不想解析页面的所有文本内容,我想自定义它,就像 Nutch 应该抓取页面并只抓取/获取与地址相关的数据,因为我的用例是抓取 URL 并只解析地址信息作为文本。
例如,我只需要抓取和解析包含地址信息、电子邮件 ID、电话号码和传真号码的文本内容。
- 我应该怎么做?是否有任何插件可用于此?
- 如果我想为此编写一个自定义解析器,有人可以在这方面帮助我吗?
【问题讨论】:
标签: java parsing solr web-crawler nutch