【发布时间】:2017-12-04 04:14:41
【问题描述】:
我正在使用strom-crawler-elastic。我可以看到这些获取的 url 和状态。 ES_IndexInit.sh 文件中的配置更改仅提供 url、标题、主机、文本。但是我可以用 html 标签存储整个 html 内容吗?
【问题讨论】:
标签: web-crawler elasticsearch-5 stormcrawler
我正在使用strom-crawler-elastic。我可以看到这些获取的 url 和状态。 ES_IndexInit.sh 文件中的配置更改仅提供 url、标题、主机、文本。但是我可以用 html 标签存储整个 html 内容吗?
【问题讨论】:
标签: web-crawler elasticsearch-5 stormcrawler
ES IndexerBolt 从 ParseFilter 获取页面内容,但不对其进行任何操作。一种选择是修改代码,使其从传入的元组中提取 content 字段并为其编制索引。
或者,您可以实现自定义 ParseFilter,它将页面内容复制到元数据键值中,并配置该字段以通过配置文件中的 indexer.md.mapping 进行索引。
无论哪种方式,您都需要修改 ES_indexInit.sh 以便 ES 中的字段被索引和/或以您想要的方式存储。
.
【讨论】:
parsefilters.json 和ES_IndexInit.sh 吗?您能否突出显示所需的更改。谢谢