【问题标题】:Can i store html content of webpage in storm crawler?我可以在风暴爬虫中存储网页的 html 内容吗?
【发布时间】:2017-12-04 04:14:41
【问题描述】:

我正在使用strom-crawler-elastic。我可以看到这些获取的 url 和状态。 ES_IndexInit.sh 文件中的配置更改仅提供 url、标题、主机、文本。但是我可以用 html 标签存储整个 html 内容吗?

【问题讨论】:

    标签: web-crawler elasticsearch-5 stormcrawler


    【解决方案1】:

    ES IndexerBolt 从 ParseFilter 获取页面内容,但不对其进行任何操作。一种选择是修改代码,使其从传入的元组中提取 content 字段并为其编制索引。

    或者,您可以实现自定义 ParseFilter,它将页面内容复制到元数据键值中,并配置该字段以通过配置文件中的 indexer.md.mapping 进行索引。

    无论哪种方式,您都需要修改 ES_indexInit.sh 以便 ES 中的字段被索引和/或以您想要的方式存储。

    .

    【讨论】:

    • 我们如何在stormcrawler v1.15中实现这一点(在ES中存储html)?我们只需要修改parsefilters.jsonES_IndexInit.sh 吗?您能否突出显示所需的更改。谢谢
    猜你喜欢
    • 1970-01-01
    • 2017-05-04
    • 2011-03-03
    • 1970-01-01
    • 2018-01-26
    • 2021-01-17
    • 1970-01-01
    • 2013-10-28
    • 1970-01-01
    相关资源
    最近更新 更多