【问题标题】:Crawling using Storm Crawler使用 Storm Crawler 爬行
【发布时间】:2016-12-28 09:29:16
【问题描述】:

我们正在尝试实施 Storm Crawler 来抓取数据。我们已经能够从 url 中找到子链接,但我们想从这些子链接中获取内容。我一直找不到很多资源来指导我如何获得它?在这方面任何有用的链接/网站都会有所帮助。谢谢。

【问题讨论】:

    标签: web-crawler apache-storm stormcrawler


    【解决方案1】:

    Getting Startedpresentations and talks,以及各种blog posts应该很有用。

    如果子链接被提取和解析 - 您可以在日志中检查,那么内容将可用于索引或存储,例如 WARC。有一个dummy indexer 将内容转储到控制台,可以作为起点,或者有资源用于在 Elasticsearch 或 SOLR 中索引文档。 WARC module 也可以用来存储页面的内容。

    【讨论】:

    • 嗨 Julien,按照指示,我已将 Warc 模块页面中提供的 sn-p 添加到我的 CrawlTopology.java 文件中,但是当我运行 mvn clean package 时,出现以下错误:找不到符号 符号:类 FileNameFormat 位置:类 crawler.CrawlTopology 以及许多其他类似的行。我是否必须向 pom.xml 添加一些依赖项
    • 嗨。您应该将 WARC 模块添加到依赖项 com.digitalpebble.stormcrawlerstorm-crawler-warc${storm-crawler.version} 也许暂时保持简单并使用虚拟索引器,它已经在核心模块中,不需要额外的依赖项。另外,使用原型生成的代码作为起点,这样可以省去很多麻烦。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-10-17
    • 1970-01-01
    • 2023-01-19
    • 2021-01-28
    • 1970-01-01
    相关资源
    最近更新 更多