【问题标题】:How to setup storm crawler with Postgres?如何使用 Postgres 设置风暴爬虫?
【发布时间】:2017-05-08 18:04:20
【问题描述】:

我正在尝试使用 postgres sql 数据库作为后端来设置 Stormcrawler。但是没有关于需要存在哪些表才能启动风暴爬虫的文档。

我需要哪些表以及它们有哪些列?或者有什么方法可以自动创建所需的表? 另外如何在这种模式下启动爬虫?因为我无法像示例爬虫拓扑那样发送种子 URL。

【问题讨论】:

    标签: postgresql web-crawler stormcrawler


    【解决方案1】:

    tableCreationScript。对于 URL 的注入,您可以使用插入将它们自己添加到表中,如 tutorial 所示,或者重用来自 elasticsearch 模块的注入拓扑并指定来自 mysql 模块的 statusupdaterbolt。另一种方法是简单地将 MemorySpout 添加到 SQLSpout 旁边的拓扑中。

    【讨论】:

    • 谢谢你的回答,也许你可以在 sql 自述页面上链接到本教程?
    • 我注意到另一个问题,由于使用了查询语法,您似乎只支持 mysql。设置名称相当清楚。但您最好也将其添加到文档中。
    • 如果有更通用的方法,我们将非常欢迎您的贡献!
    • 我猜你将不得不添加一个抽象出使用的数据库的依赖项,比如hibernate,我是一个有scala背景的初级工程师,所以我真的不知道好的java sql框架。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-01-17
    • 1970-01-01
    • 1970-01-01
    • 2018-06-07
    • 2015-07-12
    相关资源
    最近更新 更多