【问题标题】:Twitter data harvesting推特数据收集
【发布时间】:2018-08-19 03:41:21
【问题描述】:

对于我的项目,我需要从 Twitter 收集数据。

我目前面临两种设计选择:

  1. 什么是最好的软件架构?我读到 spark 支持 Twitter,但我不熟悉 Scala。另一方面,Apache Spark 似乎是一个不错的选择,但我不确定如何将数据保存到公共接收器
  2. 我有一些预算限制。我肯定需要一台服务器来完成接收和处理。但是,对于数据收集,我不知道是否有几个 VM/容器比运行 Kafka 生产者的一堆 Raspberry PI 提供更好的性能/成本比。

【问题讨论】:

    标签: apache-spark twitter raspberry-pi apache-kafka


    【解决方案1】:

    看看 Confluent 平台,尤其是 Kafka Connect [1]。

    有一个开箱即用的 Twitter 连接器。所有 twitter 数据都将流式传输到 Kafka。

    [1]https://www.confluent.io/blog/using-ksql-to-analyse-query-and-transform-data-in-kafka

    【讨论】:

    • Twitter 连接器不是开箱即用的。需要单独编译
    • 正如 cricket_007 所说,Twitter 连接器必须是 downloaded separately。你可以在this article看到它的使用细节。
    【解决方案2】:

    同意@leshkin 的观点,Kafka Connect 是最合适的。但是,Twitter 连接器 (available on github here) 不需要 Confluent Platform,只需 Kafka Connect,它是 Apache Kafka 发行版的标准部分。 https://kafka.apache.org/documentation/#connect

    如果您选择,您可以在分布式模式下运行 Kafka 连接工作程序,以将负载分配到多个虚拟机/容器/盒子中,这些盒子不必与您运行 kafka 代理的盒子相同(它们只需要一些相关的库当然来自 kafka 和连接器和 Java 的库)

    【讨论】:

    • 谢谢!这很有趣。我知道生产者将是 I/O(净)密集型的,因此很容易容器化。
    猜你喜欢
    • 1970-01-01
    • 2012-03-15
    • 1970-01-01
    • 2011-03-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多