【问题标题】:Streaming tweets with kafka and without it to analyze in Hive使用 kafka 流式传输推文,不使用它在 Hive 中进行分析
【发布时间】:2020-03-07 02:35:29
【问题描述】:

我想做一个项目,我在 Hive 中流式传输一些推文以分析它们,所有这些过程都必须在 HDF/NiFi 中完成。项目必须是可扩展的。 我在 Cloudera 网站上看到人们采用了两种不同的流量策略。

1.) 获取推文 ---> 将它们放入 HDFS ---> 使用 Hive 进行分析

2.) 获取推文 ---> 使用 Kafka 流式传输(发布/消费者) ---> 将它们放入 HDFS ---> 使用 Hive 分析

所以,我的问题是有什么区别?第一个策略不可扩展? 你会遵循哪种策略? 谢谢。

【问题讨论】:

    标签: hadoop apache-kafka streaming apache-nifi tweets


    【解决方案1】:

    这完全取决于您的维护负担。

    Hadoop、YARN、Kafka 和 Nifi 都是需要大量调优和配置的独立服务。除了 Twitter 摄取之外的每个组件都是可独立扩展的。

    您可以将 Kafka 用作 HDFS 前的一种缓冲区,用于在登陆任何文件系统之前对推文进行批处理和处理。此外,您可以稍后将推文流式传输到 Elasticsearch 或 Solr 中进行搜索,而不是在 Hadoop 中进行批量分析

    对于更快的查询,使用 Presto、Kudu、Spark 或 Impala 而不是 Hive

    【讨论】:

      猜你喜欢
      • 2019-07-27
      • 2018-10-06
      • 1970-01-01
      • 2016-11-22
      • 1970-01-01
      • 2018-03-19
      • 1970-01-01
      • 2019-05-13
      • 2016-10-03
      相关资源
      最近更新 更多