【发布时间】:2020-03-07 02:35:29
【问题描述】:
我想做一个项目,我在 Hive 中流式传输一些推文以分析它们,所有这些过程都必须在 HDF/NiFi 中完成。项目必须是可扩展的。 我在 Cloudera 网站上看到人们采用了两种不同的流量策略。
1.) 获取推文 ---> 将它们放入 HDFS ---> 使用 Hive 进行分析
2.) 获取推文 ---> 使用 Kafka 流式传输(发布/消费者) ---> 将它们放入 HDFS ---> 使用 Hive 分析
所以,我的问题是有什么区别?第一个策略不可扩展? 你会遵循哪种策略? 谢谢。
【问题讨论】:
标签: hadoop apache-kafka streaming apache-nifi tweets