【发布时间】:2018-10-24 14:26:01
【问题描述】:
我正在寻找从 Kafka 读取消息(大量消息,每天大约 100B)的最佳方式,在读取消息后我需要对数据进行操作并将其写入 HDFS。
- 如果我需要以最佳性能做到这一点,我从 Kafka 读取消息并将文件写入 HDFS 的最佳方式是什么?
- 哪种编程语言最适合这种情况?
- 我是否需要考虑为此使用 Spark 等解决方案?
【问题讨论】:
标签: apache-spark hadoop apache-kafka
我正在寻找从 Kafka 读取消息(大量消息,每天大约 100B)的最佳方式,在读取消息后我需要对数据进行操作并将其写入 HDFS。
【问题讨论】:
标签: apache-spark hadoop apache-kafka
您可以使用 Spark、Flink、NiFi、Streamsets……但 Confluent 提供了 Kafka Connect HDFS 正是为此目的。
Kafka Connect API 在转换方面有些限制,因此大多数人所做的就是编写一个 Kafka Streams 作业来过滤/增强辅助主题的数据,然后将其写入 HDFS
注意:这些选项会将许多文件写入 HDFS(通常,每个 Kafka 主题分区一个)
哪种编程语言最适合?
以上每个都使用Java。但如果使用 NiFi、Streamsets 或 Kafka Connect,则无需自己编写任何代码
【讨论】: