【发布时间】:2020-08-04 15:33:07
【问题描述】:
我在 HDFS 中有一个大小为 10TB 的平面文件。我需要将数据写入 Kafka,然后保存到 Amazon S3。我正在为这项任务寻找不同的方法。根据之前提出的问题,我了解到可以由 Nifi 或 Spark 完成。但是,我不清楚它是如何实现的。
【问题讨论】:
-
不太清楚你想做什么......你想使用nifi从HDFS获取10TB文件,然后将数据写入Kafka?或者您已经在 Kafka 中拥有数据,并且您想使用 NiFi 读取数据并将其批处理并将大文件写入 HDFS/S3?
-
我更新了问题。你现在可以检查一下吗?
-
NiFi 有处理器 PublishKafka 和 ConsumeKafka,它有一个用于写入 S3 的处理器,称为 PutS3Object
标签: apache-spark amazon-s3 apache-kafka apache-nifi large-files