【发布时间】:2018-01-14 09:45:25
【问题描述】:
我正在写一个 Kafka 制作人
它必须从本地 Linux 文件夹中读取数据并写入我的主题
有可能做这样的事情吗?
我的代码 sn-p 在这里(在 Scala 中)是什么
商业案例 -
实时数据将在此处以 CSV 文件的形式写入本地 Linux 文件夹 - /data/data01/pharma/2017/
如何将这些数据移动到我创建的主题中?
我的消费者将读取这些数据并添加到 Spark 流数据帧中进行处理
【问题讨论】:
-
Spark Streaming 可以查看本地文件目录。无论你想用它做什么都取决于 Spark API 的限制......所以是的,有一个 Kafka 生产者 api
-
好的。感谢您的评论/回复。但我在这里的要求是 - 实时处理..所以数据将被写入本地 linux 文件夹。所以 kafka 生产者将读取相同的内容,而 kafka 消费者(使用 spark 将处理相同)我不能在生产者中有 spark(可以我);关于如何满足这个要求的任何建议(或者我错过了一些非常基本的东西)..我是新手。
-
Spark 绝对可以是生产者和消费者...
标签: scala apache-spark apache-kafka real-time kafka-producer-api