【问题标题】:Kafka producer to read from a local Linux folderKafka 生产者从本地 Linux 文件夹中读取
【发布时间】:2018-01-14 09:45:25
【问题描述】:

我正在写一个 Kafka 制作人
它必须从本地 Linux 文件夹中读取数据并写入我的主题
有可能做这样的事情吗?

我的代码 sn-p 在这里(在 Scala 中)是什么

商业案例 -

实时数据将在此处以 CSV 文件的形式写入本地 Linux 文件夹 - /data/data01/pharma/2017/

如何将这些数据移动到我创建的主题中?

我的消费者将读取这些数据并添加到 Spark 流数据帧中进行处理

【问题讨论】:

  • Spark Streaming 可以查看本地文件目录。无论你想用它做什么都取决于 Spark API 的限制......所以是的,有一个 Kafka 生产者 api
  • 好的。感谢您的评论/回复。但我在这里的要求是 - 实时处理..所以数据将被写入本地 linux 文件夹。所以 kafka 生产者将读取相同的内容,而 kafka 消费者(使用 spark 将处理相同)我不能在生产者中有 spark(可以我);关于如何满足这个要求的任何建议(或者我错过了一些非常基本的东西)..我是新手。
  • Spark 绝对可以是生产者和消费者...

标签: scala apache-spark apache-kafka real-time kafka-producer-api


【解决方案1】:

实时数据将写入本地linux文件夹

有很多框架可以让你处理这个

我所知道的 Kafka 连接

重点是,不要重新发明轮子,否则会冒着编写不必要的(并且可能是错误的)代码的风险。

【讨论】:

    【解决方案2】:

    如果你想读取单个文件,那么

    cat ${file} | bin/kafka-console-producer.sh --broker-list localhost:9092 --topic my_topic
    

    如果文件是动态创建的,那么你需要监控它们并将其提供给 kafka-console-producer.sh

    Kafka producer to read data files

    【讨论】:

    • 还有一个帮助先生,现在,我正在尝试自定义生产者以使用火花流从 kafka 主题中读取。任何想法如何做到这一点。
    • 使用结构化流,spark.apache.org/docs/latest/…
    猜你喜欢
    • 1970-01-01
    • 2016-05-24
    • 1970-01-01
    • 1970-01-01
    • 2017-10-17
    • 1970-01-01
    • 2023-03-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多