【发布时间】:2015-08-25 22:35:00
【问题描述】:
我正在考虑使用大数据构建一些东西。理想情况下,我想做的是:
取一个 .csv 文件放入 flume,然后放入 kafka,执行 n ETL 并放回 Kafka,从 kafka 放入 flume,然后放入 hdfs。一旦信息在 hdfs 中,我想执行 map reduce 工作或一些 hive 查询,然后绘制任何我想要的图表。
如何将 .csv 文件放入 Flume 并将其保存到 kafka?我有这段代码,但我不确定它是否有效:
myagent.sources = r1
myagent.sinks = k1
myagent.channels = c1
myagent.sources.r1.type = spooldir
myagent.sources.r1.spoolDir = /home/xyz/source
myagent.sources.r1.fileHeader = true
myagent.sinks.k1.type = org.apache.flume.sink.kafka.KafkaSink
vmagent.channels.c1.type = memory
myagent.channels.c1.capacity = 1000
myagent.channels.c1.transactionCapacity = 100
myagent.sources.r1.channels = c1
myagent.sinks.k1.channel = c1
有什么帮助或建议吗?如果这段代码是正确的,如何继续?
谢谢大家!!
【问题讨论】:
标签: apache-kafka flume