【发布时间】:2016-11-10 16:48:18
【问题描述】:
我正在尝试在 Hadoop 中进行 POC 以进行日志聚合。我们有多个 IIS 服务器托管至少 100 个站点。我想将日志连续流式传输到 HDFS 并解析数据并存储在 Hive 中以进行进一步分析。
1) 正确选择 Apache KAFKA 还是 Apache Flume
2) 在流式传输之后,最好使用 Apache Storm 并将数据摄取到 Hive
请提供任何建议以及此类问题陈述的任何信息。
谢谢
【问题讨论】:
标签: hadoop hive apache-kafka flume