【问题标题】:Best way to automatate getting data from Csv files to Datalake将数据从 Csv 文件自动获取到 Data Lake 的最佳方法
【发布时间】:2017-09-12 15:17:49
【问题描述】:

我需要从 csv 文件(每天从不同的业务数据库中提取)获取数据到 HDFS,然后将其移动到 Hbase 并最终将这些数据汇总到数据集市 (sqlServer)。

我想知道自动化这个过程的最佳方法(使用 java 或 hadoops 工具)

【问题讨论】:

    标签: hadoop hbase hdfs datamart bigdata


    【解决方案1】:

    我会回应上面的评论。 Kafka Connect,它是 Apache Kafka 的一部分。有了这个,您只需使用配置文件从您的源流,您可以使用 KSQL 创建派生/丰富/聚合流,然后将它们流式传输到 HDFS/Elastic/HBase/JDBC/etc 等等

    有一个 Kafka Connect 连接器列表here

    这个博客系列介绍了基础知识:

    【讨论】:

    • 谢谢罗宾,我开始阅读有关 kafka 连接器的信息,它似乎更容易且更便宜。我会 poc 这部分,看看会发生什么。再次感谢和不错的博客顺便说一句;)
    【解决方案2】:

    几乎不需要编码?排名不分先后

    • Talend 开放工作室
    • 流集数据收集器
    • Apache Nifi

    假设你可以设置一个 Kafka 集群,你可以试试 Kafka Connect

    如果你想编程,可能是 Spark。否则,请选择您最喜欢的语言。通过 Oozie 安排作业

    如果不需要原始 HDFS 数据,可以直接加载到 HBase 中

    【讨论】:

    • 谢谢@cricket_007 的答案。你能告诉我“为什么你不能直接登陆 hbase”是什么意思?
    • 编写一些代码来解析 CSV 并写入 Hbase 表。由于hbase已经是over hdfs数据了,我看没必要先放到hdfs中,然后再加载到hbase中
    • 我明白,实际上,会有其他应用程序需要相同的数据,他们想直接从 hdfs 中提取数据。只有我的需要一个 hbase。
    猜你喜欢
    • 1970-01-01
    • 2012-02-07
    • 2021-06-12
    • 1970-01-01
    • 1970-01-01
    • 2019-04-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多