【问题标题】:Fast HDFS and Hive data replication快速 HDFS 和 Hive 数据复制
【发布时间】:2018-03-29 09:23:01
【问题描述】:

我正在考虑 2 个用例的集群之间的数据复制:

  1. DR(因此在 2 个数据中心之间进行复制
  2. 在 2 个生产集群之间同步

对于第一个,我倾向于认为 Falcon 是正确的选择。但是对于第二个,我想将数据复制为可用的 sson(意味着 HDFS 的 put 结束,Hive 的表创建结束)。您对此有何看法?

【问题讨论】:

  • 我的观点是 Hadoop 不是一个实时系统。如果您需要立即读取两个独立系统之间的每次写入,则需要一个高度一致的数据库。 Hive 和 HDFS 都是数据库
  • 猜我的要求不清楚。它基本上是在 2 个集群之间替换数据,而不是从系统立即读取/写入。它真的是 Hadoop 到 Hadoop。例如。作业在集群 1 上结束,然后立即在集群 2 上复制...
  • 使用 Oozie 来安排作业,然后是 distcp 操作。根据数据大小,它不会“快”
  • 所以基本上是程序化的,使用 distcp 用于 hdfs 和 sqoop 用于 hive...

标签: hadoop hive hdfs replication


【解决方案1】:

刚刚发现 ReAir https://github.com/airbnb/reair

似乎是一个很好的工具。 :)

【讨论】:

    猜你喜欢
    • 2019-07-12
    • 2014-06-15
    • 1970-01-01
    • 1970-01-01
    • 2013-11-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多