【发布时间】:2018-03-29 09:23:01
【问题描述】:
我正在考虑 2 个用例的集群之间的数据复制:
- DR(因此在 2 个数据中心之间进行复制
- 在 2 个生产集群之间同步
对于第一个,我倾向于认为 Falcon 是正确的选择。但是对于第二个,我想将数据复制为可用的 sson(意味着 HDFS 的 put 结束,Hive 的表创建结束)。您对此有何看法?
【问题讨论】:
-
我的观点是 Hadoop 不是一个实时系统。如果您需要立即读取两个独立系统之间的每次写入,则需要一个高度一致的数据库。 Hive 和 HDFS 都是数据库
-
猜我的要求不清楚。它基本上是在 2 个集群之间替换数据,而不是从系统立即读取/写入。它真的是 Hadoop 到 Hadoop。例如。作业在集群 1 上结束,然后立即在集群 2 上复制...
-
使用 Oozie 来安排作业,然后是 distcp 操作。根据数据大小,它不会“快”
-
所以基本上是程序化的,使用 distcp 用于 hdfs 和 sqoop 用于 hive...
标签: hadoop hive hdfs replication