【发布时间】:2016-10-25 07:43:51
【问题描述】:
我使用 Sqoop 将数据从 Oracle 提取到 Hadoop,并且效果很好。在 Sqoop 上不使用分区的情况下,只需 4 分钟即可将 8600 万条记录从 Oracle 带到 Hive 表。谁能提供一些有关 Oracle Hadoop 连接器的详细信息,它的性能会比 Sqoop 更好吗?
【问题讨论】:
-
根据 Oracle 文档:Oracle Loader for Hadoop 是一个 MapReduce 程序,运行在 Hadoop 集群上,用于预处理数据。它可以对数据进行分区、排序和转换为 Oracle 数据类型,为加载做准备。这会将一些数据库周期卸载到 Hadoop 上,从而在加载过程中使用更少的数据库 CPU。在线模式下,将预处理后的数据直接加载到数据库中。在离线模式下,Oracle Loader for Hadoop 将预处理后的数据作为数据泵文件写入 HDFS。在线模式有两种加载方式,JDBC和直接路径。