【发布时间】:2014-12-13 10:25:38
【问题描述】:
我正在使用 Sqoop 将数据从 Oracle 导入 Hadoop。在 Oracle 表中,我有大约 200 万条记录,主键是我作为拆分字段提供的。
我的 sqoop 作业即将完成,我正在获取正确的数据,并且作业运行了 30 分钟,到目前为止一切正常。
当我检查输出文件时,我看到第一个文件约为 1.4 GB,第二个文件约为 157.2 MB,最后一个文件(第 20 个文件)约为 10.4 MB,而从第 3 到第 19 的所有其他文件都是 0 字节。
我设置 -m 20 是因为我想为我的工作运行 20 个映射器。
这里是 sqoop 命令:
sqoop import --connect "CONNECTION_STRING" --query "SELECT * FROM WHERE AND \$CONDITIONS" --split-by .ID --target-dir /output_data -m 20
注意:我的集群能够处理 20 个映射器,而数据库也能够一次处理 20 个请求。
有什么想法吗?
- 达摩
【问题讨论】:
标签: sqoop