【发布时间】:2014-12-17 11:41:59
【问题描述】:
我有一个从 csv 文件查询数据的 pig 脚本。
该脚本已在本地使用大小 .csv 文件进行了测试。
在小型集群中: 它从处理脚本开始,在完成 40% 的调用后失败
错误只是,
Failed to read data from "path to file"
我的推断是,脚本可以读取文件,但是有一些连接断开,一条消息丢失
但我只收到上述错误。
【问题讨论】:
-
如果任何答案解决了您的问题,请单击大复选框接受它作为答案。
-
不幸的是它没有:/
-
您能否提供更多信息,例如日志或异常?
-
export HADOOP_CLIENT_OPTS="-Xmx128m ${HADOOP_CLIENT_OPTS}" 将为容器中的每个任务(map 或 reduce)分配 128 MB(Yran 默认为 200),但堆大小默认为 1 GB可以通过设置环境变量 YARN_HEAPSIZE = Memory in MBs 来更改
标签: java csv hadoop apache-pig