【发布时间】:2017-02-22 00:38:35
【问题描述】:
例外:
失败并出现异常 java.io.IOException:java.io.IOException: 不知何故 读取 -1 个字节试图跳过 6257 个字节以寻求定位 6708,尺寸:1290047
有人知道如何在云数据过程中修复它吗?
【问题讨论】:
标签: hadoop hive hadoop-partitioning google-cloud-dataproc orc
例外:
失败并出现异常 java.io.IOException:java.io.IOException: 不知何故 读取 -1 个字节试图跳过 6257 个字节以寻求定位 6708,尺寸:1290047
有人知道如何在云数据过程中修复它吗?
【问题讨论】:
标签: hadoop hive hadoop-partitioning google-cloud-dataproc orc
看起来您可能正在点击this known issue,这有点特定于读取 ORC 文件。 GCS 连接器版本 1.5.4 已修复,本周将在 Dataproc 中推出(预计将于 10 月 14 日星期五全面推出)。
与此同时,您可以使用一个小的初始化操作来自动更新数据处理集群上的连接器版本;创建一个名为update-gcs-1.5.4.sh的文件:
#!/bin/bash
rm -f /usr/lib/hadoop/lib/gcs-connector*.jar
gsutil cp gs://hadoop-lib/gcs/gcs-connector-1.5.4-hadoop2.jar /usr/lib/hadoop/lib/
然后将该文件上传到某处的 GCS:
gsutil cp update-gcs-1.5.4.sh gs://<YOUR_BUCKET_HERE>/update-gcs-1.5.4.sh
然后创建您的 Dataproc 集群:
gcloud dataproc clusters create \
--initialization-actions gs://<YOUR_BUCKET_HERE>/update-gcs-1.5.4.sh
【讨论】: