【发布时间】:2017-11-03 08:19:33
【问题描述】:
S3DistCp 能否将 Spark 应用程序存储为 .snappy.parquet 输出的多个文件合并到一个文件中,并让 Hive 读取生成的文件?
【问题讨论】:
标签: apache-spark hive emr
S3DistCp 能否将 Spark 应用程序存储为 .snappy.parquet 输出的多个文件合并到一个文件中,并让 Hive 读取生成的文件?
【问题讨论】:
标签: apache-spark hive emr
我还尝试将较小的 snappy parquet 文件合并到较大的 snappy parquet 文件中。 用过的 aws emr add-steps --cluster-id {clusterID} --steps file://filename.json 和 aws emr 等待 step-complete --cluster-id {clusterID} --step-id {stepID}
命令运行正常,但是当我尝试使用 parquet-tools 读取合并文件时,读取失败并出现 java.io.EOFException。
联系了 AWS 支持团队。他们说他们在 parquet 文件上使用 s3distcp 时遇到了一个已知问题,他们正在努力修复,但没有修复的 ETA。
【讨论】: