【问题标题】:Can S3DistCp combine .snappy.paruqet files?S3DistCp 可以合并 .snappy.paruqet 文件吗?
【发布时间】:2017-11-03 08:19:33
【问题描述】:

S3DistCp 能否将 Spark 应用程序存储为 .snappy.parquet 输出的多个文件合并到一个文件中,并让 Hive 读取生成的文件?

【问题讨论】:

    标签: apache-spark hive emr


    【解决方案1】:

    我还尝试将较小的 snappy parquet 文件合并到较大的 snappy parquet 文件中。 用过的 aws emr add-steps --cluster-id {clusterID} --steps file://filename.json 和 aws emr 等待 step-complete --cluster-id {clusterID} --step-id {stepID}

    命令运行正常,但是当我尝试使用 parquet-tools 读取合并文件时,读取失败并出现 java.io.EOFException。

    联系了 AWS 支持团队。他们说他们在 parquet 文件上使用 s3distcp 时遇到了一个已知问题,他们正在努力修复,但没有修复的 ETA。

    【讨论】:

    • 有什么更新吗?这有用吗? aws 支持团队有没有回复您?
    猜你喜欢
    • 1970-01-01
    • 2015-05-25
    • 1970-01-01
    • 2012-03-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-03-28
    • 1970-01-01
    相关资源
    最近更新 更多