【发布时间】:2017-10-05 08:37:26
【问题描述】:
我正在使用 spark sql 读取 S3 中以 ORC 格式的 2 个不同数据集。但是对于几乎相似大小的数据集,读取的性能差异是巨大的。
数据集 1:包含 212,000,000 条记录,每条记录有 50 列,在 s3 bucket 中以 orc 格式总计高达 15GB。
数据集 2:包含 29,000,000 条记录,每条记录有 150 列,在同一 s3 存储桶中以 orc 格式总计高达 15GB。
使用 spark sql 读取数据集 1 需要 2 分钟。并且它需要 12 分钟 在相同的基础设施中使用相同的 spark 读取/计数作业读取数据集 2。
每行的长度可能会导致这种巨大差异。谁能帮我理解读取这些数据集的巨大性能差异背后的原因?
【问题讨论】:
标签: apache-spark amazon-s3 apache-spark-sql performance-testing