【发布时间】:2020-02-03 16:09:41
【问题描述】:
我正在将数据集加载到 DynamicFrame 中,执行转换,然后将其写回 S3:
datasink = glueContext.write_dynamic_frame.from_options(
frame = someDateFrame,
connection_type = "s3",
connection_options = {
"path": "s3://the-bucket/some-data-set"
},
format = "parquet"
)
结果是 12 个 Parquet 文件,平均大小约为 3MB。
首先,鉴于几乎所有消费软件(Presto/Athena、Spark)都喜欢大约 100MB 的文件大小并且不是一堆小文件。如果有人对此有见解,我将不胜感激。
但实际上我想知道是否可以让 Glue/Spark 生成一个大文件或至少更大的文件。这可能吗?
【问题讨论】:
-
您可以正确指定 spark.sql.shuffle.partitions 而不是使用默认的 200。请参阅stackoverflow.com/questions/50701265/…
标签: apache-spark pyspark parquet aws-glue