【发布时间】:2021-04-17 07:06:11
【问题描述】:
我遇到了性能问题,在检查了 spark 的 Web UI 后,我发现存在严重的数据偏斜问题:
我已经尝试通过列的多个组合“分发”和“重新分区”但没有运气,所以我试图调试 spark 是如何对数据集进行分区的(为了修复它),有什么方法可以手动运行用于创建列的分区函数?基本上我正在尝试做类似的事情:
df = df.withColumn("assigned_partition", partitioning_function())
df_grouped = df.groupby("assigned_partition").count()
这样我就可以确定偏斜的模式或原因。
注意:这是在查询 hive 表之后,所以我知道偏度不是由于任何 spark 逻辑或计算造成的。
【问题讨论】:
标签: apache-spark pyspark