【发布时间】:2022-01-03 13:06:22
【问题描述】:
我正在尝试了解 Spark 中数据倾斜时发生的问题。
假设我有以下数据,而我 left outer join 的数据集非常小。
true //50 million records
false //50k records
所以在上述情况下,true 记录将被加载到一个分区中,如果过载,它应该创建另一个分区。
但它卡在哪里了?我正在尝试将其可视化。
请帮助我理解在卡住的流程中会发生什么。网上看了很多,但没能完全明白。
【问题讨论】:
-
我想你应该多告诉我们一点。如果您做了一些特殊的事情,请显示左右数据集的示例和代码。
标签: java apache-spark dataset