【发布时间】:2015-11-21 22:31:04
【问题描述】:
我有一个大型数据集,我正在尝试使用 Apache Spark 运行(大约 5TB)。我注意到,当作业开始时,它检索数据的速度非常快,并且作业的第一阶段(map 转换)完成得非常快。
但是,在处理了大约 500GB 的数据后,map 转换开始变慢,并且一些任务需要几分钟甚至几小时才能完成。
我使用 10 台 122 GB 和 16 个 CPU 的机器,并将所有资源分配给每个工作节点。我想过增加机器的数量,但还有什么我可能会遗漏的吗?
我已尝试使用我的一小部分数据集 (30 GB),它似乎工作正常。
【问题讨论】:
-
只是一个猜测,但你可以尝试使用
mapPartitions(如果有一些地图阶段的准备,它应该更快)。
标签: performance apache-spark bigdata cluster-computing distributed-computing