【发布时间】:2015-10-08 17:27:18
【问题描述】:
我正在开发 30gb ram(12 核引擎)的 IBM 服务器,我已经提供了所有的核心来激发,但它仍然只使用 1 个核心,我在加载文件时尝试并成功使用命令
val name_db_rdd = sc.textFile("input_file.csv",12)
并且能够为启动作业的处理提供所有 12 个核心,但我想将中间操作之间的操作拆分给执行器,以便它可以使用所有 12 个核心。
图片 - 描述
val new_rdd = rdd.repartition(12)
正如您在这张图片中看到的,只有 1 个执行器正在运行,并且重新分区功能将数据拆分到一个执行器上的多个任务。
【问题讨论】:
-
请提供您的 SparkConf 配置以及您如何启动应用程序的详细信息,以上内容还不够。
标签: scala apache-spark