【发布时间】:2019-03-20 23:57:20
【问题描述】:
例如,我目前有一个 DataProc 集群,由一个 master 和 4 个 worker 组成,每台机器有 8 个 vCPU 和 30GB 内存。
每当我向集群提交作业时,集群总共最多提交 11GB,并且只使用 2 个工作节点来完成工作,并且在这些节点上只使用 2 个 vCPU 资源。这使得原本应该只需要几分钟的工作需要近一个小时才能执行。
我尝试在主节点上编辑spark-defaults.conf 文件,并尝试使用参数--executor-cores 4 --executor-memory 20g --num-executors 4 运行我的spark-submit 命令,但都没有任何效果。
这些集群只会被启动以执行单个任务,然后会被拆除,因此不需要为任何其他作业保留资源。
【问题讨论】:
标签: apache-spark google-cloud-platform google-cloud-dataproc