【发布时间】:2020-11-21 00:40:50
【问题描述】:
我通过 Google Dataproc 在 Spark 集群上运行 hail0.1。
我成功运行了 1 Tb 数据集,导入 vcf 并写入 vds。
当我尝试运行 3 Tb 数据集时,使用相同的代码,它报告:SparkException: Job 2 cancelled because SparkContext was shut down 我猜这是 OOM 异常,因此我升级 drive.mem 和 executor.mem,仍然报告相同的错误,但它完成了更多任务。 (第一次在 10000/600000 左右终止,第二次在 30000/60000 终止)
这里有哪些故障排除步骤?我想我的 driver 和 executor mem 已经很高了。
第一次集群配置:
Master node
Standard (1 master, N workers)
Machine type
n1-highmem-32
Number of GPUs
0
Primary disk type
pd-standard
Primary disk size
200GB
Local SSDs
0
Worker nodes
4
Machine type
n1-highmem-16
Number of GPUs
0
Primary disk type
pd-standard
Primary disk size
100GB
Local SSDs
1
Secondary worker nodes
10
Machine type
n1-highmem-16
Number of GPUs
0
Primary disk type
pd-standard
Primary disk size
100GB
Local SSDs
0
Preemptible
true
Properties
distcp:mapreduce.map.java.opts
-Xmx1664m
distcp:mapreduce.map.memory.mb
2048
distcp:mapreduce.reduce.java.opts
-Xmx1664m
distcp:mapreduce.reduce.memory.mb
2048
hdfs:dfs.namenode.handler.count
80
hdfs:dfs.namenode.service.handler.count
40
hdfs:dfs.replication
1
mapred-env:HADOOP_JOB_HISTORYSERVER_HEAPSIZE
4000
mapred:mapreduce.map.cpu.vcores
1
mapred:mapreduce.map.java.opts
-Xmx3276m
mapred:mapreduce.map.memory.mb
4096
mapred:mapreduce.reduce.cpu.vcores
2
mapred:mapreduce.reduce.java.opts
-Xmx8192m
mapred:mapreduce.reduce.memory.mb
10240
mapred:yarn.app.mapreduce.am.command-opts
-Xmx8192m
mapred:yarn.app.mapreduce.am.resource.cpu-vcores
2
mapred:yarn.app.mapreduce.am.resource.mb
10240
spark-env:SPARK_DAEMON_MEMORY
4000m
spark:spark.driver.extraJavaOptions
-Xss4M
spark:spark.driver.maxResultSize
60g
spark:spark.driver.memory
200g
spark:spark.executor.cores
8
spark:spark.executor.extraJavaOptions
-Xss4M
spark:spark.executor.memory
37237m
spark:spark.kryoserializer.buffer.max
1g
spark:spark.task.maxFailures
20
spark:spark.yarn.am.memory
37237m
spark:spark.yarn.am.memoryOverhead
3723
spark:spark.yarn.executor.memoryOverhead
3723
yarn-env:YARN_NODEMANAGER_HEAPSIZE
4000
yarn-env:YARN_RESOURCEMANAGER_HEAPSIZE
4000
yarn-env:YARN_TIMELINESERVER_HEAPSIZE
4000
yarn:yarn.nodemanager.resource.memory-mb
81920
yarn:yarn.scheduler.maximum-allocation-mb
81920
yarn:yarn.scheduler.minimum-allocation-mb
2048
我第二次升级master节点到n1-highmem-96,工作节点到n1-highmem-32,spark.driver.memory 600g,spark.driver.maxResultSize 180g,其他设置由Yarn自动调整。
【问题讨论】:
标签: apache-spark pyspark hadoop-yarn google-cloud-dataproc