【发布时间】:2018-10-12 11:16:48
【问题描述】:
我正在开发一个 spark 应用程序,但我遇到了一个严重的问题 结果非常高的 CGTime 任务时间。 我导出了日志并使用 GC easy 对其进行了分析。
集群硬件: 1 名司机 m4.2xlarge 16 个 vCore,32 GiB 内存,仅 EBS 存储 EBS 存储:32 GiB
15 核: m4.2xlarge 16 个 vCore,32 GiB 内存,仅 EBS 存储 EBS 存储:32 GiB
配置
hadoop-env.export JAVA_HOME /usr/lib/jvm/java-1.8.0
mapred-site mapreduce.fileoutputcommitter.algorithm.version 2
mapred-site mapred.output.committer.class org.apache.hadoop.mapred.FileOutputCommitter
spark-defaults spark.default.parallelism 880
spark-defaults spark.executor.instances 44
spark-defaults spark.yarn.executor.memoryOverhead 3072
spark-defaults spark.executor.cores 10
spark-defaults spark.yarn.driver.memoryOverhead 3072
spark-defaults spark.driver.memory 18G
spark-defaults spark.driver.cores 10
spark-defaults spark.executor.memory 18G
spark-env.export JAVA_HOME /usr/lib/jvm/java-1.8.0
输入
维度 1.2 Tera 数据。
伪指令
1 读取数据 2 映射到配对 |行 -> 元组(行,1) 3个不同的
日志问题
- 连续 Full GC
- 长时间停顿
- 应用程序等待资源
分析链接
我不是 CG 采集器动力学方面的专家,谁能帮我找出问题所在?
【问题讨论】:
标签: java apache-spark garbage-collection amazon-emr