【发布时间】:2020-06-30 16:30:48
【问题描述】:
我有一个在 EMR 上运行的 spark 流作业,从 Kafka 读取消息并输出到 S3。
我使用的是 emr-5.17.0,即 hadoop 2.8.4,spark 2.3.1
问题是shuffle文件堆积在:/mnt/yarn/usercache/hadoop/appcache/application_1540126328960_0001/
在磁盘空间用完之前永远不会被删除
文件看起来像:shuffle_328_127_0.index、shuffle_328_134_0.data
我确实尝试像这样更新 Yarn 的政策: yarn.nodemanager.localizer.cache.cleanup.interval-ms 300000 yarn.nodemanager.localizer.cache.target-size-mb 5000
但这并没有解决问题。
目前我会自动重新启动作业并每隔几个小时启动一个新作业,当应用程序停止时它会删除缓存
我该怎么做才能让 yarn 删除缓存文件?
谢谢
【问题讨论】:
-
您能否仅通过配置解决此问题?我有类似的问题,但我不想运行 crons 或类似的东西。
标签: apache-spark apache-kafka spark-streaming