【发布时间】:2022-11-23 05:11:55
【问题描述】:
如果我有一个应用程序每天在同一组列(不一定是相同的行值)上运行相同的作业。有没有一种方法可以保存 spark 执行计划,而不必每次都让 spark 重新计算它?
我的应用程序需要数千次转换,而且构建沿袭图和优化计划需要花费大量时间。
【问题讨论】:
标签: apache-spark pyspark
如果我有一个应用程序每天在同一组列(不一定是相同的行值)上运行相同的作业。有没有一种方法可以保存 spark 执行计划,而不必每次都让 spark 重新计算它?
我的应用程序需要数千次转换,而且构建沿袭图和优化计划需要花费大量时间。
【问题讨论】:
标签: apache-spark pyspark
有没有一种方法可以保存 spark 执行计划,而不必每次都让 spark 重新计算它?
我从来没有遇到过这种可能性,所以我可以自信地说这不是一个选择。
相反,您可以做些什么来优化作为 Spark 输入的数据 - 最佳分区、压缩、支持谓词下推的格式可能是您可以节省时间的地方。
【讨论】: