【发布时间】:2017-08-25 23:43:38
【问题描述】:
我有一个系统,其中 REST API (Flask) 使用 spark-sumbit 将作业发送到正在运行的 pyspark。
由于各种原因,我需要spark同时运行所有任务(即我需要设置执行器的数量=运行时的任务数量)。
例如,如果我有 20 个任务并且只有 4 个核心,我希望每个核心执行 5 个任务(执行器)而无需重新启动 spark。
我知道我可以在启动 spark 时设置执行器的数量,但我不想这样做,因为 spark 正在执行其他作业。
这是否可以通过变通来实现?
【问题讨论】:
-
每个作业都可以有自己的配置,一旦作业提交参数就不能修改。
-
为什么静态配置为什么不用
spark.dynamicAllocation.enabled动态分配资源?
标签: python apache-spark jvm pyspark bigdata