【发布时间】:2016-12-26 14:34:34
【问题描述】:
我正在尝试为跨不同站点的 apache spark 集群选择拓扑。 Spark 有自己的感知能力吗?
例如,假设在俄勒冈州和槟城有一个工人集群。
现在,当提交应用程序时,它会从俄勒冈州加载数据并对其进行处理并将其保存回俄勒冈州。俄勒冈州的工人是否会被优先考虑(如果他们是免费的)? 尚未找到有关此主题的文档。
【问题讨论】:
-
Spark 本身不具备地理感知能力。即它不会知道你是否在俄勒冈州和槟城有工人,并且只在俄勒冈州排队任务,因为数据在那里。您需要构建您的集群,以便特定作业与具有最小网络延迟的工作人员一起运行。
标签: apache-spark spark-dataframe