【问题标题】:Does apache spark has geo awareness?apache spark有地理意识吗?
【发布时间】:2016-12-26 14:34:34
【问题描述】:

我正在尝试为跨不同站点的 apache spark 集群选择拓扑。 Spark 有自己的感知能力吗?

例如,假设在俄勒冈州和槟城有一个工人集群。

现在,当提交应用程序时,它会从俄勒冈州加载数据并对其进行处理并将其保存回俄勒冈州。俄勒冈州的工人是否会被优先考虑(如果他们是免费的)? 尚未找到有关此主题的文档。

【问题讨论】:

  • Spark 本身不具备地理感知能力。即它不会知道你是否在俄勒冈州和槟城有工人,并且只在俄勒冈州排队任务,因为数据在那里。您需要构建您的集群,以便特定作业与具有最小网络延迟的工作人员一起运行。

标签: apache-spark spark-dataframe


【解决方案1】:

如此处所述https://jaceklaskowski.gitbooks.io/mastering-apache-spark/content/spark-data-locality.html

Spark 依赖于数据局部性,即数据放置或与数据的接近度 源,这使得 Spark 作业对数据所在的位置敏感。 因此,让 Spark 在 Hadoop YARN 集群上运行非常重要 如果数据来自 HDFS。 数据系统本身可能是地理感知的,例如卡桑德拉:Does Spark use data locality?http://www.slideshare.net/RussellSpitzer/spark-cassandralocality

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-05-26
    • 1970-01-01
    • 1970-01-01
    • 2015-07-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-06-10
    相关资源
    最近更新 更多