【问题标题】:How can we set the execution parameters for an apache spark application我们如何设置 apache spark 应用程序的执行参数
【发布时间】:2017-05-02 05:29:22
【问题描述】:

我们设置了一个多节点集群,用于测试具有 4 个节点的 Spark 应用程序。 每个节点有 250GB RAM,48 个内核。 在一个节点上运行主节点,三个作为从节点。

我们已经使用 scala 开发了一个 spark 应用程序。 我们使用 spark-submit 选项来运行作业。 现在这是我们感到震惊的地方,需要更多澄清才能继续。

查询 1: 这是运行火花作业的最佳选择。 a) Spark 作为主控 b) 纱线为主 和区别。

查询 2: 在运行任何 Spark 作业时,我们可以提供执行器数量、内核数量、执行器内存等选项。

您能否告知这些参数的最佳值,以便在我的情况下获得更好的性能。

任何帮助将不胜感激,因为它对任何开始使用 Spark 的人都有帮助:)

谢谢。!!

【问题讨论】:

标签: apache-spark


【解决方案1】:

Query1:YARN 是更好的资源管理器,支持的功能比 Spark Master 更多。更多您可以访问 Apache Spark Cluster Managers

Query2:只能在作业初始化时分配资源。有可用的命令行标志。此外,如果您不希望通过 spark-submit 传递命令行标志,您可以在代码中创建 spark 配置时设置它们。 您可以使用查看可用的标志 spark-submit --help

更多信息请访问Spark Configuration

选择资源主要取决于您要处理的数据大小和问题的复杂性。

请访问5 mistakes to avoid while writng spark applications

【讨论】:

  • 亲爱的,感谢您的回复。对于查询 2,我们发现我们可以选择设置内核和内存的参数。但是,如果您能帮助我获得更好的性能结果在我的情况下的最佳值是多少,那就太好了。我们正在尝试处理 3TB 的数据。
  • 所以,您想用 1TB 的 RAM 处理 3TB 的数据。当您拥有如此庞大的数据集和有限的资源时,您如何期望性能。
猜你喜欢
  • 1970-01-01
  • 2015-11-03
  • 2014-08-28
  • 1970-01-01
  • 1970-01-01
  • 2014-11-27
  • 1970-01-01
  • 2021-10-15
  • 2018-02-16
相关资源
最近更新 更多