【问题标题】:How many servers are listening during a Spark Streaming?在 Spark Streaming 期间有多少台服务器在监听?
【发布时间】:2015-07-02 00:41:37
【问题描述】:

我正在配置我的集群,我想通过最小化实际可以访问 http 协议的机器数量来加强安全性

所以我的问题是:在进行 Spark 流式传输(比如通过 twitter 提要)时,驱动程序是唯一一个监听流式传输然后将数据作为 RDD 重新分配给执行器的服务器,还是每个执行器都在监听到溪流?

【问题讨论】:

  • 随机选择的工作节点将接收流。
  • @vanekjar,你有源文档吗?有没有办法强制特定服务器接收流?
  • 你能添加你如何设置你的工作的代码吗?
  • 来自 Spark Streaming 官方文档:each input DStream creates a single receiver (running on a worker machine) that receives a single stream of data [spark.apache.org/docs/latest/…

标签: apache-spark spark-streaming


【解决方案1】:

Spark Streaming 将为在 Spark Streaming 配置期间创建的每个接收器发出长时间运行的任务。这些接收器分配在集群上的某个节点上。

如果要指定实例化每个接收器的主机,则必须扩展接收器实现并实现

def preferredLocation: Option[String]

【讨论】:

    猜你喜欢
    • 2014-06-02
    • 2013-03-11
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-12
    • 2021-11-05
    • 2021-02-28
    • 2018-05-13
    相关资源
    最近更新 更多