【发布时间】:2018-09-19 23:16:26
【问题描述】:
我有一个在 yarn-client(客户端驱动程序)中运行的 spark-submit 作业,除其他功能外,它还通过 Kafka 读取和发送消息。
在我的集群上,只有 Kafka 代理节点有 Kafka jar,我不想让我的所有节点都成为 Kafka 客户端。这意味着我的 Spark 作业必须加载 (--jars) 并将 Kafka jar 从客户端服务器复制到集群上的所有执行程序。
我的问题是:一般的最佳做法是什么?将这些 jars (~20MB) 复制到每个执行程序是否会对性能/延迟产生影响?还是一种经典的工作方式?
Environment
RHEL7
Spark 1.6
Kafka 0.10.1
Network 10GB
【问题讨论】:
标签: java apache-spark hadoop apache-kafka