【发布时间】:2017-05-17 22:54:58
【问题描述】:
我有 3 个节点集群,Cloudera 5.9 在 CentOS 6.7 上运行。我需要将我的 R 包(在我的笔记本电脑上运行)连接到在 Hadoop 上以集群模式运行的 Spark。
但是,如果我尝试通过 Sparklyr Connect 将本地 R 连接到 Hadoop Spark,则会出现错误。因为它正在笔记本电脑上搜索 Spark 主页。
我搜索了一下,发现我们可以安装 SparkR 并将 R 与 Spark 一起使用。但是我对此几乎没有疑问。
- 我已经从 https://amplab-extras.github.io/SparkR-pkg/ 但我的问题是我 直接复制到我的Linux服务器上安装?
- 我是否必须停止/删除我现有的非独立 Spark 并使用纱线,即它在集群模式下运行?或 SparkR 可以 只是在它上面运行,如果我将它安装在服务器上?
- 或者我必须在独立模式下运行 Spark(获取 Spark 网关 使用脚本运行和启动主/从)并安装包 从 linux 命令行上面呢?
- 如果安装了它,我可以通过 CM UI 访问它吗?
请帮忙,我是新手,真的需要指导。
谢谢, 希尔帕
【问题讨论】:
-
您是如何尝试连接到 Spark 集群的?这个答案可能有用:stackoverflow.com/a/38107699/2026277
标签: r apache-spark hadoop2 sparkr