【问题标题】:Run SparkR | or R package on my Cloudera 5.9 Spark运行 SparkR |或我的 Cloudera 5.9 Spark 上的 R 包
【发布时间】:2017-05-17 22:54:58
【问题描述】:

我有 3 个节点集群,Cloudera 5.9 在 CentOS 6.7 上运行。我需要将我的 R 包(在我的笔记本电脑上运行)连接到在 Hadoop 上以集群模式运行的 Spark。

但是,如果我尝试通过 Sparklyr Connect 将本地 R 连接到 Hadoop Spark,则会出现错误。因为它正在笔记本电脑上搜索 Spark 主页。

我搜索了一下,发现我们可以安装 SparkR 并将 R 与 Spark 一起使用。但是我对此几乎没有疑问。

  1. 我已经从 https://amplab-extras.github.io/SparkR-pkg/ 但我的问题是我 直接复制到我的Linux服务器上安装?
  2. 我是否必须停止/删除我现有的非独立 Spark 并使用纱线,即它在集群模式下运行?或 SparkR 可以 只是在它上面运行,如果我将它安装在服务器上?
  3. 或者我必须在独立模式下运行 Spark(获取 Spark 网关 使用脚本运行和启动主/从)并安装包 从 linux 命令行上面呢?
  4. 如果安装了它,我可以通过 CM UI 访问它吗?

请帮忙,我是新手,真的需要指导。

谢谢, 希尔帕

【问题讨论】:

标签: r apache-spark hadoop2 sparkr


【解决方案1】:

我在 CentOS 上安装了 R studio,并从下面的链接 http://devopspy.com/linux/install-r-rstudio-centos-7/ 获得了一个 e-GUI

后来我尝试安装 sparklyr,但遇到了很多问题。最后通过安装解决了:

sudo yum install libcurl-devel
sudo yum install openssl-devel
sudo yum install libgit2-devel

稍后您可以正常安装 sparklyr 包。

【讨论】:

    【解决方案2】:

    安装 R 然后在其上安装 SparkR 的最佳方法是:http://blog.clairvoyantsoft.com/2016/11/installing-sparkr-on-a-hadoop-cluster/

    我能够通过此链接安装它们。它非常有用且最新。

    谢谢, 希尔帕

    【讨论】:

      【解决方案3】:
      猜你喜欢
      • 1970-01-01
      • 2018-04-22
      • 1970-01-01
      • 2016-06-28
      • 1970-01-01
      • 2018-04-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多