【问题标题】:Shipping R packages to the nodes in SparkR将 R 包运送到 SparkR 中的节点
【发布时间】:2015-09-17 08:11:24
【问题描述】:

您好,我想知道是否有解决方案可以使用 spark-submit 发送 R 包并在 SparkR 的计算节点上使用它们?

【问题讨论】:

  • 您必须使用配置管理系统来安装它们,该系统允许您定义 IT 基础架构的状态,然后自动强制执行正确的状态,例如 puppet 或 chef。
  • 确实有可能,因为 zip 打包的 R 包可以通过install.packages("<package name>, repos=NULL) 安装,并且 zip 文件被发送到 YARN 缓存(即工作目录或 SparkR)。我找不到一个非常简单的方法,所以希望有人能回答;)

标签: r apache-spark hadoop2 sparkr


【解决方案1】:

压缩 R 包的内容并将其作为 my_package.zip 发送到集群,即使用 spark-submit 命令。这会将 zip 文件放入 SparkR 脚本的工作目录中。

然后你可以在你的 R 脚本中安装这个包:

 install.packages("my_package.zip",repos=NULL)
 library(my_package)

免责声明:如果您的软件包依赖于其他软件包,您将需要手动发送和安装它们。

【讨论】:

猜你喜欢
  • 2017-01-05
  • 2017-05-17
  • 2014-09-12
  • 2018-04-27
  • 2020-11-26
  • 2016-06-28
  • 1970-01-01
  • 2019-05-08
  • 1970-01-01
相关资源
最近更新 更多