【发布时间】:2019-01-06 12:49:17
【问题描述】:
S3 存储桶中的对象大小为 5.3 GB。为了将对象转换为数据,我使用了get_object("link to bucket path")。但这会导致内存问题。
所以,我在 RStudio 中安装了 Spark 2.3.0 并尝试将此对象直接加载到 Spark 中,但是将对象直接加载到 spark 中的命令未知。
library(sparklyr)
library(dplyr)
sc <- spark_connect(master = "local")
如果我将对象转换为可读的数据类型(例如 R 中的 data.frame/tbl),我将使用 copy_to 将数据从 R 传输到 spark 中,如下所示:
将数据复制到 Spark
spark_tbl <- copy_to(spark_conn,data)
我想知道如何在 spark 中转换对象?
相关链接是
任何指导将不胜感激。
【问题讨论】:
-
转换是什么意思?
-
将对象类型转换为数据。这样我就可以将它用作 R 中的 data.frame 或 tibble。目前,该对象在 R 中不可读,除非它转换为任何类型的 data.frame
-
get_object返回list如果我没记错的话。我们无法说出它的外观或您期望的输出。请发帖minimal reproducible example。
标签: r apache-spark amazon-s3 sparklyr s3-bucket