【发布时间】:2019-05-25 12:58:20
【问题描述】:
我需要使用“sparklyr”库读取“.csv”类型的文件,其中的数值以逗号显示。这个想法是能够直接使用“spark_read_csv()”进行阅读。
我正在使用:
library(sparklyr)
library(dplyr)
f<-data.frame(DNI=c("22-e","EE-4","55-W"),
DD=c("33,2","33.2","14,55"),CC=c("2","44,4","44,9"))
write.csv(f,"aff.csv")
sc <- spark_connect(master = "local", spark_home = "/home/tomas/spark-2.1.0-bin-hadoop2.7/", version = "2.1.0")
df <- spark_read_csv(sc, name = "data", path = "/home/tomas/Documentos/Clusterapp/aff.csv", header = TRUE, delimiter = ",")
tbl <- sdf_copy_to(sc = sc, x =df , overwrite = T)
问题,把数字看成因子
【问题讨论】:
-
您可能希望包含文件中的一些示例数据。
-
请将此数据添加到您的问题中,格式为可读代码。
-
第一列为标识符,其余为数值,其中逗号标识带小数的数字。 df
-
我正在寻找类似 R 的 csv2 () 函数,但是 sparklyr 的东西
标签: r apache-spark sparklyr