【发布时间】:2021-05-10 03:45:17
【问题描述】:
所以我有一些使用 R 编程语言生成的大型 .rdata 文件。我目前已使用 Azure 存储资源管理器将它们上传到 azure 数据湖。但我必须将这些 rdata 文件转换为 parquet 格式,然后将它们重新插入数据湖。我该怎么做呢?我似乎找不到任何关于从 rdata 转换为 parquet 的信息。
【问题讨论】:
标签: r azure apache-spark databricks azure-data-lake
所以我有一些使用 R 编程语言生成的大型 .rdata 文件。我目前已使用 Azure 存储资源管理器将它们上传到 azure 数据湖。但我必须将这些 rdata 文件转换为 parquet 格式,然后将它们重新插入数据湖。我该怎么做呢?我似乎找不到任何关于从 rdata 转换为 parquet 的信息。
【问题讨论】:
标签: r azure apache-spark databricks azure-data-lake
如果您可以使用 python,则有一些库,例如 pyreadr,可以将 rdata 文件加载为 pandas 数据帧。然后,您可以使用 pandas 写入 parquet 或转换为 pyspark 数据框。像这样的:
import pyreadr
result = pyreadr.read_r('input.rdata')
print(result.keys()) # check the object name
df = result["object"] # extract the pandas data frame for object name
sdf = spark.createDataFrame(df)
sdf.write.parquet("output")
【讨论】: