【问题标题】:How to convert .rdata file to parquet in Azure data lake using databricks?如何使用 databricks 将 .rdata 文件转换为 Azure 数据湖中的镶木地板?
【发布时间】:2021-05-10 03:45:17
【问题描述】:

所以我有一些使用 R 编程语言生成的大型 .rdata 文件。我目前已使用 Azure 存储资源管理器将它们上传到 azure 数据湖。但我必须将这些 rdata 文件转换为 parquet 格式,然后将它们重新插入数据湖。我该怎么做呢?我似乎找不到任何关于从 rdata 转换为 parquet 的信息。

【问题讨论】:

    标签: r azure apache-spark databricks azure-data-lake


    【解决方案1】:

    如果您可以使用 python,则有一些库,例如 pyreadr,可以将 rdata 文件加载为 pandas 数据帧。然后,您可以使用 pandas 写入 parquet 或转换为 pyspark 数据框。像这样的:

    import pyreadr
    
    result = pyreadr.read_r('input.rdata')
    
    print(result.keys())  # check the object name
    df = result["object"]  # extract the pandas data frame for object name
    
    sdf = spark.createDataFrame(df)
    
    sdf.write.parquet("output")
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-11-25
      • 1970-01-01
      • 2018-11-09
      • 2016-04-16
      • 1970-01-01
      • 1970-01-01
      • 2019-02-03
      • 2018-01-04
      相关资源
      最近更新 更多