【问题标题】:How to write parquet file in partition in java similar to pyspark?java - 如何在类似于pyspark的java分区中写入parquet文件?
【发布时间】:2016-10-25 08:14:20
【问题描述】:

我可以像这样将 parquet 文件写入 pyspark 中的分区:

rdd.write
 .partitionBy("created_year", "created_month")
 .parquet("hdfs:///my_file")

parquet 文件自动分区为 created_year、created_month。如何在java中做同样的事情?我在 ParquetWriter 类中看不到选项。有没有其他类可以做到这一点?

谢谢,

【问题讨论】:

    标签: hadoop pyspark parquet


    【解决方案1】:

    你必须将你的RDD转换成DataFrame,然后调用write parquet函数。

    df = sql_context.createDataFrame(rdd)
    df.write.parquet("hdfs:///my_file", partitionBy=["created_year", "created_month"])
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-10-15
      • 1970-01-01
      • 1970-01-01
      • 2021-09-27
      • 1970-01-01
      • 2019-03-26
      • 2019-07-06
      • 2022-01-12
      相关资源
      最近更新 更多