【问题标题】:What are the formats to save data to HDFS?将数据保存到 HDFS 的格式有哪些?
【发布时间】:2018-06-04 01:26:19
【问题描述】:

创建 DataFrame 后,我可以将其保存为 avro、csv 或 parquet 格式。

dataframe 或 rdd 中是否有其他可用格式可以将数据保存在 Hadoop HDFS 中?

【问题讨论】:

    标签: hadoop apache-spark hdfs apache-spark-sql


    【解决方案1】:

    来自What Is Apache Hadoop?

    Hadoop 分布式文件系统 (HDFS™):提供对应用程序数据的高吞吐量访问的分布式文件系统。

    这样,您可以使用 HDFS 以任何格式存储虚拟文件,包括 avro、CSV、parquet 等。


    在 Spark 中,您使用 format 方法指定 DataFrame 的格式,而使用 save 方法指定存储中的位置。

    format(source: String): DataFrameWriter[T] 指定底层输出数据源。内置选项包括“parquet”、“json”等。

    save(path: String): Unit 将DataFrame的内容保存到指定路径。

    您还可以使用该快捷方式,使用json(path: String)parquet(path: String) 等特定于格式的方法来定义存储上DataFrame 的格式和路径。

    【讨论】:

      【解决方案2】:
      • RDD save*
        • pyspark.RDD.saveAsHadoopDataset
        • pyspark.RDD.saveAsHadoopFile
        • pyspark.RDD.saveAsNewAPIHadoopDataset
        • pyspark.RDD.saveAsNewAPIHadoopFile
        • pyspark.RDD.saveAsPickleFile
        • pyspark.RDD.saveAsSequenceFile pyspark.RDD.saveAsTextFile
      • DataFrame save
        • pyspark.sql.DataFrame.save
        • pyspark.sql.DataFrameWriter.save
        • pyspark.sql.DataFrame.saveAsParquetFile
        • pyspark.sql.DataFrame.saveAsTable
        • pyspark.sql.DataFrameWriter.saveAsTable

      最后但并非最不重要的...

      【讨论】:

        猜你喜欢
        • 2018-06-22
        • 1970-01-01
        • 1970-01-01
        • 2015-07-22
        • 1970-01-01
        • 2021-05-11
        • 1970-01-01
        • 1970-01-01
        • 2014-04-29
        相关资源
        最近更新 更多