【发布时间】:2018-06-04 01:26:19
【问题描述】:
创建 DataFrame 后,我可以将其保存为 avro、csv 或 parquet 格式。
dataframe 或 rdd 中是否有其他可用格式可以将数据保存在 Hadoop HDFS 中?
【问题讨论】:
标签: hadoop apache-spark hdfs apache-spark-sql
创建 DataFrame 后,我可以将其保存为 avro、csv 或 parquet 格式。
dataframe 或 rdd 中是否有其他可用格式可以将数据保存在 Hadoop HDFS 中?
【问题讨论】:
标签: hadoop apache-spark hdfs apache-spark-sql
Hadoop 分布式文件系统 (HDFS™):提供对应用程序数据的高吞吐量访问的分布式文件系统。
这样,您可以使用 HDFS 以任何格式存储虚拟文件,包括 avro、CSV、parquet 等。
在 Spark 中,您使用 format 方法指定 DataFrame 的格式,而使用 save 方法指定存储中的位置。
format(source: String): DataFrameWriter[T] 指定底层输出数据源。内置选项包括“parquet”、“json”等。
save(path: String): Unit 将DataFrame的内容保存到指定路径。
您还可以使用该快捷方式,使用json(path: String)、parquet(path: String) 等特定于格式的方法来定义存储上DataFrame 的格式和路径。
【讨论】:
最后但并非最不重要的...
【讨论】: