【发布时间】:2018-09-04 13:58:27
【问题描述】:
我想将一个巨大的 pyspark 数据框保存为 Hive 表。我怎样才能有效地做到这一点?我希望使用 pyspark.sql.DataFrameWriter.saveAsTable 中的 saveAsTable(name, format=None, mode=None, partitionBy=None, **options)。
# Let's say I have my dataframe, my_df
# Am I able to do the following?
my_df.saveAsTable('my_table')
我的问题是我可以使用哪些格式,我在哪里可以找到自己的信息? OrcSerDe 是一种选择吗?我还在学习这个。谢谢。
【问题讨论】:
-
你可以考虑压缩,因为你的数据框很大
标签: apache-spark hadoop hive pyspark hiveql