【发布时间】:2023-03-18 22:15:01
【问题描述】:
当我将 sparksql 查询产生的 DataFrame 保存在 HDFS 中时,它会生成大量的部分文件,每个部分文件大小为 1.4 KB。有没有办法增加文件的大小,因为每个部分文件包含大约 2 条记录。
df_crimes_dates_formated = spark.sql('SELECT CONCAT( SUBSTR(Dates,1,2), SUBSTR(Dates,7,4)) AS DATES , Primary_Type , COUNT(1) AS COUNT FROM crimes_data Group By CONCAT( SUBSTR(Dates,1,2), SUBSTR(Dates,7,4)) , Primary_Type ORDER BY CONCAT( SUBSTR(Dates,1,2), SUBSTR(Dates,7,4)) , COUNT(1) DESC' )
df_crimes_dates_formated.write.save('hdfs:///user/maria_dev/crimes/monthly_crimes/')
【问题讨论】:
-
可以查看分区数,然后重新分区吗?
标签: pyspark hdfs pyspark-sql