【发布时间】:2019-05-01 14:48:44
【问题描述】:
我正在加载一个相当大的 Parquet 文件
file = spark.read.parquet('hdfs/directory/test.parquet')
现在我想获取一些统计信息(类似于 pandas describe() 函数)。我试图做的是:
file_pd = file.toPandas()
file_pd.describe()
但显然这需要将所有数据加载到内存中,它会失败。 任何人都可以提出解决方法吗?
【问题讨论】:
标签: python pandas apache-spark pyspark