【发布时间】:2020-10-28 11:53:33
【问题描述】:
我在 hdfs 示例中有一个分区拼花数据:
hdfs://cluster/stage/data/datawarehouse/table=metrics_data/country=india/year=2020/month=06/day=30/hour=23/
我想了解读取数据的最佳方式:
df = spark.read.parquet("hdfs://cluster/stage/data/datawarehouse/table=metrics_data/country=india/year=2020/month=06/day=30/")。 where(col('hour') == "23")
或
df = spark.read.parquet("hdfs://cluster/stage/data/datawarehouse/table=metrics_data/country=india/year=2020/month=06/day=30/hour=23 ")
如果有的话,我想了解更多关于性能和其他优势的信息。
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql parquet