【发布时间】:2021-04-11 03:17:35
【问题描述】:
我的 HDFS 环境中有大量数据集,例如 500 多个数据集,所有数据集大约有 100M+ 行。我只想获取每个数据集的列名而不读取整个数据集,因为这样做需要很长时间。我的数据是 json 格式的,我正在使用经典的 spark json 阅读器阅读它们:spark.read.json('path')。那么在不浪费我的时间和内存的情况下获取列名的最佳方法是什么?
谢谢...
【问题讨论】:
-
spark.read.json('path').columns可能会成功,但可能涉及扫描数据以推断架构 -
@mck 是的,它完成了这项工作,但在返回列名之前仍会读取整个数据集!
标签: json apache-spark pyspark hdfs