【发布时间】:2021-05-14 16:30:49
【问题描述】:
我在 S3 存储桶中有一些 Snappy 压缩的 Parquet 文件并使用 Pyspark,我正在尝试读取文件的数据并打印其架构。但是当我从文件夹路径中读取时,架构与单个文件的架构不同。
文件夹路径架构:
df = spark.read.parquet("s3://bucket_name/rds-aurora/core/")
df.printSchema()
root
|-- rid: long (nullable = true)
|-- id: string (nullable = true)
|-- revision: integer (nullable = true)
|-- type: integer (nullable = true)
|-- content_dataType: long (nullable = true)
读取单个文件时的架构:
df = spark.read.parquet("s3://bucket_name/rds-aurora/core/part-00008-c000.snappy.parquet")
df.printSchema()
root
|-- rid: long (nullable = true)
|-- id: string (nullable = true)
|-- revision: integer (nullable = true)
|-- type: integer (nullable = true)
|-- content_dataType: long (nullable = true)
|-- content_definitionName: string (nullable = true)
文件夹路径的架构中缺少 列 content_definitionName。任何帮助都将不胜感激,以了解为什么/如何获得与单个文件架构相同的文件夹架构。
【问题讨论】:
标签: apache-spark amazon-s3 pyspark apache-spark-sql