【发布时间】:2021-12-17 20:42:03
【问题描述】:
我正在阅读 azure databricks 中 adls 中的一个文件夹,其中包含包含 parquet 文件的子文件夹。
路径 - base_folder/文件名/
filename 有 2020、2021 等子文件夹,这些文件夹又有月和日的子文件夹。
所以实际 parquet 文件的路径类似于 - base_folder/filename/2020/12/01/part11111.parquet。
我也尝试过下面的命令,但它显示相同的错误。 Unable to infer schema for Parquet. It must be specified manually
请帮助我读取一个数据帧中所有子文件夹中的所有 parquet 文件。
【问题讨论】:
-
您希望在数据框中包含包含
2020、12和01的字段吗?
标签: azure scala apache-spark databricks