【问题标题】:Error while reading a folder in azure databricks which has subfolders with parquet files在 azure databricks 中读取包含带有镶木地板文件的子文件夹的文件夹时出错
【发布时间】:2021-12-17 20:42:03
【问题描述】:

我正在阅读 azure databricks 中 adls 中的一个文件夹,其中包含包含 parquet 文件的子文件夹。

路径 - base_folder/文件名/

filename 有 2020、2021 等子文件夹,这些文件夹又有月和日的子文件夹。

所以实际 parquet 文件的路径类似于 - base_folder/filename/2020/12/01/part11111.parquet。

如果我提供基本文件夹路径,我会遇到以下错误。

我也尝试过下面的命令,但它显示相同的错误。 Unable to infer schema for Parquet. It must be specified manually

请帮助我读取一个数据帧中所有子文件夹中的所有 parquet 文件。

【问题讨论】:

  • 您希望在数据框中包含包含20201201 的字段吗?

标签: azure scala apache-spark databricks


【解决方案1】:

尝试:

spark.read.format("parquet").load(landingFolder)

此处指定: Generic Load/Save Functions

【讨论】:

猜你喜欢
  • 2021-03-19
  • 1970-01-01
  • 2021-08-27
  • 1970-01-01
  • 1970-01-01
  • 2021-01-12
  • 1970-01-01
  • 2023-04-01
  • 1970-01-01
相关资源
最近更新 更多