【发布时间】:2022-10-20 19:23:22
【问题描述】:
我想从 Pyspark 的 Azure datalake 中的目录中获取所有 parquet 文件名的列表。 以“part-”开头的长文件名
如何做到这一点?
【问题讨论】:
-
您好@Sparc,您可以使用 os 库,例如:files = os.listdir(path),其中 path :包含 parquets 文件的文件夹的路径。在文件中,您将列出所有文件,之后您可以通过仅保留以“部分”开头的文件来过滤列表
-
嗨@MerciDieuKIMPOLO,它给了我错误,因为没有这样的文件或目录。我该如何解决这个问题?
-
嗨@samkart,这不起作用。我想使用 Pyspark 从 Azure synapse notebook 运行代码,以从文件位于 datalake 的目录中获取 parquet 文件的名称。
-
请添加平台标签以便更好地覆盖和理解
-
嗨@samkart,抱歉。我现在做了标记。请您给点建议。谢谢
标签: azure pyspark parquet data-lake