【发布时间】:2020-09-04 04:18:39
【问题描述】:
我正在尝试在 adls gen2 中移动文件,标准 dbtutils.fs.mv 对于该任务来说非常慢,因为文件数远远超过 200k。我正在考虑并行化该过程,因此我从文件列表中创建了一个 RDD,并尝试在该 dbutils.fs.mv 中使用 foreachPartition。当我尝试这样做时,它会引发错误 - java.io.IOException: No FileSystem for scheme: wasbs
还尝试使用sc.hadoopConfiguration.set("fs.wasbs.impl","org.apache.hadoop.fs.azure.NativeAzureFileSystem"),但这只会在 Azure 本机文件系统的行上产生另一个错误。
也欢迎任何其他方法来实现这一点。
提前致谢。
【问题讨论】:
-
您能否分享您遇到的错误消息的完整堆栈跟踪?
标签: azure azure-databricks azure-data-lake-gen2