【发布时间】:2019-01-28 15:59:07
【问题描述】:
我正在运行 Azure Databricks 4.3(包括 Apache Spark 2.3.1、Scala 2.11)。
我通过将file: 添加到绝对local_path 中,使用dbutils.fs.cp 将CSV 文件从Azure Blob 存储复制到Databricks 集群中:
copy_to = "file:" + local_path
dbutils.fs.cp(blob_storage_path, copy_to)
当我尝试使用前面添加file: 的相同路径读取文件时:
csv_spark_df = sqlContext.read.format('csv').options(header='true', inferSchema='true').load(copy_to)
我收到一条错误消息,指出给定路径不存在:
java.io.FileNotFoundException: File file:/<local_path>
当我安装 Azure Blob 存储容器时,如下所述,然后我可以使用上面相同的 sn-p 使用 Spark 正确读取文件,使用安装目录中文件的绝对 local_path:
是否可以读取从 Azure Blob 存储复制的 CSV 文件,或者使用安装 Azure Blob 存储容器的解决方案是否是首选?
【问题讨论】:
标签: azure pyspark azure-blob-storage spark-csv azure-databricks