【问题标题】:Pyspark error : reading a tsv.gz dataframe reads 0 rows each time even though there are rows in sourcePyspark 错误:读取 tsv.gz 数据帧每次读取 0 行,即使源中有行
【发布时间】:2021-05-13 16:37:08
【问题描述】:

我有以下代码;

test_df = (spark.read
         .schema(newSchema)
         .option("header", "true")
         .option("delimiter", "\t").csv("wasbs://container@AzureStorageAcc.blob.core.windows.net/dir1/dir2/2021/02/05/"))

但这似乎不起作用。有没有其他方法可以将 tsv.gz 读取为 spark 数据帧?

【问题讨论】:

    标签: apache-spark pyspark azure-blob-storage databricks


    【解决方案1】:

    尝试从你的命令中删除.format("cloudFiles"),这仅适用于structured streaming,我怀疑它可能会干扰.csv

    【讨论】:

    • 我试过了,还是不行,同样的错误
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-01-11
    • 2015-08-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多