【问题标题】:Merging files within the Azrue Data Lake container在 Azure Data Lake 容器中合并文件
【发布时间】:2021-02-20 15:26:22
【问题描述】:

考虑以下场景:

我希望我的数据流如下 导入容器 ---> 数据块(转换)--> 导出容器

改造完成后的现状 容器:

---import
    --folder
        --mydata.csv
---export
    --folder
        --part-1-transformed-mydata.csv
        --part-2-transformed-mydata.csv
        --part-3-transformed-mydata.csv
        --initial.txt
        --success.txt
        --finish.txt

我想要以下结构:

---import
    --folder
        --mydata.csv
---export
    --folder
        --transformed-mydata.csv

在数据块中应该首选什么方式(考虑到数据是几 GB

注意:我在数据块中使用 Apache Spark 3.0.0、Scala 2.12,内存为 14 GB,4 核。集群类型是标准的

【问题讨论】:

    标签: pyspark azure-data-factory-2 azure-databricks


    【解决方案1】:

    您要么需要将数据重新分区到单个分区中(请注意,这违背了使用分布式计算平台的意义)

    或者在生成文件后,只需运行一个命令将它们全部连接到一个文件中,如果每个文件都有一个标题,您需要在逻辑中考虑这一点,这可能会出现问题。

    如果有意义的话,将导出文件夹视为“文件”可能会更好。不能解决您的问题,但除非您出于某种原因需要生成单个文件,否则大多数消费者在读取目录中的数据时不会遇到问题

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-03-09
      • 2020-11-22
      • 2019-11-26
      • 2020-05-23
      相关资源
      最近更新 更多