【发布时间】:2021-02-20 15:26:22
【问题描述】:
考虑以下场景:
我希望我的数据流如下 导入容器 ---> 数据块(转换)--> 导出容器
改造完成后的现状 容器:
---import
--folder
--mydata.csv
---export
--folder
--part-1-transformed-mydata.csv
--part-2-transformed-mydata.csv
--part-3-transformed-mydata.csv
--initial.txt
--success.txt
--finish.txt
我想要以下结构:
---import
--folder
--mydata.csv
---export
--folder
--transformed-mydata.csv
在数据块中应该首选什么方式(考虑到数据是几 GB
注意:我在数据块中使用 Apache Spark 3.0.0、Scala 2.12,内存为 14 GB,4 核。集群类型是标准的
【问题讨论】:
标签: pyspark azure-data-factory-2 azure-databricks