【问题标题】:Naming a Parquet File in Glue JOB在 Glue JOB 中命名 Parquet 文件
【发布时间】:2018-01-12 16:27:01
【问题描述】:

如何在 AWS 粘合作业中为​​ parquet 文件分配预定义名称?

例如,在我的作业运行后,parquet 文件会存储在特定文件夹中,其名称如下:

part-00000-fc95461f-00da-437a-9396-93c7ea473720.sn​appy.parquet, part-00000-tc95431f-00ds-437b-9396-93c7ea473720.sn​appy.parquet

我希望文件以预定义或结构化格式存储,例如:

part-00000-12Jan2018.sn​appy.parquet, part-00000-13Jan2018.sn​appy.parquet

等等。

【问题讨论】:

    标签: amazon-s3 pyspark parquet aws-glue


    【解决方案1】:

    由于 spark 工作方式的性质,我们目前无法根据自己的喜好命名文件。 另一种方法是在将文件写入 s3/data Lake 后立即重命名文件。 我发现these 的答案很有帮助。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-02-03
      • 2020-12-30
      • 2021-11-01
      • 2020-01-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多