【发布时间】:2020-05-12 07:18:03
【问题描述】:
我在 s3 中有 parquet 文件,具有以下分区: 年/月/日/ some_id 使用 Spark (PySpark),我每天都想在最后 14 天 进行 UPSERT - 我想替换 s3 中的现有数据(每个分区一个 parquet 文件),但不删除14天之前的日子.. 我尝试了两种保存模式: append - 不好,因为它只是添加了另一个文件。 overwrite - 正在删除过去的数据和其他分区的数据。
有什么方法或最佳实践可以克服这个问题吗?我应该在每次运行中从 s3 读取所有数据,然后再写回来吗?也许重命名文件以便 append 将替换 s3 中的当前文件?
非常感谢!
【问题讨论】:
标签: amazon-s3 pyspark etl parquet