【发布时间】:2019-03-01 04:53:50
【问题描述】:
我有运行模型的时间序列每日数据。该模型在 Spark 中运行。
我只想每天运行模型,并将结果附加到历史结果中。拥有一个包含历史数据的“合并的单一数据源”对于模型成功运行非常重要。
我必须使用 AWS 服务来存储结果。如果我存储在 S3 中,我最终将每天存储回填 + 1 个文件(文件太多)。如果我存储在 Redshift 中,它不会合并 + upsert,因此变得复杂。面向客户的数据位于 Redshift 中,因此不能选择删除表并每天重新加载。
我不确定如何巧妙地(定义为最低成本和后续处理)存储增量数据,而无需每天重新处理所有内容以获得单个文件。
【问题讨论】:
-
"如果我存储在 Redshift 中,它不会合并 + upsert,因此变得复杂。" - 你能扩展一下吗?为什么无法在 Redshift 中创建插入/更新逻辑?
标签: apache-spark amazon-s3 time-series amazon-redshift