【发布时间】:2018-11-08 02:52:06
【问题描述】:
每天运行并生成一个 csv 文件(包含帐户详细信息)的银行应用程序,我们会将数据加载到数据库中。
第二天,将再生成一个每日文件。在此文件中,对于某些帐号,详细信息已更新/修改/删除。 在将其插入数据库时,我们如何仅加载已更改的数据。
流程是 csv 文件->HDFS->hive/spark 中的转换(如果适用)-> redshift
【问题讨论】:
标签: csv apache-spark hadoop hive amazon-redshift