【发布时间】:2020-05-19 09:30:58
【问题描述】:
我有一个 Spark 作业,它从多个来源获取数据并将数据聚合到一个表中。只有当有新数据时,作业才应该更新表。
我能想到的一种方法是从现有表中获取数据,并与传入的新数据进行比较。比较发生在 spark 层中。
我想知道是否有更好的比较方法,可以提高比较性能。
如果有人对此有任何建议,请告诉我。
提前非常感谢。
【问题讨论】:
-
您也可以将新数据写入临时表,然后使用 Bigquery Merge 更新目标表。
-
答案将基于意见。请查看我在项目中所做的工作
标签: dataframe apache-spark pyspark google-bigquery bigdata