【发布时间】:2018-09-02 02:06:51
【问题描述】:
我有一个包含大量记录的数据框。在该 DF 中,一条记录可以重复多次,并且每次更新时,最后更新的字段都将具有修改记录的日期。
我们有一组列,我们希望在这些列上比较相似 id 的行。在此比较期间,我们希望捕获从先前记录到当前记录的字段/列发生了哪些变化,并将其捕获到更新记录的“updated_columns”列中。将此第二条记录与第三条记录进行比较并识别更新的列并在第三条记录的“updated_columns”字段中捕获它,继续相同直到该 id 的最后一条记录,并对具有多个条目的每个 id 执行相同的操作.
最初,我们将列分组并从该组列中创建一个哈希值,并与下一行的哈希值进行比较,这样可以帮助我识别有更新的记录,但想要更新的列。
我在这里分享一些数据,这是预期的结果,这就是添加更新列后最终数据的样子(我可以说,使用列 Col1、Col2、Col3、col4 和 Col5 来比较两行):
希望以有效的方式做到这一点。任何人都尝试过这样的事情。
寻求帮助!
~克里什。
【问题讨论】:
-
图形表示总是有帮助的!
-
我已经用例子更新了这个问题,谢谢。
标签: apache-spark apache-spark-sql