【发布时间】:2020-05-10 04:08:57
【问题描述】:
我有一个数据框:
DF:
1,2016-10-12 18:24:25
1,2016-11-18 14:47:05
2,2016-10-12 21:24:25
2,2016-10-12 20:24:25
2,2016-10-12 22:24:25
3,2016-10-12 17:24:25
如何只保留每个组的最新记录? (上面有3组(1,2,3))。
结果应该是:
1,2016-11-18 14:47:05
2,2016-10-12 22:24:25
3,2016-10-12 17:24:25
还努力提高效率(例如,在具有 1 亿条记录的中等集群上在短短几分钟内完成),因此应以最有效和正确的方式进行排序/排序(如果需要)。.
【问题讨论】:
-
这能回答你的问题吗? How to select the first row of each group?
标签: dataframe date apache-spark pyspark