【发布时间】:2018-08-20 01:26:50
【问题描述】:
我正在处理如下所示的数据集
Id Time Location
754005 13:19:00 HK564
754005 13:19:00 IE578
980278 19:51:00 AK177
980278 21:15:00 JB237
Id 列包含重复值,Time 可能包含也可能不包含重复值,Location 列包含唯一值。
我正在尝试过滤此数据集,其中 Id 值基于此逻辑是唯一的:
1) 如果该Id 的时间值相同,则保留该Id 的最后一行。换句话说,id 754005 重复了两次,时间相同但Location 不同,所以保留最后一行意味着保留这一行
754005 13:19:00 IE578
2) 如果该Id 的时间值不同,则保留该Id 的具有最新时间值的行。也就是说,id980278有两个不同的时间值19:51:00,21:15:00,为这个id保留时间为21:15:00的行,因为这是最新的时间。
最终的数据集应该如下所示
Id Time Location
754005 13:19:00 IE578
980278 21:15:00 JB237
【问题讨论】: