【发布时间】:2021-07-25 07:56:05
【问题描述】:
我有一个看起来像这样的数据集。
datetime id
2020-01-22 11:57:09.286 UTC 5
2020-01-22 11:57:02.303 UTC 6
2020-01-22 11:59:02.303 UTC 5
ID 不是唯一的,并且会给出不同的日期时间值。比方说:
持续时间 = max(datetime)-min(datetime)。
我想计算持续时间 max(datetime)-min(datetime) 小于 2 秒的 id。所以,例如我会输出:
count = 1
因为 id 5。然后,我想创建一个新数据集,其中只包含每个唯一 id 的 min(datetime) 值的那些行。因此,新数据集将包含第一行但不包含第三行。最终的数据集不应有任何重复的 id。
datetime id
2020-01-22 11:57:09.286 UTC 5
2020-01-22 11:57:02.303 UTC 6
我该怎么做?
P.S:我提供的数据集可能不是一个很好的例子,因为条件是 2 秒,但这里是以分钟为单位的
【问题讨论】:
-
您应该发布原始数据帧,根据该数据帧导出例外输出。不可能进行逆向工程
-
那是原始数据框,我需要这个@anky 的输出
-
你能看到编辑吗? @anky
标签: python pandas dataframe datetime data-analysis