【发布时间】:2022-07-12 21:37:59
【问题描述】:
我有一个如下所示的数据框:
| Timestamp | description |
|---|---|
| 0 | Parser starts |
| 12 | parsing |
| 24 | parsing |
| 26 | Parsing finished |
| 28 | Parser starts |
| 45 | Parsing finished |
我想计算每次解析花费的时间。因此,我想要(df['description'] == 'Parsing finished') 和(df['description'] == 'Parser starts') 的时间戳之间的差异。我知道我可以使用pd.diff(),但我只能找到如何在设定的时间段内使用它。我想根据描述值设置周期。
预期输出:
| Timestamp | description | difference |
|---|---|---|
| 0 | Parser starts | NaN |
| 12 | parsing | NaN |
| 24 | parsing | NaN |
| 26 | Parsing finished | 26 |
| 28 | Parser starts | NaN |
| 45 | Parsing finished | 19 |
我曾想过循环遍历每一行,但这在使用 Pandas 时似乎违反直觉。
【问题讨论】: