【问题标题】:Pandas timestamp difference in groupby transform分组转换中的熊猫时间戳差异
【发布时间】:2017-07-04 18:51:44
【问题描述】:

我有一个带有整数索引、session_id、事件和时间戳的数据框,如下所示:

In [41]: df = pd.DataFrame(data={'session_id': np.sort(np.random.choice(np.arange(3), 11)), 'event': np.random.choice(['A', 'B', 'C', 'D'], 11), 'time_stamp': pd.date_range
    ...: ('1/1/2017', periods=11, freq='S')}).reset_index(drop=True)

In [42]: df
Out[42]:
   event  session_id          time_stamp
0      B           0 2017-01-01 00:00:00
1      C           0 2017-01-01 00:00:01
2      D           0 2017-01-01 00:00:02
3      B           1 2017-01-01 00:00:03
4      B           1 2017-01-01 00:00:04
5      D           2 2017-01-01 00:00:05
6      B           2 2017-01-01 00:00:06
7      A           2 2017-01-01 00:00:07
8      B           2 2017-01-01 00:00:08
9      B           2 2017-01-01 00:00:09
10     A           2 2017-01-01 00:00:10

我想使用groupby by 和lambda 函数计算会话长度,但我想返回一个索引与原始数据帧相同的系列对象,以便将其添加为列。像这样groupby.transform 应该可以做到这一点,但它会返回一个奇怪的“无法将对象转换为 numpy 日期时间”错误:

In [44]: df.groupby('session_id')['time_stamp'].transform(lambda x: x.max() - x.min())
---------------------------------------------------------------------------
ValueError                                Traceback (most recent call last)
<ipython-input-44-c67ed1d4a90e> in <module>()
----> 1 df.groupby('session_id')['time_stamp'].transform(lambda x: x.max() - x.min())

/Users/hendele/anaconda2/lib/python2.7/site-packages/pandas/core/groupby.pyc in transform(self, func, *args, **kwargs)
   2843
   2844             indexer = self._get_index(name)
-> 2845             result[indexer] = res
   2846
   2847         result = _possibly_downcast_to_dtype(result, dtype)

ValueError: Could not convert object to NumPy datetime

我以为我用错了,但是当你使用 groupby.agg 时,它起作用了!

In [43]: df.groupby('session_id')['time_stamp'].agg(lambda x: x.max() - x.min())
Out[43]:
session_id
0   00:00:02
1   00:00:01
2   00:00:05
Name: time_stamp, dtype: timedelta64[ns]

您能否解释一下这是否是错误,如果不是,我做错了什么?谢谢!

附言不想使用时间戳索引,因为我可能在实际数据中有重复的时间戳。

【问题讨论】:

  • PR 已经合并,修复应该在0.20.0

标签: python pandas numpy timestamp split-apply-combine


【解决方案1】:

为什么agg 工作,但transform 失败?

这两种行为的区别在于transform() 操作需要返回一个like-indexed。为方便起见,transform 从原始系列的副本开始。然后,在每个组的计算之后,将复制系列的适当元素设置为等于结果。此时进行类型比较,发现timedelta 不能转换为datetimeagg() 不执行此步骤,因此不会导致类型检查失败。

解决方法:

此分析建议解决方法。如果transform 的结果是datetime,它将成功。所以要解决:

base_time = df['time_stamp'][0]
df.groupby('session_id')['time_stamp'].transform(
    lambda x: x.max() - x.min() + base_time) - base_time

这是一个错误吗?

我认为这是一个错误,我计划在早上提交一个问题。我将在这里更新问题链接。

更新:

我已为此问题提交了bugpull request

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-04-16
    • 2014-10-28
    • 2016-03-27
    • 2011-12-24
    • 2018-10-10
    • 2019-04-26
    • 1970-01-01
    • 2022-07-21
    相关资源
    最近更新 更多