【发布时间】:2017-02-13 13:53:18
【问题描述】:
我有一个数据集,我需要在其中计算与数据集上每个人相关的指标。例如,我有一个数据框,其中的数据看起来像这样
id name age task_date task_venue money_earned
1 John 25 2016-05-01 A 100
2 Jane 28 2016-05-12 A 120
1 John 25 2016-05-03 B 150
3 Suse 21 2016-05-30 B 200
...
所以,我需要做的是计算每个人John, Jane, Suse 等的指标,例如Time Since Last Task、Average Earnings、Total Earnings、Total Tasks Done 等。
真正的数据集很大(大约 100 万行,列更多,约 50 和约 75K 人),但这基本上解释了我需要做什么。
获取此数据框并进行这些计算的最有效方法是什么?我更喜欢使用 pandas 函数,但只要我可以将结果保存在另一个数据框中,纯 python 也可以工作?
【问题讨论】:
标签: python pandas optimization data-analysis data-science