【发布时间】:2020-02-05 06:19:24
【问题描述】:
我正在尝试创建一个函数,该函数可以查看 DataFrame 中的前几行,并根据一组要回顾的行数对它们求和。在这里,我使用了 3,但理想情况下,我想将其放大以回顾更多行。我的解决方案有效,但似乎效率不高。另一个标准是每次击中一个新团队时,计数必须重新开始,因此每个新团队的第一行始终为 0,数据将按团队顺序排序,但如果解决方案已知数据不存在的位置在团队秩序中,这将是不可思议的。 Pandas 中是否有可以帮助解决此问题的函数?
到目前为止,我已经尝试了下面的代码并尝试在谷歌上搜索问题,我能找到的最接近的例子是:here!但这对索引进行了分组,我不确定如何在每次遇到新团队时该值都必须不断重置时应用它,因为每次有新团队时它都不会区分。
np.random.seed(0)
data = {'team':['a','a','a','a','a','a','a','a','b','b',
'b','b','b','b','b','b','c','c','c','c','c','c','c','c'],
'teamPoints': np.random.randint(0,4,24)}
df = pd.DataFrame.from_dict(data)
df.reset_index(inplace=True)
def find_sum_last_3(x):
if x == 0:
return 0
elif x == 1:
return df['teamPoints'][x-1]
elif x == 2:
return df['teamPoints'][x-1] + df['teamPoints'][x-2]
elif df['team'][x] != df['team'][x-1]:
return 0
elif df['team'][x] != df['team'][x-2]:
return df['teamPoints'][x-1]
elif df['team'][x] != df['team'][x-3]:
return df['teamPoints'][x-1] + df['teamPoints'][x-2]
else:
return df['teamPoints'][x-1] + df['teamPoints'][x-2] +
df['teamPoints'][x-3]
df['team_form_3games'] = df['index'].apply(lambda x : find_sum_last_3(x))
函数的第一部分解决了由于元素少于 3 个而无法求和为 3 的边缘情况
函数的第二部分解决了“团队”变化的问题。当团队发生变化时,总和需要重新开始,因此每个“团队”都被单独考虑
最后一部分只是查看数据帧的前 3 个元素并将它们相加。
此示例按预期工作,并提供了一个具有预期输出的新列,如下所示:
0, 0, 3, 4, 4, 4, 6, 9, 0, 1, 4, 5, 6, 3, 5, 5, 0, 0, 0, 2, 3, 5, 6, 8
第一个元素是 0,因为它是边缘情况,第二个是 0,因为第一个元素的和是 0。第三个是 3,因为第一个和第二个元素的和是 3。第四个是第一个,第二个的和,第三。 5th 是 2nd,3rd,4th 的总和。 6th 是 3rd,4th,5th 的总和
但是,当扩展到 10 时,效率非常低,因此很难扩展到 10 或 15。它也很不优雅,需要为每个不同长度的总和编写一个新函数。
【问题讨论】: