【发布时间】:2020-03-13 06:56:56
【问题描述】:
normal = []
nine_plus []
tw_plus = []
for i in df['SubjectID'].unique():
x= df.loc[df['SubjectID']==i]
if(len(x['Year Term ID'].unique())<=8):
normal.append(i)
elif(len(x['Year Term ID'].unique())>=9 and len(x['Year Term ID'].unique())<13):
nine_plus.append(i)
elif(len(x['Year Term ID'].unique())>=13):
tw_plus.append(i)
您好,我正在处理一个包含 1000 万行的数据集。该数据集是关于学生记录的,我试图根据学生参加的学期数将他们分为三组。我觉得我现在正在使用非常粗略的方法,并且可能有更有效的分类方式。有什么建议吗?
【问题讨论】:
-
您可以在每个循环中计算一次
len(x['Year Term ID'].unique()),而不是 1-4 次。 -
请为此提供更多上下文。我们现在甚至无法测试潜在的解决方案。