【问题标题】:pandas groupby and update with min valuepandas groupby 并用最小值更新
【发布时间】:2018-07-17 07:31:09
【问题描述】:

我的数据框:

dfd = pd.DataFrame({'A': ['Apple','Apple', 'Apple','Orange','Orange','Orange','Pears','Pears'],
                    'B': [1,2,9,6,4,3,2,1]
                   })
       A    B
0   Apple   1
1   Apple   2
2   Apple   9
3   Orange  6
4   Orange  4
5   Orange  3
6   Pears   2
7   Pears   1

预期:

   A    new_B   old_B
0   Apple   1   1
1   Apple   1   2
2   Apple   1   9
3   Orange  3   6
4   Orange  3   4
5   Orange  3   3
6   Pears   1   2
7   Pears   1   1

预期数据框:new_values 包含该组的最小值,对于 Apple,B 列的最小值为 1,因此 Apple 的所有新值为 1,同样,B 列的 Orange 最小值为 3,在 new_b 中被替换柱子。

第二个预期输出: 一旦达到上述预期输出,我必须为每个组创建 sql 语句并写入文件: 基本上,迭代每一行并编写sql查询:

sql_query= "update test_tbl "\
    "set id =  {0}"\
    "where id = {1}"\
    "and A = '{2}' ".format(new_b,old_b,A)

print(sql_query, file=open("output.sql", "a"))

【问题讨论】:

  • 使用df.groupby('A').apply(min)

标签: python pandas pandas-groupby


【解决方案1】:

GroupBy.transform 用于Series,大小与原始df 相同:

dfd['new_B'] = dfd.groupby('A')['B'].transform('min')
print (dfd)
        A  B  new_B
0   Apple  1      1
1   Apple  2      1
2   Apple  9      1
3  Orange  6      3
4  Orange  4      3
5  Orange  3      3
6   Pears  2      1
7   Pears  1      1

如果列的顺序很重要,请使用insertrename

dfd.insert(1, 'new_B', dfd.groupby('A')['B'].transform('min'))
dfd = dfd.rename(columns={'B':'old_B'})
print (dfd)
        A  new_B  old_B
0   Apple      1      1
1   Apple      1      2
2   Apple      1      9
3  Orange      3      6
4  Orange      3      4
5  Orange      3      3
6   Pears      1      2
7   Pears      1      1

如果transform 不可能使用这里是替代解决方案:

#aggregate by min
s = dfd.groupby('A')['B'].min()
print (s)
A
Apple     1
Orange    3
Pears     1
Name: B, dtype: int64

#insert and map
dfd.insert(1, 'new_B', dfd['A'].map(s))
dfd = dfd.rename(columns={'B':'old_B'})
print (dfd)
        A  new_B  old_B
0   Apple      1      1
1   Apple      1      2
2   Apple      1      9
3  Orange      3      6
4  Orange      3      4
5  Orange      3      3
6   Pears      1      2
7   Pears      1      1

【讨论】:

  • 我必须使用每个组的旧值和新值创建 sql 查询,是否有任何替代方法来代替遍历每一行?
  • @min2bro - 我不明白,为什么要迭代? transform 不能用吗?
  • @min2bro - 添加了聚合替代解决方案和map
  • @min2bro - 不幸的是sql 对我来说很难,所以我不知道。但在我看来,最好的方法是将输出 DataFrame 添加到 sql 表中,然后在纯 sql 中使用左连接。
  • @tommy.carstensen - 它创建由每个组的最小值填充的新列,因此所有其他列都不会更改。如果聚合 min 则行数会减少,换句话说,由于聚合,行数会比原来的少。
【解决方案2】:

我认为下面的脚本适用于它

import pandas as pd

dfd = pd.DataFrame({'A': ['Apple','Apple', 'Apple','Orange','Orange','Orange','Pears','Pears'],
                    'B': [1,2,9,6,4,3,2,1]
                   })

dfd_1 = dfd.groupby(['A'], as_index=False).agg({'B': 'min'})

dfd = pd.merge(dfd_1, dfd, how='left', left_on=['A'], right_on=['A'])

dfd.columns = ['A', 'new_B','old_B']

【讨论】:

  • 更新了我的问题。
猜你喜欢
  • 2022-11-25
  • 1970-01-01
  • 2021-12-15
  • 1970-01-01
  • 1970-01-01
  • 2017-08-05
  • 1970-01-01
  • 2019-06-25
相关资源
最近更新 更多