【问题标题】:How to do group by and take count of unique and count of some value as aggregate on same column in python pandas?python - 如何在python pandas的同一列上进行分组并计算唯一性和某些值的计数作为聚合?
【发布时间】:2017-06-23 00:19:15
【问题描述】:

我的问题与我之前的Question 有关,但有所不同。所以我在问新问题。

在上述问题中,请参阅@jezrael 的答案。

df = pd.DataFrame({'col1':[1,1,1],
                   'col2':[4,4,6],
                   'col3':[7,7,9],
                   'col4':[3,3,5]})

print (df)
   col1  col2  col3  col4
0     1     4     7     3
1     1     4     7     3
2     1     6     9     5

df1 = df.groupby(['col1','col2']).agg({'col3':'size','col4':'nunique'})
df1['result_col'] = df1['col3'].div(df1['col4'])
print (df1)
           col4  col3  result_col
col1 col2                        
1    4        1     2         2.0
     6        1     1         1.0

现在我想计算 col4 的具体值。假设我还想在同一个查询中计算col4 == 3

df.groupby(['col1','col2']).agg({'col3':'size','col4':'nunique'}) ... + count(col4=='3')

如何在上述相同的查询中执行此操作,我尝试了以下但没有得到解决方案。

df.groupby(['col1','col2']).agg({'col3':'size','col4':'nunique','col4':'x: lambda x[x == 7].count()'})

【问题讨论】:

    标签: python mysql pandas numpy


    【解决方案1】:

    提前将col4==3 作为一列包含在内,从而进行一些预处理。然后使用aggregate

    df.assign(result_col=df.col4.eq(3).astype(int)).groupby(
        ['col1', 'col2']
    ).agg(dict(col3='size', col4='nunique', result_col='sum'))
    
               col3  result_col  col4
    col1 col2                        
    1    4        2           2     1
         6        1           0     1
    

    旧答案

    g = df.groupby(['col1', 'col2'])
    g.agg({'col3':'size','col4': 'nunique'}).assign(
        result_col=g.col4.apply(lambda x: x.eq(3).sum()))
    
               col3  col4  result_col
    col1 col2                        
    1    4        2     1           2
         6        1     1           0
    

    稍微重新排列

    g = df.groupby(['col1', 'col2'])
    final_df = g.agg({'col3':'size','col4': 'nunique'})
    final_df.insert(1, 'result_col', g.col4.apply(lambda x: x.eq(3).sum()))
    final_df
    
               col3  result_col  col4
    col1 col2                        
    1    4        2           2     1
         6        1           0     1
    

    【讨论】:

      【解决方案2】:

      我认为您需要 aggregate 并在 dict 中列出 col4 列中的函数。

      如果需要计算3 的值,最简单的就是sum True 中的x == 3 值:

      df1 = df.groupby(['col1','col2'])
              .agg({'col3':'size','col4': ['nunique', lambda x: (x == 3).sum()]})
      df1 = df1.rename(columns={'<lambda>':'count_3'})
      df1.columns = ['{}_{}'.format(x[0], x[1]) for x in df1.columns]
      print (df1)
                 col4_nunique  col4_count_3  col3_size
      col1 col2                                       
      1    4                1             2          2
           6                1             0          1
      

      【讨论】:

      • 让我检查一下。以及如何为两个结果指定不同的列名?
      • 互联网上有什么东西可以让我获取这些小数据并在上面执行 pandas 吗?
      • 我认为没有这样的免费服务。
      • 这个答案也是正确的,但我在 group by 之前使用了@piRSquared 的 .assign() 方法,所以我接受了他的答案。谢谢..
      猜你喜欢
      • 1970-01-01
      • 2017-02-22
      • 1970-01-01
      • 1970-01-01
      • 2017-07-24
      • 2014-03-31
      • 1970-01-01
      • 2018-10-28
      • 1970-01-01
      相关资源
      最近更新 更多