【问题标题】:Count values, keep duplicates with Pandas计数值,使用 Pandas 保留重复项
【发布时间】:2020-03-16 20:40:02
【问题描述】:

我有这个 ID 数据集,位于 GUID 的 A 列(250,000 个值)。我需要计算该列中每个 GUID 出现的次数,然后将其作为另一列包含在数据集中。问题是使用 .value_counts() 和 pandas 给了我一个列表,但删除了重复项。由于我想将新计数数据集与旧数据集对齐,因此列表不对齐。

import os
import pandas as pd

path = (r"D:\\Users\\cdoyle\Desktop\\Final2_.xlsx")
df = pd.read_excel(path)
df = df[['Data BoundingBoxGUID', 'Data Line', 'Data Remove Item:', 'Data Status:', 'Model']]
df2 = df['Data BoundingBoxGUID'].value_counts()


df_output = pd.concat([df,df2], axis=1)

【问题讨论】:

  • 您需要将value_counts的结果与原始DF连接起来才能将其复制到所有行中。

标签: python pandas


【解决方案1】:

我们通常做transform

df['new'] = df.groupby('Data BoundingBoxGUID')['Data BoundingBoxGUID'].transform('count')

【讨论】:

  • 非常感谢@WeNYoBen,这条线会在 df_output 线之前吗?
  • @cd-6 是的,是的
猜你喜欢
  • 2018-03-28
  • 1970-01-01
  • 2019-06-10
  • 2019-09-16
  • 1970-01-01
  • 1970-01-01
  • 2014-03-28
  • 2015-12-16
  • 2013-07-10
相关资源
最近更新 更多