【发布时间】:2021-05-13 12:25:37
【问题描述】:
我有一个 pandas 数据框,其中包含根据一列 (ID) 的重复项,但在其他几列中具有不同的值。我的目标是根据 ID 删除重复项,但连接其他列中的信息。
这是我正在使用的示例:
ID Age Gender Form Signature Level
000 30 M Paper Yes A
000 30 M Electronic No B
001 42 Paper No B
处理后,我希望数据看起来像这样:
ID Age Gender Form Signature Level
000 30 M Paper, Electronic Yes, No A, B
001 42 Paper No B
首先,我用“Not Noted”填充了 nAn 单元格,以便可以使用 groupby 函数。我尝试了以下代码:
df = df.groupby(['ID', 'Age', 'Gender'])['Form'].apply(set).reset_index()
这负责连接表单列,但我不知道如何合并签名和级别列。有人有什么建议吗?
【问题讨论】:
标签: python pandas dataframe duplicates pandas-groupby