【发布时间】:2021-07-27 23:52:59
【问题描述】:
我有一个数据框,其中一列包含一个长度不同的元组列表,这些元组代表产品代码,每个合同号都是索引。元组的长度在 1 到 22 之间变化。我使用groupby() 对相同长度的元组进行分组。
我使用df.get_group() 来访问每个长度的数据帧。每个 df 的行数从 1 到 80 不等。
例如对于元组 (123, 456, 789) 和 (123, 456, 213),我希望输出为:
[1]: (123, 456)
从这里我想将每个元组与数据框中其他元组的 x 数量进行比较,并打印出所有重复项。
我尝试过使用set(x) & set(y),但我不确定如何将它用于 x 行。
有没有更 Pythonic 的方式来做到这一点?
【问题讨论】:
标签: python pandas dataframe duplicates tuples