【发布时间】:2021-09-20 04:17:18
【问题描述】:
我有 2 个包含名称列表的数据集。 1 个数据集还具有其他名称没有的额外名称,而另一个具有重复名称。我的目标是创建一个列出所有差异并排除匹配项的第三个数据框
考虑这些数据框:
df =
Full name
dan lastname1
dan lastname1
bill lastname2
bob lastname3
brad lastname4
df2=
Full name
daniel lastname1
william lastname2
robert lastname3
bradley lastname4
Jane lastname5
d3 =
Full name match
daniel lastname1 dan lastname1
william lastname2 bill lastname2
robert lastname3 bob lastname3
bradley lastname4 brad lastname4
Jane lastname5 NaN
我尝试合并数据框并删除重复项,但没有运气。我认为多余的名字和昵称会让人失望。
【问题讨论】:
-
你能用你预期的 df3 更新你的帖子吗?
-
你可以得到
df1[~df1['Full name'].isin(df2['Full name'])].drop_duplicates().reset_index(drop=True)的匹配值。
标签: python regex pandas dataframe