【发布时间】:2020-03-01 11:50:22
【问题描述】:
这是我目前的代码
import pandas as pd
from io import StringIO
data = StringIO("""
"name1","hej","7aa","a"
"name1","du","71al","a"
"name1","aj","74a","a"
"name1","oj","7aj","a"
"name2","fin","7ag","a"
"name2","katt","7a","a"
""")
df = pd.read_csv(data, header=0, names=["name","text2","text","as"])
df[['text2','text','as']] = df.groupby(['name']).transform(lambda
x: ','.join(x))
df = df[['name','text','text2','as']].drop_duplicates()
df
让我走得更远。
df
name text text2 as
0 name1 71al,74a,7aj du,aj,oj a,a,a
3 name2 7ag,7a fin,katt a,a
我只需要一行来检查每个列 ['text','text2','as'],如果所有逗号分隔的元素都相同,则只返回第一个
所以我想要的结果是
df
name text text2 as
0 name1 71al,74a,7aj du,aj,oj a
3 name2 7ag,7a fin,katt a
我尝试过使用 split(',') 应用。无法让它工作。
我将这篇文章添加为第一个 cmets。我没有正确描述我的问题
如果我的 df 是这样的:
df
name text text2 as
0 name1 71al,74a,7aj du,aj,oj a,b,a
3 name2 7ag,7a fin,katt a,a
我需要修改为:
df
name text text2 as
0 name1 71al,74a,7aj du,aj,oj a,b,a
3 name2 7ag,7a fin,katt a
不是:
df
name text text2 as
0 name1 71al,74a,7aj du,aj,oj a,b
3 name2 7ag,7a fin,katt a
谢谢
这是我的最终解决方案:
data = StringIO("""
"name1","hej","7aa","a"
"name1","du","71al","b"
"name1","aj","74a","a"
"name1","oj","7aj","a"
"name2","fin","7ag","a"
"name2","katt","7a","a"
""")
df = pd.read_csv(data, header=0, names=["name","text2","text","as"])
df[['text2','text','as']] = df.groupby(['name']).transform(lambda x: ','.join(x))
df = df[['name','text','text2','as']].drop_duplicates()
for col in df.columns:
df[col] = df[col].str.split(',').map(lambda x: ','.join(set(x) if len(set(x)) == 1 else x))
df
我不得不求助于迭代。我无法使用 agg 获得预期的结果。此外,如果有人可以在这里向我解释 len(set(x)) == 1 的方式,那将不胜感激(由于逗号,它应该至少为 2 吗?)
【问题讨论】:
标签: python-3.x pandas if-statement lambda apply