【发布时间】:2020-10-12 06:46:50
【问题描述】:
您好,我正在使用 python 对一些数据进行分类:
Articles Filename
A New Marine Ascomycete from Brunei. Invasive Species.csv
A new genus and four new species Forestry.csv
A new genus and four new species Invasive Species.csv
我想知道每个“文件名”有多少个独特的“文章”。
所以我想要的输出是这样的:
Filename Count_Unique
Invasive Species.csv 1
Forestry.csv 0
另外,我也想得到这个输出:
Filename1 Filename2 Count_Common articles
Forestry.csv Invasive Species.csv 1
我连接了数据集并最终计算了每个“文件名”中存在的元素。
有人愿意帮忙吗?我已经尝试过unique(), drop_duplicates() 等,但似乎无法获得所需的输出。
无论如何,这是我的代码的最后几行:
concatenated = pd.concat(data, ignore_index =True)
concatenatedconcatenated.groupby(['Title','Filename']).count().reset_index()
res = {col:concatenated[col].value_counts() for col in concatenated.columns}
res ['Filename']
【问题讨论】:
-
为什么“Forestry.csv”包含 0 篇独立文章?请定义您所说的“独特”是什么意思,因为它偏离了人们通常的看法。
-
Forestry.csv 的值为“0”,因为“Forestry.csv”和“Invasive Species.csv”中都出现了“一个新属和四个新物种”
标签: python group-by classification unique counter