【发布时间】:2020-12-10 08:04:15
【问题描述】:
我有 2 列,分别称为 decision1 和 decision2。
我想比较它们以获得两者之间的最高出现率,所以我要么在决策 1 或决策 2 中获得最高出现率,要么根据最大的一个。到目前为止,我的尝试导致了这一点,但没有成功,因为我只是在 EACH 列中获得最高的出现次数而不是合并
# weightage option
if args['weightage'] == "yes":
attr1 = data['decision'].value_counts().idxmax #highest occurrence in decision
attr2 = data['decision2'].value_counts().idxmax #highest occurrence in decision2
heaviest_attribute = data.groupby(['decision','decision2']).size()
理想情况下,我只需要在attr1 和attr2 之间使用某种max() 函数,但我不知道如何处理。
例如,给定这张表
我想比较决策 1 和决策 2 列,就好像它们是一列一样,在这种情况下,预期的输出将是“是”,因为它是最经常出现的值。
【问题讨论】:
-
你觉得
data.groupby(['decision','decision2']).size().idxmax吗? -
你能添加一些数据样本和预期输出吗?
-
非常感谢您提供示例输入输出以更好地了解您的问题
-
感谢您的反馈,我添加了一个示例表作为参考
标签: python pandas multiple-columns