【发布时间】:2015-07-13 12:03:57
【问题描述】:
我有一个包含 22000 行和 25 列的大型数据集。我正在尝试根据其中一列对我的数据集进行分组,并根据分组数据集获取另一列的最小值。但是,问题是它只给了我两列包含分组列和具有最小值的列......但是我需要与具有最小值的行相关的其他列的所有信息。 这是一个简单的示例,只是为了使其可重现:
data<- data.frame(a=1:10, b=c("a","a","a","b","b","c","c","d","d","d"), c=c(1.2, 2.2, 2.4, 1.7, 2.7, 3.1, 3.2, 4.2, 3.3, 2.2), d= c("small", "med", "larg", "larg", "larg", "med", "small", "small", "small", "med"))
d<- data %>%
group_by(b) %>%
summarise(min_values= min(c))
d
b min_values
1 a 1.2
2 b 1.7
3 c 3.1
4 d 2.2
因此,我还需要与列 a 和 d 相关的信息,但是,由于 c 列中的值有重复项,因此我无法根据 min_value 列合并它们...我想知道是否有任何使用 dplyr 包时保留其他列信息的方法。
我在这里“dplyr: group_by, subset and summarise”和“Finding percentage in a sub-group using group_by and summarise”找到了一些解释,但没有一个能解决我的问题。
【问题讨论】:
-
您究竟如何建议生成的 data.frame 的外观?压缩成单行后其他数据的外观如何?