【发布时间】:2018-03-29 17:29:26
【问题描述】:
我正在使用来自https://www.kaggle.com/c/titanic 的泰坦尼克号数据集。
我想制作不同的年龄组,例如“0-4”、“1-5”、“2-6”、“3-7”等,并找出存活百分比为最高。我的年龄组在整数区间 [0,80] 内。原始数据集中的“年龄”列也包括 NA。 “幸存”列包含该人是否幸存的信息(0 = 否,1 = 是)。
我试图像这样解决这个问题,但没有奏效。如有任何帮助,我将不胜感激。
for(i in 0:80){
max= -Inf
x[i]<-(sum(subset(dataset, Age < (i+5) & Age >= i, select = "Survived")))/(length(which(dataset$Age < (i+5) & dataset$Age>= i)))
if (x[i] > max) max <- x[i]
return(max, i, i+5)}
【问题讨论】:
-
您的群组重叠,
"0-4", "1-5", "2-6", "3-7"。Age == 3的值属于哪个组,所有这些? -
是的,Age == 3 分为几个年龄段。我明白这很荒谬。但是,如果有任何可能编写一个循环或用这样的组制作一个表格,以找出每个年龄组的存活率,step=5?
标签: r data.table grouping aggregation categorization