【发布时间】:2018-05-29 22:10:10
【问题描述】:
我正在处理一个包含 93 列的数据集,其中许多列有很大比例的缺失值。我正在寻找一种方法来简化筛选每一列的缺失值百分比,然后返回高于该阈值的变量名称列表以包含在新数据集中。
我有一个检查缺失值并返回缺失百分比的函数:
#check for missing data
pMiss <- function(x) {
sum(is.na(x))/length(x)*100
}
#percent of data missing per column
x <- apply(dt2,2,pMiss)
如何检索缺失值百分比小于 20% 的列的所有名称 [来自 x]?我想将这些名称检索为可以粘贴到新数据集中的列表,因此我不必手动复制和粘贴 x.xml 中的每个名称。
提前谢谢你。
【问题讨论】:
标签: r function missing-data