【问题标题】:Determining how to quickly classify columns in huge datasets as factors确定如何将庞大数据集中的列快速分类为因子
【发布时间】:2016-03-11 21:48:15
【问题描述】:

这里没有很好的例子,因为我正在使用的数据集非常庞大。

但如果我有一个 200,300 多列的数据集,我希望有某种规则来快速分类并将其中一些列转换为因子。是否有一些快速的 R 代码可以做到这一点?

原因是我没有时间逐列完全理解或解释数据,但如果我看到 5000 行中只有唯一的 4 个值,我认为这是分类数据。

任何人有任何快速的代码 sn-ps 或方法来做到这一点?

【问题讨论】:

    标签: r apply r-caret categorical-data data-cleaning


    【解决方案1】:

    假设 df 指的是您的数据框:

    ## Find all columns with less than 5 unique values
    cols <- apply(df, 2, FUN = function(x) length(unique(x))) < 5
    
    ## Convert columns with less than 5 unique values to factor
    df[cols] <- lapply(df[cols], factor)
    

    【讨论】:

      猜你喜欢
      • 2021-01-26
      • 1970-01-01
      • 2022-01-09
      • 1970-01-01
      • 2015-03-07
      • 1970-01-01
      • 2015-11-08
      • 1970-01-01
      • 2013-07-14
      相关资源
      最近更新 更多