【问题标题】:Cleaning unnecessary variable in big data by using R使用 R 清理大数据中不必要的变量
【发布时间】:2018-10-03 08:47:36
【问题描述】:

我有一个包含 163 列(变量)和 199566 行(数据)的数据集。 那么如何消除冗余数据? 我可以通过使用正态分布来做到这一点吗?

【问题讨论】:

标签: r bigdata normalization redundancy


【解决方案1】:

也许可以试试dimensionality reduction methods,例如PCA。它将帮助您减少列的数量,就好像我正确理解是您想要实现的那样。

如果您以前没有使用过它们,您可能需要详细了解这些技术的具体作用,但以上内容将帮助您入门。

【讨论】:

    猜你喜欢
    • 2022-01-09
    • 2014-07-17
    • 2015-11-10
    • 2017-08-12
    • 2021-06-02
    • 1970-01-01
    • 2018-01-13
    • 2012-06-26
    相关资源
    最近更新 更多