【发布时间】:2018-10-03 08:47:36
【问题描述】:
我有一个包含 163 列(变量)和 199566 行(数据)的数据集。 那么如何消除冗余数据? 我可以通过使用正态分布来做到这一点吗?
【问题讨论】:
-
我们的信息太少了。你尝试了什么,有错误吗?你应该看看这里:stats.stackexchange.com/a/6800
-
欢迎来到 StackOverflow。为了提出更好的问题,请阅读How to ask a good question 和Minimal, Complete, and Verifiable Example 和How to make a great R reproducible example。
-
举一个数据例子和你到目前为止做了什么
-
“规范化”表示“消除冗余数据”。但“冗余”视情况而定。在这种情况下,是什么让数据“冗余”?什么是的情况?你想要完成什么以及你是如何完成它的?
标签: r bigdata normalization redundancy