【发布时间】:2014-02-18 06:39:50
【问题描述】:
我正在做聚类分析。有很多变量相互关联。我想知道,包括相关变量可以吗?这种情况该怎么办?
提前致谢
【问题讨论】:
-
您可以在聚类之前对数据集运行 PCA 以消除线性相关性。
-
我从未使用过 PCA,这种方法会删除相关变量吗?你能详细说明一下吗?
标签: statistics cluster-analysis
我正在做聚类分析。有很多变量相互关联。我想知道,包括相关变量可以吗?这种情况该怎么办?
提前致谢
【问题讨论】:
标签: statistics cluster-analysis
首先,显而易见的方法:
评估您是否需要所有这些,或者可以放弃其中一些
通过执行 PCA 美白(去相关)您的数据,这无论如何都是 k-means 的最佳实践
其次,您可能需要研究相关聚类,它会尝试识别在您的数据集中表现出不同相关性的聚类。当您的数据不是全局相关时,白化不会删除这些局部相关性。相关聚类旨在发现这些模式。
【讨论】:
如果变量高度相关,建议删除它们。
无论聚类算法或链接方法如何,您通常遵循的一件事是找到点之间的距离。保持高度相关的变量几乎会给它们更多,计算两点之间距离的权重加倍(由于所有变量都被归一化,效果通常会加倍)。
简而言之,影响集群形成的变量强度增加了。
【讨论】: