【问题标题】:Clustering with correlated variables用相关变量聚类
【发布时间】:2014-02-18 06:39:50
【问题描述】:

我正在做聚类分析。有很多变量相互关联。我想知道,包括相关变量可以吗?这种情况该怎么办?

提前致谢

【问题讨论】:

  • 您可以在聚类之前对数据集运行 PCA 以消除线性相关性。
  • 我从未使用过 PCA,这种方法会删除相关变量吗?你能详细说明一下吗?

标签: statistics cluster-analysis


【解决方案1】:

首先,显而易见的方法:

  • 评估您是否需要所有这些,或者可以放弃其中一些

  • 通过执行 PCA 美白(去相关)您的数据,这无论如何都是 k-means 的最佳实践

其次,您可能需要研究相关聚类,它会尝试识别在您的数据集中表现出不同相关性的聚类。当您的数据不是全局相关时,白化不会删除这些局部相关性。相关聚类旨在发现这些模式。

【讨论】:

  • 我没用过PCA,这个方法会选择不相关的数据吗?
  • PCA 不选择数据。它计算一个投影矩阵,这样在投影您的数据之后,您的协方差矩阵就是单位矩阵。如果您的数据已经去相关,PCA 可能会将单位矩阵作为投影返回。
  • 所以你的意思是,我可以选择使用 PCA 不相关的变量?
  • PCA 不选择变量。它使用矩阵乘法投影数据。显然,矩阵乘法与选择特征是不一样的。
【解决方案2】:

如果变量高度相关,建议删除它们。

无论聚类算法或链接方法如何,您通常遵循的一件事是找到点之间的距离。保持高度相关的变量几乎会给它们更多,计算两点之间距离的权重加倍(由于所有变量都被归一化,效果通常会加倍)。

简而言之,影响集群形成的变量强度增加了。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-10-01
    • 2010-11-30
    • 1970-01-01
    • 2015-11-10
    • 2015-06-12
    • 2016-02-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多