【发布时间】:2018-05-26 08:11:23
【问题描述】:
我必须对大量数据进行聚类分析。由于我有很多缺失值,我制作了一个相关矩阵。
corloads = cor(df1[,2:185], use = "pairwise.complete.obs")
现在我有问题如何继续。我阅读了很多文章和示例,但没有什么对我真正有用。我怎样才能知道有多少集群对我有好处?
我已经试过了:
dissimilarity = 1 - corloads
distance = as.dist(dissimilarity)
plot(hclust(distance), main="Dissimilarity = 1 - Correlation", xlab="")
我有一个情节,但它非常混乱,我不知道如何阅读它以及如何继续。它看起来像这样:
知道如何改进它吗?我实际上能从中得到什么?
我还想创建一个 Screeplot。我读到会有一条曲线,您可以在其中看到有多少集群是正确的。
我也进行了聚类分析,选择了 2-20 个聚类,但结果太长了,我不知道如何处理,不知道看什么重要。
【问题讨论】:
-
您可以任意确定簇的数量。如何确定聚类的数量是非常有争议的,但一些分析可以帮助你。看看
maptree包中的kgs函数。 -
我查了一下并读到它应该可以帮助您找到大量的集群。但我对这个主题完全陌生。作为集群和diss我必须输入什么?我的 corloads = cluster 和 diss = distance 吗? kgs (cluster, diss, alpha=1, maxclust=NULL)
标签: r statistics cluster-computing analysis dendrogram