@Chase 和 @bill_080 在 cmets 中建议的通用解决方案需要一点点改进才能(部分)满足 OP 的需求。
一个可重现的例子:
require(MASS)
set.seed(1)
dat <- data.frame(mvrnorm(100, mu = c(2,6,3),
Sigma = matrix(c(10, 2, 4,
2, 3, 0.5,
4, 0.5, 2), ncol = 3)))
使用欧式距离计算标准化数据的相异矩阵
dij <- dist(scale(dat, center = TRUE, scale = TRUE))
然后使用组平均法计算这些数据的层次聚类
clust <- hclust(dij, method = "average")
接下来,我们根据从树状图中形成 3 ('k') 个组来计算样本的排序,但我们可以在这里选择其他东西。
ord <- order(cutree(clust, k = 3))
接下来根据树状图计算样本之间的差异,即相关距离:
coph <- cophenetic(clust)
这里有 3 个图像图:
- 根据聚类分析分组排序的原始相异矩阵,
- 共相距离,再次按上述排序
- 原始差异与共生距离之间的差异
- 比较原始距离和共生距离的 Shepard 式图;捕获原始距离的聚类效果越好,点越接近 1:1 线
这是生成上述图的代码
layout(matrix(1:4, ncol = 2))
image(as.matrix(dij)[ord, ord], main = "Original distances")
image(as.matrix(coph)[ord, ord], main = "Cophenetic distances")
image((as.matrix(coph) - as.matrix(dij))[ord, ord],
main = "Cophenetic - Original")
plot(coph ~ dij, ylab = "Cophenetic distances", xlab = "Original distances",
main = "Shepard Plot")
abline(0,1, col = "red")
box()
layout(1)
这会在活动设备上产生:
话虽如此,但只有 Shepard 图显示了“聚类数据与 [dis] 相似性矩阵之间的相关性”,而这不是图像图(水平图)。您建议如何计算两个数字之间的相关性,以便对共同和原始 [dis] 相似性进行所有成对比较?