【发布时间】:2015-02-17 04:57:29
【问题描述】:
我需要对一些数据进行聚类,我用 R 尝试了 kmeans、pam 和 clara。
问题是我的数据在数据框的列中,并且包含 NA。
我使用na.omit() 来获取我的集群。但是,我怎样才能将它们与原始数据相关联?这些函数返回一个没有 NA 的整数向量,并且它们不保留有关原始位置的任何信息。
是否有一种巧妙的方法可以将集群与数据框中的原始观察结果相关联? (或者在存在 NA 时智能地执行聚类的方法?)
谢谢
【问题讨论】:
-
你给你的行命名了吗?我认为 kmeans 和 pam (至少)保留了行名,不是吗?
-
我这样做:kmeans(na.omit(x), k)
-
簇向量(例如
clus$cluster)对应于x的非NA元素。所以clus$cluster的元素对应的x的索引是which(!is.na(x))。
标签: r cluster-analysis k-means na missing-data