【发布时间】:2023-03-22 18:55:01
【问题描述】:
我正在使用 Spark Mlib 进行 kmeans 聚类。我有一组向量,我想从中确定最可能的聚类中心。所以我将在这个集合上运行 kmeans 聚类训练,并选择分配给它的向量数量最多的集群。
因此,我需要知道训练后分配给每个集群的向量数量(即 KMeans.run(...))。但我找不到从 KMeanModel 结果中检索此信息的方法。我可能需要在所有训练向量上运行predict 并计算出现最多的标签。
还有其他方法吗?
谢谢
【问题讨论】:
-
分层聚类还是 K-means?
-
嗨,这是kmeans。我已更新问题以使其更清晰
-
当您说“最可能的集群中心”时,您是指质心吗?
-
是的。
KMeans.run(parsedData, numClusters, numIterations)。假设我有 numClusters = 3。我想从 3 个结果集群中选择一个分配了大部分向量的集群
标签: apache-spark pyspark cluster-analysis k-means apache-spark-mllib