【发布时间】:2020-06-26 05:27:54
【问题描述】:
我正在对数据集执行 K-means 聚类,但我有可用的地面实况标签。我在聚类过程中使用它们来查找 V-Measure 和 Adjusted Rand 分数以获得最佳 K。
为了评估我的最佳模型,我希望每个已知标签都有一个指标来描述它的聚类程度 - 几乎类似于纯度分数,但标签分布在多个集群中。
例如,标签 0 有 5 个数据点,因此我们有以下内容:
true_labels = [0,0,0,0,0]
cluster_numbers = [1,1,1,1,1](即所有标签 0 点都在同一个簇中)
--> 应该返回 1.0 的满分
如果标签的点像这样分布在多个集群中
cluster_numbers = [0,0,0,1,1]
--> 返回分数为0.6
是否有人知道可用于评估聚类中每个基本事实标签的指标?这不必与我上面给出的示例相同。
【问题讨论】:
标签: algorithm machine-learning statistics cluster-analysis