【问题标题】:What to do if there is only one data point in a cluster when using K-Means clustering?使用 K-Means 聚类时,如果一个集群中只有一个数据点怎么办?
【发布时间】:2020-03-17 05:23:17
【问题描述】:

我正在使用二等分 K-Means,它利用 k=2 的 k-means,我在 1 个集群中只遇到了 1 个数据点。这是否意味着 K-Means 过程应该停止,因为它已经达到收敛,或者我应该使用新值重新开始算法过程?

【问题讨论】:

标签: cluster-computing cluster-analysis k-means bisection


【解决方案1】:

1-element clusters 在 k-means 中非常频繁地出现在脏数据上。

由于 k-means 可最大限度地减少平方误差,因此将离群点分配给它们自己的集群会在平方误差目标方面给出“最佳”结果。所以这通常正确的结果 - 这不是用户真正想要的。用户通常更喜欢非平方优化(例如,使用 PAM),或者具有不属于集群的“噪声”点概念的方法(例如,DBSCAN)。

【讨论】:

  • 这并不能真正回答问题。我应该如何处理结果
  • 那么您可能需要更好地澄清您的问题。你不需要对结果做任何事情吗?
猜你喜欢
  • 1970-01-01
  • 2018-08-14
  • 2021-04-19
  • 2010-11-22
  • 2016-01-01
  • 2020-01-18
  • 2017-09-01
  • 2017-07-28
  • 1970-01-01
相关资源
最近更新 更多