【发布时间】:2013-04-15 23:29:05
【问题描述】:
我正在使用 K-Means 和聚类分析 WEKA。
一般来说,我会检查项目数据集上的不同算法。
我无法决定应该选择什么最佳 SSE/集群比率。
理论上,当我增加集群时,SSE 会降低,但是直到哪里?
找到了一些 K = (n/2)^0.5 的手指规则,任何人都可以支持这个吗?
【问题讨论】:
标签: cluster-analysis weka k-means
我正在使用 K-Means 和聚类分析 WEKA。
一般来说,我会检查项目数据集上的不同算法。
我无法决定应该选择什么最佳 SSE/集群比率。
理论上,当我增加集群时,SSE 会降低,但是直到哪里?
找到了一些 K = (n/2)^0.5 的手指规则,任何人都可以支持这个吗?
【问题讨论】:
标签: cluster-analysis weka k-means
请注意,Weka 没有很多集群。它主要是一个分类工具。
平方和是一个非常以k-means为中心的度量。不要费心将此度量与任何其他算法一起使用。这是过拟合:这是 k-means 优化的度量,所以它当然会最好(通过添加另一个集群,它将能够进一步改进这个度量,这不足为奇)。
如果您想评估聚类的质量,最可靠(尽管也值得怀疑)的方法是使用带标签的数据集。
【讨论】: