【问题标题】:Data Mining SSE Via Clusters K通过集群 K 进行数据挖掘 SSE
【发布时间】:2013-04-15 23:29:05
【问题描述】:

我正在使用 K-Means 和聚类分析 WEKA。
一般来说,我会检查项目数据集上的不同算法。
我无法决定应该选择什么最佳 SSE/集群比率。
理论上,当我增加集群时,SSE 会降低,但是直到哪里?
找到了一些 K = (n/2)^0.5 的手指规则,任何人都可以支持这个吗?

【问题讨论】:

    标签: cluster-analysis weka k-means


    【解决方案1】:

    请注意,Weka 没有很多集群。它主要是一个分类工具。

    平方和是一个非常以k-means为中心的度量。不要费心将此度量与任何其他算法一起使用。这是过拟合:这是 k-means 优化的度量,所以它当然会最好(通过添加另一个集群,它将能够进一步改进这个度量,这不足为奇)。

    如果您想评估聚类的质量,最可靠(尽管也值得怀疑)的方法是使用带标签的数据集。

    【讨论】:

    • 我已经读到我可能会使用 MakeDensityBasedClusterer 来查找对数可能性,但同样,如果我增加集群,可能性会增加(例如,5 给出 -28,8 给出 -27,10 给出 - 25)
    • 是的。这是内部评估的典型特征。您需要权衡取舍,因为更复杂的模型通常会允许更详细(但不一定更好!)的数据模型。一些措施(BIC?)试图做出这样的权衡,但我不相信它会好得多。它仍在评估集群与相当受限的模型的匹配程度。
    猜你喜欢
    • 2015-11-14
    • 2015-05-15
    • 2011-05-07
    • 1970-01-01
    • 2018-10-23
    • 1970-01-01
    • 2014-01-25
    • 2016-02-13
    • 1970-01-01
    相关资源
    最近更新 更多