【问题标题】:Why does Weka XMeans systematically underestimate the number of clusters?为什么 Weka XMeans 系统地低估了集群的数量?
【发布时间】:2016-06-04 00:29:21
【问题描述】:

我在使用 Weka 的 XMeans 集群时遇到了一些问题。我已经和其他几个人谈过,我们都同意下面的屏幕截图中有六个集群,或者如果你真的眯着眼睛,至少至少有两个。无论哪种方式,xMeans 似乎都不同意。

XMeans 似乎系统地低估了集群的数量,基于我设置的最小集群计数。最大集群数为 100,这是我得到的结果:

-L 1 // 1 cluster
-L 2 // 2 clusters
-L 3 // 3 clusters
-L 4 // 5 clusters
-L 5 // 6 clusters
-L 6 // 6 clusters

最令人震惊的是,-L 1(和-H 100)只能找到一个集群。只有将最小集群数设为五个,我才能真正看到六个集群。将改进结构参数提高到 100,000 似乎没有任何效果。 (我也玩过其他选项,没有发现任何区别。)以下是生成上述屏幕截图的选项,它找到了一个中心:

private static final String[] XMEANS_OPTIONS = {
    "-H", "100",         // max number of clusters (default 4)
    "-L", "1",           // min number of clusters (default 2)
    "-I", "100",         // max overall iterations (default 1)
    "-M", "1000000",     // max improve-structure iterations (default 1000)
    "-J", "1000000",     // max improve-parameter iterations (default 1000) 
};

显然我在这里遗漏了一些东西。如何使 XMeans 的行为符合预期?

【问题讨论】:

  • 在 ELKI 中尝试 X-means。它工作得更好吗?那么可能有一个错误......但根据我的经验,x-means 确实经常得到错误的集群数量,即使在像这样的简单合成数据上也是如此
  • 你能分享数据吗,例如,在投递箱上?我假设出了什么问题。
  • @CAFEBABE - 数据为here,以空格分隔的格式。很想听听你的想法。

标签: cluster-analysis weka k-means xmeans


【解决方案1】:

我想这是我害怕的。一个心理问题(我认为如果您搜索格式塔理论,您可能会找到关于感知方面的一些解释)。

人眼正在抓住星团的形状,发现六个圆圈。然而,k-means 和 x-means 只关注 距离。因此,集群看起来相当尴尬。同样在使用 6-means 多次重启后,我几乎总是实现了如下集群: 这可能是一个局部最小值,可以通过 xmeans 解决

或用于 3 均值

这很有趣,因为有些点显然违反了预期。

如果您使用 R 中的 K-Means,您可以分析聚类结果的内部。这些表明这些看起来很尴尬的集群通常表现得很好。因此,不会收敛到预期的不同结果。

我认为这可以通过使用不同的距离度量来解决。例如,强制圆形形状的平方欧几里得距离。 或者在 RBF 内核中使用一些基于内核的聚类技术

================================================

EDIT1: 但是,weka 的结果的一个方面还是比较尴尬,我用 RWeka 做了几个实验。基本上,我确实为27 之间的每个初始集群大小运行了 100 次集群运行。我的预期是,对于 26,集群相当稳定,而我预计它们会增长的其他集群大小。

但是,结果不同

所以基本上26 是相当稳定的,但是,集群大小总是最多增加1。

让我们来看看 BIC

我们可以观察到,当增加集群大小时,BIC 并没有增加,但是,强烈依赖于初始集群大小。

让我们再深入一点,看看初始集群大小为 3。以不同的初始大小运行多次重新启动会生成(可重现)以下两种情况:

尽管如此,BIC 上的结果似乎表明 BIC 计算中存在 BUG。

【讨论】:

  • 哇!谢谢@CAFEBABE。你办婚礼吗?
  • 另外,我很难放弃我的格式塔理论。拿你的第一个数字,上面。 Xmeans 发现了六个簇(即颜色)。我们是说总方差实际上低于分配这些集群,而不是像我天真地分配它们吗?对我来说似乎很清楚,通过将红色/蓝色簇分成两部分并将右侧的每个(视觉)簇赋予其自己的中心(保持簇的数量不变以免干扰BIC)——但我还没有真正尝试过。
  • 认为人类感知和心理“问题”实际上往往是这类伪“智能”解决方案的理想行为。否则,由于距离而不是明显的圆形/椭圆中的存在,在降维后,您将有一个聚类器将腊肠犬与猫聚类。一个更好的例子可能是对象与对象的反映:心理“问题”使我们的大脑很容易区分相似的幻觉和实际的相似。在这种情况下,距离度量就是错觉。
猜你喜欢
  • 2012-06-08
  • 2019-05-01
  • 2016-03-18
  • 2012-04-02
  • 2014-02-18
  • 2016-03-02
  • 2010-11-09
  • 1970-01-01
  • 2018-01-27
相关资源
最近更新 更多