【问题标题】:Why not use just Canopy clustering instead of combining with KMeans Mahout为什么不只使用 Canopy 集群而不是与 KMeans Mahout 结合使用
【发布时间】:2014-11-13 09:05:00
【问题描述】:

问题就在标题中——如果 Canopy 可以用于聚类以及确定质心,为什么不将它用于聚类,而不仅仅是使用它来生成质心作为 KMeans 聚类的输入?

我正在考虑使用 Mahout 实现,但我认为这更多是一个概念,与系统没有太大关系。

谢谢

【问题讨论】:

    标签: machine-learning mahout


    【解决方案1】:

    Mahout 已弃用 Canopy,因此我根本不会使用它。

    它很快,因此我们的想法是对起始质心进行比随机估计更好的快速估计,以便 kmeans 更快地收敛。

    Canopy 没有收敛标准,因此您只能先猜测。 Kmeans 遵循一种称为梯度下降的算法进行迭代,以找到定义的误差函数的局部最小值。所以它会收敛到更好的猜测,但通常你从一个随机质心开始,希望它被放置得很好。 Canopy 试图更好地放置起始质心,但它并没有比随机更好。

    因此,您可以通过遍历所有向量并找到它们最接近哪个树冠质心来计算 Canopy 的猜测并计算集群,但集群不会受益于迭代,并且在交叉验证测试中得分会更差。

    【讨论】:

      猜你喜欢
      • 2018-01-23
      • 2016-09-21
      • 2021-08-20
      • 1970-01-01
      • 1970-01-01
      • 2011-03-11
      • 2020-05-26
      • 2014-04-18
      • 1970-01-01
      相关资源
      最近更新 更多