【问题标题】:What exactly is the initializationSteps parameter in Kmeans++ in Spark MLLib?Spark MLLib中Kmeans++中的initializationSteps参数到底是什么?
【发布时间】:2016-03-24 13:46:02
【问题描述】:

我知道什么是 k-means,我也知道什么是 k-means++ 算法。我相信唯一的变化是找到初始 K 中心的方式。

在 ++ 版本中,我们最初选择一个中心,然后使用概率分布选择剩余的 k-1 个中心。

在 k-means 的 MLLib 算法中,initializationSteps 参数是什么?

【问题讨论】:

    标签: apache-spark pyspark apache-spark-sql apache-spark-mllib


    【解决方案1】:

    准确地说,k-means++ 是一种选择初始中心的算法,它没有描述整个训练过程。

    MLLib k-means 使用 k-means|| 进行初始化,这是 ++ 的分布式变体。它对迭代次数不是一个点,而是多个点。

    initializationSteps对应迭代次数,根据the original paper应该大致为O(log n)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-06-01
      • 2016-10-25
      • 2016-07-08
      • 2015-10-01
      • 2018-02-24
      • 1970-01-01
      • 2019-06-23
      • 1970-01-01
      相关资源
      最近更新 更多