【问题标题】:Choosing Centroid for K-means with multi dimensional data为具有多维数据的 K 均值选择质心
【发布时间】:2021-03-31 04:40:02
【问题描述】:

集群 1:

数据 0 [1, 2, 3, 4, 5]

数据 1 [4, 32, 21, 3, 2]

数据 2 [2, 82, 51, 2, 1] #集群结束

这些是一些组成的值(维度 = 5),表示 k-means 的集群成员 要计算质心,我知道取平均值。但是,我不清楚我们是取所有这些特征的总和的平均值还是按列取平均值。

我的意思的一个例子:

所有内容的平均值

sum = 1 + 2 + 3 + 4 + 5 + 4 + 32 + 21.... + 1 /(总长度)

质心 = [sum ,sum, sum, sum, sum]

平均特征

sum1 = 第一列的平均值 = (1 + 4 + 2) / 3

sum2 = 第二列的平均值 = (2 + 32 + 82) / 3

...

质心 = [sum1, sum2, sum3, sum4, sum5]

据我所知,第一个似乎是正确的方法。然而,第二个对我来说更有意义。谁能解释一下哪个是正确的,为什么?

【问题讨论】:

  • 我投票结束这个问题,因为它与 help center 中定义的编程无关,而是关于 ML 理论和/或方法 - 请参阅介绍和 注意machine-learningtag info.

标签: data-science cluster-analysis k-means


【解决方案1】:

它的平均功能。质心将是

质心^T = ( (1 + 4 + 2) / 3 , (2 + 32 + 82) / 3, .... , (5 + 2 + 1) / 3)

        = ( 7/3, ..., 8/3)

这是有道理的,因为您需要一个应该作为集群中每个数据点的代表的向量。因此,对于质心的每个分量,我们生成所有点的平均值,将其作为代表集群的 R^5 空间中的样本。

【讨论】:

    猜你喜欢
    • 2017-11-04
    • 2018-12-20
    • 2015-05-05
    • 2017-09-24
    • 2015-03-21
    • 2016-06-27
    • 2013-05-02
    • 2023-03-30
    • 1970-01-01
    相关资源
    最近更新 更多