【发布时间】:2021-03-31 04:40:02
【问题描述】:
集群 1:
数据 0 [1, 2, 3, 4, 5]
数据 1 [4, 32, 21, 3, 2]
数据 2 [2, 82, 51, 2, 1] #集群结束
这些是一些组成的值(维度 = 5),表示 k-means 的集群成员 要计算质心,我知道取平均值。但是,我不清楚我们是取所有这些特征的总和的平均值还是按列取平均值。
我的意思的一个例子:
所有内容的平均值
sum = 1 + 2 + 3 + 4 + 5 + 4 + 32 + 21.... + 1 /(总长度)
质心 = [sum ,sum, sum, sum, sum]
平均特征
sum1 = 第一列的平均值 = (1 + 4 + 2) / 3
sum2 = 第二列的平均值 = (2 + 32 + 82) / 3
...
质心 = [sum1, sum2, sum3, sum4, sum5]
据我所知,第一个似乎是正确的方法。然而,第二个对我来说更有意义。谁能解释一下哪个是正确的,为什么?
【问题讨论】:
-
我投票结束这个问题,因为它与 help center 中定义的编程无关,而是关于 ML 理论和/或方法 - 请参阅介绍和 注意 在
machine-learningtag info.
标签: data-science cluster-analysis k-means