【发布时间】:2018-05-16 05:37:00
【问题描述】:
正如this post 的回答关于特征缩放的所述,KMeans 的一些(全部?)实现对特征数据点的顺序很敏感。基于 sklearn.cluster.KMeans documentation,n_init 只改变质心的初始位置。这意味着必须循环遍历 features 数据点的几次洗牌,以测试这是否是一个问题。我的问题如下:
- scikit-learn 的实现是否像帖子建议的那样对排序敏感?
- n_init 会为我处理吗?
- 如果我自己这样做,我应该根据最小惯性取最好的还是按照here的建议取平均值?
- 是否有一个很好的规则可以根据数据点的数量知道多少个随机排列就足够了?
更新:这个问题最初询问的不是问题的特征(列)顺序。这是对链接帖子中“对象”一词的误解。它已更新为询问数据点(行)的顺序。
【问题讨论】:
标签: python scikit-learn cluster-analysis k-means