【发布时间】:2017-05-21 08:40:29
【问题描述】:
我有一个包含 50K 行和 26 个特征的数据集。我正在使用 sklearn 的 StandardScaler 对列进行归一化(每列的均值为 0,标准差为 1),然后运行 PCA 以将特征集减少到原始方差的约 90%。然后在运行 sklearn 的 KMeans 算法之前对行进行规范化。
有什么理由我不应该在运行 PCA 后对行进行规范化?如果有,在 PCA 之前对行进行规范化会导致任何问题 - 应该在规范化列之前还是之后进行?
对行进行归一化的原因是从每行中删除“幅度”或“技能水平”,而是查看各个 PCA 减少特征之间的关系。
【问题讨论】:
标签: scikit-learn normalization pca