【问题标题】:Determine the value of n_components variable in pca analysis确定 pca 分析中 n_components 变量的值
【发布时间】:2018-05-01 08:45:45
【问题描述】:

祝你有美好的一天。请帮我。我有一个标准化文件。该文件由 21 个数字列组成。

我会将pca analysis 应用到这个文件,如下所示:

pca = decomposition.PCA(n_components=21)
pca_output = pca.fit_transform(pca_matrix)
pca_inverse = pca.inverse_transform(pca_output)

据我了解,我分配给n_components 变量的值等于列数。但我不明白的是如何确定n_components 变量。

【问题讨论】:

    标签: python pca


    【解决方案1】:

    它是一个超参数,找到它的最佳值取决于您想对数据做什么。让我描述 3 种可能的用途:

    • 可视化:2 或 3 可能是最明智的选择:)
    • 压缩:这里的目标是在不丢失太多信息的情况下简单地减少特征数量。您可以安装所有组件 (n_components=None)。然后检查属性explained_variance_ratio_ 并决定你愿意放弃多少。或者您可以输入n_components='mle',让数据为您决定。
    • 预处理:这里的降维是一些流水线的第一步(在回归/分类之前)。与压缩相反,您希望使用转换后的特征作为监督学习算法的输入。我建议通过 GridSearchCV 在 PCA 的 n_components 和预测模型的超参数上找到最佳 n_components。

    【讨论】:

      猜你喜欢
      • 2021-07-11
      • 1970-01-01
      • 2016-05-07
      • 2018-11-20
      • 2016-08-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-10-24
      相关资源
      最近更新 更多