【发布时间】:2018-12-19 19:48:46
【问题描述】:
假设我想在使用 sklearn 在 Python3 中进行 PCA 时找到最佳组件数。
我会通过迭代一些 n_components 并在验证模型时计算每个值的总绝对预测误差来做到这一点。
我的问题是,将n_components 参数传递给PCA 并从那里传递,而不是不传递它而只使用它获得的隐式最大值中的第一个 (i) 组件有什么区别。
我的线性代数有点不稳定,但如果我没记错的话,这两种情况下的单个向量应该是相同的,并且按升序排列,并提供相同数量的解释方差。
很抱歉,我没有提供任何代码,也没有编写两种方案来亲自测试它们,但我在长途火车上,我的笔记本电脑电池在过程中耗尽了。现在我被好奇心困住了。
【问题讨论】:
标签: python scikit-learn data-science pca data-analysis