【发布时间】:2018-08-21 22:25:57
【问题描述】:
我正在使用逻辑回归和不应用 PCA 进行二元分类。与单独的逻辑回归相比,在逻辑回归之前应用 PCA 可提供更高的准确性和更低的 FN。我想知道为什么会发生这种情况,特别是为什么 PCA 产生的 FN 较少。我读过成本敏感性分析可以帮助解释这一点,但我不确定这是否正确。有什么建议?
【问题讨论】:
标签: performance machine-learning confusion-matrix false-positive
我正在使用逻辑回归和不应用 PCA 进行二元分类。与单独的逻辑回归相比,在逻辑回归之前应用 PCA 可提供更高的准确性和更低的 FN。我想知道为什么会发生这种情况,特别是为什么 PCA 产生的 FN 较少。我读过成本敏感性分析可以帮助解释这一点,但我不确定这是否正确。有什么建议?
【问题讨论】:
标签: performance machine-learning confusion-matrix false-positive
不需要花哨的分析来解释这种行为。
PCA 仅用于通过限制其方差来“清理”数据。让我用一个例子来解释这个概念,然后我会回到你的问题。
一般来说,在任何 ML 问题中,可用样本的数量永远不足以覆盖样本空间的所有可能种类。你永远不可能拥有一个包含所有可能的人脸、所有可能的表情等的数据集。
因此,您不是使用所有可用的功能,而是以一种获得更有意义的更高级别功能的方式来设计功能(在此示例中为像素)。您可以降低图片的分辨率,例如简单的例子;您会丢失图片背景上的信息,但您的模型会更好地关注图片中最重要的部分,即人脸。
当您处理表格数据时,一种类似于降低分辨率的技术是切除部分原始特征,这就是 PCA 所做的:它保留特征中最重要的组成部分,即“主成分”,删除不太重要的。
因此,使用 PCA 训练的模型可以提供更好的结果,因为通过截断部分特征,您的模型可以更好地关注样本中最重要的部分,因此它具有抵抗过度拟合的鲁棒性。
干杯
【讨论】: