【问题标题】:Feature Extraction and higher sensitivity特征提取和更高的灵敏度
【发布时间】:2018-03-22 15:02:48
【问题描述】:
在 WBCD 数据集上进行特征提取(PCA 和 LDA)然后进行逻辑回归时,我得到了提高的灵敏度,但精度不同。我一直在努力寻找可以解释/研究特征提取如何提高分类器灵敏度的文献,但我找不到任何东西。
【问题讨论】:
标签:
python
machine-learning
logistic-regression
feature-extraction
【解决方案1】:
特征提取降低了数据的维度。这样做通常是为了创建一个更小的系统(以减少计算费用)和/或减少噪声(以获得更清晰的信号)。
Introduction to Statistical Learning(here)中给出了关于无监督学习 (p.373) 的简明介绍,我认为这正是您所寻找的。
以 PCA 为例。从统计学习简介:
当面对大量相关变量时,委托人
组件允许我们用更少的数量来总结这个集合
代表变量共同解释了大多数
原始集合的可变性。主成分方向
在第 6.3.1 节中作为特征空间中的方向沿
原始数据是高度可变的。这些方向也
定义尽可能接近数据的行和子空间
云。要执行主成分回归,我们只需使用
主成分作为回归模型中的预测变量
原始较大的一组变量。
主成分分析 (PCA)
计算主成分,然后使用这些
理解数据的组成部分。 PCA 是一种无监督的方法,
因为它只涉及一组特征 X1、X2、...、Xp,并且没有
相关响应 Y. 除了生成派生变量以供使用
在监督学习问题中,PCA 还可以作为数据的工具
可视化(观察的可视化或
变量)。我们现在更详细地讨论 PCA,重点是
使用 PCA 作为无监督数据探索的工具,以保持
与本章的主题。
我的首选资源是 统计学习要素(可免费获得 here)。从第 534 页开始,详细讨论了 PCA,将其应用于手写以使问题更易于处理。