【发布时间】:2014-06-01 03:51:47
【问题描述】:
我遇到了一个问题,我可能拥有大量功能。本质上是一大堆数据点(为了讨论,假设它包含数百万个特征)。我不知道哪些数据点有用以及哪些与给定结果无关(我猜 1% 是相关的,99% 是无关的)。
我确实有数据点和最终结果(二进制结果)。我对减少特征集很感兴趣,这样我就可以确定最有用的数据点集,以收集来训练未来的分类算法。
我当前的数据集非常庞大,如果我要识别相关特征、减少收集的数据点数量并增加数量,我无法用海量数据生成尽可能多的训练示例的训练示例。我希望在给定更少的特征数据点(同时保持相关数据点)的情况下,我会得到更好的分类器和更多的训练示例。
- 我应该首先关注哪些机器学习算法, 确定与结果相关的特征?
从我所做的一些阅读看来,SVM 似乎为每个特征提供了权重,我可以使用它来识别得分最高的特征。 谁能证实这一点?展开解释?还是我应该换个思路?
【问题讨论】:
标签: machine-learning