【发布时间】:2019-04-26 04:34:07
【问题描述】:
我目前正在从事一个分类项目,但我不确定应该如何开始。
目标
将大小为 80*80(即 6400 像素)的图片准确分类到正确的类别(二进制)中。
设置
5260 个训练样本,600 个测试样本
问题
由于像素多于样本,在我开始制定分类方法(如 SVM、KNN 等)之前,“丢弃”大部分像素并只查看重要的像素似乎是合乎逻辑的。
假设训练数据由 X_train(预测变量)和 Y_train(结果)组成。到目前为止,我已经尝试从 sklearn 中查看 SelectKBest() 方法来进行特征提取。但是,使用这种方法并知道我实际上必须选择多少个 k 的最佳方法是什么?
也可能是我在这里完全走错了路,如果我错了,请纠正我,或者如果可能的话建议其他方法。
【问题讨论】:
标签: image-processing scikit-learn classification