【发布时间】:2016-04-24 12:11:54
【问题描述】:
我有一个包含 15 个不同类别的分类相关图像数据,每个类别有五个特征集。这五个特征集包括颜色特征、筛选特征等。多达 5 个不同的特征。每个类中的平均实例/样本数约为 300(从 200 到 400 不等)。特征集维度为512、1296、5376、5376、22950,样本总数接近4500。
(为清楚起见:假设一个类别和一个颜色特征,我有一个包含 220 行(样本)的矩阵,每行是 5376 维向量,因此一个 220 x 5376 维矩阵代表一个类别和一个特征)。
现在,如果我将 PCA 应用于单个类别/类,那么我将获得小于 270 的所有特征集的降维(n_components = min(n_samples, feature_dimension))。
如果我将 PCA 应用于 4500 个图像的完整数据集(连接来自 15 个类的所有样本),当然是在一个特征集上,比如颜色.. 那么我将获得一个小于 min(4500,特征维度)。
应用 PCA 最合适的方法是什么?是基于类别的数据(每个特征)还是一个特征的完整数据集?请注意,我需要固定主成分的数量以解释 90% 以上的方差。
很高兴得到一些帮助!
【问题讨论】:
标签: python-2.7 machine-learning pca