【问题标题】:Apply PCA on classification data, category wise or on complete dataset?将 PCA 应用于分类数据、类别还是完整数据集?
【发布时间】:2016-04-24 12:11:54
【问题描述】:

我有一个包含 15 个不同类别的分类相关图像数据,每个类别有五个特征集。这五个特征集包括颜色特征、筛选特征等。多达 5 个不同的特征。每个类中的平均实例/样本数约为 300(从 200 到 400 不等)。特征集维度为512、1296、5376、5376、22950,样本总数接近4500。

(为清楚起见:假设一个类别和一个颜色特征,我有一个包含 220 行(样本)的矩阵,每行是 5376 维向量,因此一个 220 x 5376 维矩阵代表一个类别和一个特征)。

现在,如果我将 PCA 应用于单个类别/类,那么我将获得小于 270 的所有特征集的降维(n_components = min(n_samples, feature_dimension))。

如果我将 PCA 应用于 4500 个图像的完整数据集(连接来自 15 个类的所有样本),当然是在一个特征集上,比如颜色.. 那么我将获得一个小于 min(4500,特征维度)。

应用 PCA 最合适的方法是什么?是基于类别的数据(每个特征)还是一个特征的完整数据集?请注意,我需要固定主成分的数量以解释 90% 以上的方差。

很高兴得到一些帮助!

【问题讨论】:

    标签: python-2.7 machine-learning pca


    【解决方案1】:

    我建议您尝试两种方法。将数据转储到 ARFF 文件(类似于带有一些标题的 CSV)并在 Weka (http://www.cs.waikato.ac.nz/ml/weka/) 中打开它。您将能够轻松探索不同的场景,可视化降维,甚至检查一些特征选择算法。

    【讨论】:

    • @stackoverflow.com/users/327694/josep-valls 感谢您的关注!但是你看..我期待以两种方式减少维度的某些数学影响。我正在按照建议检查这两种方法,但只是在一种方法(完整数据集)中,我们有许多不同的样本,我不确定它对降维有什么影响。与这两种方法相关的一些理论解释会有所帮助。
    • @zeroone 在 Weka 中,您可以调整应用后想要保留的方差,并查看不同特征选择策略的影响。对于更理论的答案,您可能想尝试在stats.stackexchange.com 社区中提问。
    猜你喜欢
    • 1970-01-01
    • 2013-11-13
    • 2020-01-30
    • 2017-11-02
    • 2019-11-12
    • 2019-01-13
    • 2019-10-21
    • 2014-03-19
    • 2012-08-01
    相关资源
    最近更新 更多