【发布时间】:2020-11-18 05:26:54
【问题描述】:
我想尝试对我的高维数据集使用 UMAP 作为预处理步骤(不是用于数据可视化),以减少特征数量,但我该如何选择(如果有方法)正确数量的映射原始数据的维度?例如,在 PCA 中,您可以选择解释固定百分比方差的因素的数量。
【问题讨论】:
标签: pca dimensionality-reduction
我想尝试对我的高维数据集使用 UMAP 作为预处理步骤(不是用于数据可视化),以减少特征数量,但我该如何选择(如果有方法)正确数量的映射原始数据的维度?例如,在 PCA 中,您可以选择解释固定百分比方差的因素的数量。
【问题讨论】:
标签: pca dimensionality-reduction
没有与 PCA 给出的显式度量相媲美的好方法。但是,根据经验,对于大于n_neighbors 值的嵌入维度,您将获得显着递减的收益。考虑到这一点,并且由于您实际上有一个下游任务,因此最有意义的是构建下游任务评估的管道并查看 UMAP 维度数量的交叉验证。
【讨论】: