【发布时间】:2020-08-25 18:29:15
【问题描述】:
我正在学习大型数据集的特征选择。我遇到了一种名为“Mutual_info_regression”和“Mutual_info_classif”的方法。它返回所有特征的值。该值代表什么?
【问题讨论】:
标签: python machine-learning scikit-learn deep-learning
我正在学习大型数据集的特征选择。我遇到了一种名为“Mutual_info_regression”和“Mutual_info_classif”的方法。它返回所有特征的值。该值代表什么?
【问题讨论】:
标签: python machine-learning scikit-learn deep-learning
它们都测量包含一组特征向量的矩阵和目标之间的mutual information。它们位于sklearn.feature_selection 之下,因为互信息可用于了解某个特征的预测器有多好。这是信息论中的一个核心概念,与entropy 的概念密切相关,我建议你从它开始。但简而言之,两个变量之间的互信息,衡量一个给定的特征在多大程度上可以解释另一个(目标),或者更专业地说,通过观察一个特征将获得多少关于目标变量的信息。
实际上,这是通过Iterative Dichotomiser 3 训练的内部决策树的度量,用于决定在每个拆分中将哪个特征设置为节点,以及要设置的后续阈值。这两种方法的唯一区别是一种适用于离散目标,另一种适用于连续目标。
【讨论】: