【发布时间】:2019-05-26 05:14:38
【问题描述】:
在构建决策树或随机森林时,我们是否需要缩放(通过 zscale 或标准化)数据?正如我们所知,我们需要为 KNN、K-means 聚类和 PCA 扩展数据。因为这些算法是基于距离计算的。线性、Logistic、NavieBayes、决策树和随机森林的缩放怎么样?
【问题讨论】:
标签: machine-learning random-forest decision-tree
在构建决策树或随机森林时,我们是否需要缩放(通过 zscale 或标准化)数据?正如我们所知,我们需要为 KNN、K-means 聚类和 PCA 扩展数据。因为这些算法是基于距离计算的。线性、Logistic、NavieBayes、决策树和随机森林的缩放怎么样?
【问题讨论】:
标签: machine-learning random-forest decision-tree
在构建决策树或随机森林时,我们是否需要缩放(通过 zscale 或标准化)数据?
答:决策树和随机森林不受特征量的影响,因此不需要。
我们知道,我们需要为 KNN、K-means 聚类和 PCA 扩展数据。因为这些算法是基于距离计算的。在线性、逻辑、NavieBayes、决策树和随机森林中进行缩放呢?
答:一般来说,缩放不是绝对要求,而是建议,主要用于基于相似性的算法。对于许多算法,您可能需要在规范化之前考虑数据转换。您还可以尝试各种规范化技术,没有一种尺寸适合所有问题。基于误差的算法(如线性、逻辑回归、神经网络)进行归一化的主要原因是由于权重的更好初始化,更快收敛到全局最小值。基于信息的算法(决策树、随机森林)和基于概率的算法(朴素贝叶斯) ,贝叶斯网络)也不需要归一化。
【讨论】:
通常最好进行缩放,因为如果所有特征都在相同的比例上,则梯度下降算法会更快地收敛到全局或最优局部最小值。
我们可以通过使每个输入值在大致相同的范围内来加速梯度下降。这是因为我们的模型参数会在小范围内快速下降,在大范围内缓慢下降,因此当变量非常不均匀时会低效地振荡到最优值。
【讨论】:
当我们寻找数据点之间的某种关系时,我们会进行数据缩放。在 ANN 和其他数据挖掘方法中,我们需要对输入进行规范化,否则网络将处于病态。我们进行缩放以达到线性、更稳健的关系。此外,数据缩放还可以帮助您克服数据中的异常值。简而言之,在每种类型的机器学习算法中都强烈建议进行数据缩放。 您可以进行标准化或标准化以扩展数据。 [注意不要将标准化与标准化(例如 Z 分数)混淆] 希望对您有所帮助。
【讨论】: