【问题标题】:Scaling of data before building model is necessary for all the models or not?所有模型都需要在构建模型之前缩放数据吗?
【发布时间】:2019-05-26 05:14:38
【问题描述】:

在构建决策树或随机森林时,我们是否需要缩放(通过 zscale 或标准化)数据?正如我们所知,我们需要为 KNN、K-means 聚类和 PCA 扩展数据。因为这些算法是基于距离计算的。线性、Logistic、NavieBayes、决策树和随机森林的缩放怎么样?

【问题讨论】:

    标签: machine-learning random-forest decision-tree


    【解决方案1】:

    在构建决策树或随机森林时,我们是否需要缩放(通过 zscale 或标准化)数据?

    答:决策树和随机森林不受特征量的影响,因此不需要。

    我们知道,我们需要为 KNN、K-means 聚类和 PCA 扩展数据。因为这些算法是基于距离计算的。在线性、逻辑、NavieBayes、决策树和随机森林中进行缩放呢?

    答:一般来说,缩放不是绝对要求,而是建议,主要用于基于相似性的算法。对于许多算法,您可能需要在规范化之前考虑数据转换。您还可以尝试各种规范化技术,没有一种尺寸适合所有问题。基于误差的算法(如线性、逻辑回归、神经网络)进行归一化的主要原因是由于权重的更好初始化,更快收敛到全局最小值。基于信息的算法(决策树、随机森林)和基于概率的算法(朴素贝叶斯) ,贝叶斯网络)也不需要归一化。

    【讨论】:

      【解决方案2】:

      通常最好进行缩放,因为如果所有特征都在相同的比例上,则梯度下降算法会更快地收敛到全局或最优局部最小值。

      我们可以通过使每个输入值在大致相同的范围内来加速梯度下降。这是因为我们的模型参数会在小范围内快速下降,在大范围内缓慢下降,因此当变量非常不均匀时会低效地振荡到最优值。

      【讨论】:

        【解决方案3】:

        当我们寻找数据点之间的某种关系时,我们会进行数据缩放。在 ANN 和其他数据挖掘方法中,我们需要对输入进行规范化,否则网络将处于病态。我们进行缩放以达到线性、更稳健的关系。此外,数据缩放还可以帮助您克服数据中的异常值。简而言之,在每种类型的机器学习算法中都强烈建议进行数据缩放。 您可以进行标准化或标准化以扩展数据。 [注意不要将标准化与标准化(例如 Z 分数)混淆] 希望对您有所帮助。

        【讨论】:

          猜你喜欢
          • 2014-08-14
          • 2017-10-06
          • 1970-01-01
          • 2020-04-16
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多