【问题标题】:Data spread is good or bad in machine learning , and why数据传播在机器学习中是好是坏,以及为什么
【发布时间】:2020-08-24 19:51:22
【问题描述】:

我是机器学习的新手,我知道标准差是一个描述数据如何传播的数字,但如果传播高对模型有好处,我们如何解决这个问题?

【问题讨论】:

    标签: python pandas numpy machine-learning data-science


    【解决方案1】:

    正如Wikipedia 所说:

    标准偏差是一组值的变化量或离散量的量度。低标准差表示值倾向于接近集合的平均值(也称为期望值),而高标准差表示值分布在较宽的范围内。

    这意味着通常标准差只是一个统计数据,其中包含有关数据分布的一些信息。由于机器学习有很多分支和领域,所以说我们希望数据被分散或集中是不太正确的。

    在分类等一些应用中,如果每个类的数据更集中在均值附近(假设类的均值不同),则可以将它们分类的准确率更高。

    您可以通过将整个数据除以某个数字来简单地降低整个数据的标准差,但这也会降低您的班级中心之间的距离,这意味着这对您没有任何好处。

    【讨论】:

      猜你喜欢
      • 2011-06-04
      • 2011-03-11
      • 2011-02-06
      • 2017-05-29
      • 1970-01-01
      • 2016-04-05
      • 2016-11-17
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多