【问题标题】:prepare data for machine learning为机器学习准备数据
【发布时间】:2020-07-07 18:12:19
【问题描述】:

我正在使用线性回归进行深度学习。我从医院收集了真实的一天(患者到达时间、分诊时间、检查时间和住院时间),但数据不干净,值高低。例如,数据集中的平均等待时间为 28 分钟,数据集中等待时间的标准差为 75 分钟。

这在机器学习中叫什么?是数据不平衡吗?我该如何克服这个问题?数据科学中是否有任何技术可以帮助使这些数据为机器学习做好准备?

【问题讨论】:

    标签: deep-learning dataset linear-regression


    【解决方案1】:

    这里的问题是,您的不同特征(即等待时间、分类等)可能具有截然不同的尺度(如您所说,一个特征的平均值可能为 28,标准差为 75,而不同的特征可能具有可能有完全不同的规模)。您认为这可能会使训练变得更加困难是正确的。

    一种非常常见的解决方案称为归一化:假设每个特征按照均值 0 和标准差 1 分布,重新计算每个特征。将其应用于数据集非常简单:您所要做的就是,每个单独条目中的每个特征,减去平均值(这将使 0 成为新的平均值)并将结果除以标准差(这将使 1 成为新的标准差)。这个过程很常见,以至于它已经在大多数机器学习或统计框架中以矢量化方式实现。

    虽然这可以缓解浅层模型中的问题(如线性回归,就像您的情况一样),但具有多层的模型在中间层中可能仍会受到此问题的影响。在这种情况下,通常在每一层之后应用一种称为批量标准化的相关技术。

    【讨论】:

      猜你喜欢
      • 2021-09-21
      • 2021-11-24
      • 1970-01-01
      • 2021-03-28
      • 2013-10-22
      • 1970-01-01
      • 2019-11-14
      • 2010-12-14
      • 2013-08-05
      相关资源
      最近更新 更多