【问题标题】:How to quantify bias and variance given train data samples如何量化给定训练数据样本的偏差和方差
【发布时间】:2020-03-09 20:16:20
【问题描述】:

我有一个模型,我使用多项式和径向基函数进行训练,我将数据分成训练集和测试集,并从训练集中抽取大量样本。现在我对下一步感到茫然,我知道偏差是损失最小的样本的损失。我是在火车数据还是测试数据上计算这个?方差只是测试集上损失的方差吗?

【问题讨论】:

  • 您似乎对基本的统计术语感到困惑。堆栈溢出更侧重于编码问题,请查看stats.stackexchange。并寻找一个关于偏差/方差权衡的好教程,应该有很多。

标签: machine-learning statistics linear-regression


【解决方案1】:

这种权衡的主要目标是为决策边界找到合适的复杂度

高复杂度:(可以)记住过去,(可能)不概括未来(高方差问题)

低复杂度:(可能)由于非常简单的决策边界而无法从过去学到足够的知识,并且(可能)也无法做出良好的预测(高偏差问题)

这可以简单地用如下图来表示,

【讨论】:

  • 感谢您的回复,但是我正在寻找一种方法来为偏差和方差提供一个数字,以显示哪些模型是好的,哪些是不好的。
猜你喜欢
  • 2020-04-22
  • 2021-10-14
  • 2020-02-13
  • 1970-01-01
  • 2018-10-17
  • 2017-09-14
  • 2023-04-07
  • 2018-08-18
  • 1970-01-01
相关资源
最近更新 更多