先来回顾一下前两篇文章,在有限的训练集中,我们知道无论什么学习算法,我们所产生的结果个数都是有限的,因而对应训练集,不同hypothesis个数也是确定的,因此,有成长函数的概念,break point 概念,成长函数与演算法的选择有关,不够泛化,我们想得出其上限,因此有了bounding 函数,更一步简化后,我们使用一个多项式来表达bounding函数的上限,最终我们可使用(上限的上限)来简化成长函数。(不断地取上限,导致我们将在之后提及的looseness of bounding function)
machine learning可行性原理分析(三)再结合使用成长函数表示的vc bounding,我们就可以说,N很大时,hypothesis 函数存在break point ,模型具有泛化能力,在训练集上的表现能反映出在测试集的表现。因此,我们希望机器能有所学习,离不开大的训练集、存在break point 的hypothesis ,好的演算法能选到在训练集上误差最小hypothesis :
machine learning可行性原理分析(三)machine learning可行性原理分析(三)VC dimension :
可scatter 所有样本可能性的最大样本个数。
machine learning可行性原理分析(三)现在整个学习的过程可使用更为正式的说法来表示,训练集样本足够大,hypothesis 的dvc有限,演算法选择的hypothesis 在训练集上的错误率足够低,机器学习是可靠地。
machine learning可行性原理分析(三)为了得到dvc更深层的含义,让我们来回顾一些我们所熟悉的hypothesis的dvc
machine learning可行性原理分析(三)现在来推导一下d-D 的perceptron的dvc,之后我们来探究一下dvc的物理含义。
machine learning可行性原理分析(三)为了证明,dvc≥d+1,只需说明存在某一个含有d+1笔样本的数据集,可以被perceptron表达。这里使用了一组特殊构造的样本集,利用perceptron公式可得出这组样本可产生所有可能性的结果。因此dvc≥1。
machine learning可行性原理分析(三)而证明所有d+2笔data 都无法被hypothesis 所scatter,则是利用线性相关/无关的特性。训练集中的样本是相关的,因此,有一个样本是用其余样本所表出的,对于某一个训练集,有一种如下图般特殊的情况,即特殊的系数取值和预测结果下,有一种组合是无法产生的,而且这个这种取法无关于怎么获取样本,对所有的训练样本都成立。
machine learning可行性原理分析(三)
物理意义:
结合d-D的perceptron 和其他的hypothesis ,可以说dvc能用来表示hypothesis 中参数的自由度,表示hypothesis 的复杂度。原来我们说M(hypothesis 个数)能决定学习可靠性(学习是否准确,泛化能力是否ok),更准确应该是使用dvc表示学习可靠性程度。可见,一个hypothesis 同时影响着学习过程和泛化能力评估过程。针对不同的训练集,选择合适的hypothesis 是很重要的!很大程度上影响着学习效果!
machine learning可行性原理分析(三)通过上面分析我们对dvc的重要性做出了感性认知,下面将使用具体公式和图形来表示dvc对学习和测试过程的影响,根据vc bound,定义出了模型复杂度表达公式:
machine learning可行性原理分析(三)通过上述的计算并代入到vc bound的左侧公式里,可得出最坏情况下的Eout的表达:
machine learning可行性原理分析(三)
machine learning可行性原理分析(三)
从另一个方面来了解vc bound,为了实现好的学习效果,N和dvc应该具有的关系如下图所示,而实际中,我们并不需要如此多的训练样本,同时也给出我们为达到好的学习效果,dvc和N具有的隐藏信息。
machine learning可行性原理分析(三)总结:
machine learning可行性原理分析(三)

相关文章:

  • 2021-09-13
  • 2022-12-23
  • 2022-12-23
  • 2022-12-23
  • 2021-07-26
  • 2022-12-23
  • 2021-05-28
猜你喜欢
  • 2021-06-11
  • 2021-12-06
  • 2021-06-08
  • 2021-04-06
  • 2022-12-23
  • 2021-06-15
  • 2021-11-05
相关资源
相似解决方案