假设我们有一个固定样本集 反向传导,它包含 反向传导 个样例。我们可以用批量梯度下降法来求解神经网络。具体来讲,对于单个样例 反向传导,其代价函数为:

反向传导

这是一个(二分之一的)方差代价函数。给定一个包含 反向传导 个样例的数据集,我们可以定义整体代价函数为:

反向传导

以上公式中的第一项 反向传导 是一个均方差项。第二项是一个规则化项(也叫权重衰减项),其目的是减小权重的幅度,防止过度拟合。


[注:通常权重衰减的计算并不使用偏置项 反向传导,比如我们在 反向传导 的定义中就没有使用。一般来说,将偏置项包含在权重衰减项中只会对最终的神经网络产生很小的影响。如果你在斯坦福选修过CS229(机器学习)课程,或者在YouTube上看过课程视频,你会发现这个权重衰减实际上是课上提到的贝叶斯规则化方法的变种。在贝叶斯规则化方法中,我们将高斯先验概率引入到参数中计算MAP(极大后验)估计(而不是极大似然估计)。]


权重衰减参数 反向传导 用于控制公式中两项的相对重要性。在此重申一下这两个复杂函数的含义:反向传导 是针对单个样例计算得到的方差代价函数;反向传导 是整体样本代价函数,它包含权重衰减项。


以上的代价函数经常被用于分类和回归问题。在分类问题中,我们用 反向传导 或 反向传导,来代表两种类型的标签(回想一下,这是因为 sigmoid激活函数的值域为 反向传导;如果我们使用双曲正切型激活函数,那么应该选用 反向传导 和 反向传导 作为标签)。对于回归问题,我们首先要变换输出值域(译者注:也就是 反向传导),以保证其范围为 反向传导 (同样地,如果我们使用双曲正切型激活函数,要使输出值域为 反向传导)。


我们的目标是针对参数 反向传导 和 反向传导 来求其函数 反向传导 的最小值。为了求解神经网络,我们需要将每一个参数 反向传导 和 反向传导 初始化为一个很小的、接近零的随机值(比如说,使用正态分布 反向传导 生成的随机值,其中 反向传导 设置为 反向传导 ),之后对目标函数使用诸如批量梯度下降法的最优化算法。因为 反向传导 是一个非凸函数,梯度下降法很可能会收敛到局部最优解;但是在实际应用中,梯度下降法通常能得到令人满意的结果。最后,需要再次强调的是,要将参数进行随机初始化,而不是全部置为 反向传导。如果所有参数都用相同的值作为初始值,那么所有隐藏层单元最终会得到与输入值有关的、相同的函数(也就是说,对于所有 反向传导反向传导都会取相同的值,那么对于任何输入 反向传导 都会有:反向传导 )。随机初始化的目的是使对称失效


梯度下降法中每一次迭代都按照如下公式对参数 反向传导 和反向传导 进行更新:

反向传导

其中 反向传导 是学习速率。其中关键步骤是计算偏导数。我们现在来讲一下反向传播算法,它是计算偏导数的一种有效方法。


我们首先来讲一下如何使用反向传播算法来计算 反向传导 和 反向传导,这两项是单个样例 反向传导 的代价函数 反向传导 的偏导数。一旦我们求出该偏导数,就可以推导出整体代价函数 反向传导 的偏导数:

 

反向传导

以上两行公式稍有不同,第一行比第二行多出一项,是因为权重衰减是作用于 反向传导 而不是 反向传导


反向传播算法的思路如下:给定一个样例 反向传导,我们首先进行“前向传导”运算,计算出网络中所有的激活值,包括 反向传导 的输出值。之后,针对第 反向传导 层的每一个节点 反向传导,我们计算出其“残差” 反向传导,该残差表明了该节点对最终输出值的残差产生了多少影响。对于最终的输出节点,我们可以直接算出网络产生的激活值与实际值之间的差距,我们将这个差距定义为 反向传导 (第 反向传导 层表示输出层)。对于隐藏单元我们如何处理呢?我们将基于节点(译者注:第 反向传导 层节点)残差的加权平均值计算 反向传导,这些节点以 反向传导 作为输入。下面将给出反向传导算法的细节:

 

  1. 进行前馈传导计算,利用前向传导公式,得到 反向传导 直到输出层 反向传导 的激活值。
  2. 对于第 反向传导 层(输出层)的每个输出单元 反向传导,我们根据以下公式计算残差:
    反向传导
    [译者注:
    反向传导
    ]
  3. 对 反向传导 的各个层,第 反向传导 层的第 反向传导 个节点的残差计算方法如下:
    反向传导
    {译者注:
    反向传导
    将上式中的反向传导反向传导的关系替换为反向传导反向传导的关系,就可以得到:
    反向传导
    以上逐次从后向前求导的过程即为“反向传导”的本意所在。 ]
  4. 计算我们需要的偏导数,计算方法如下:
    反向传导


最后,我们用矩阵-向量表示法重写以上算法。我们使用“反向传导” 表示向量乘积运算符(在Matlab或Octave里用“.*”表示,也称作阿达马乘积)。若 反向传导,则 反向传导。在上一个教程中我们扩展了 反向传导 的定义,使其包含向量运算,这里我们也对偏导数 反向传导 也做了同样的处理(于是又有 反向传导 )。


那么,反向传播算法可表示为以下几个步骤:

  1. 进行前馈传导计算,利用前向传导公式,得到 反向传导直到输出层 反向传导 的激活值。
  2. 对输出层(第 反向传导 层),计算:
    反向传导
  3. 对于 反向传导 的各层,计算:
    反向传导
  4. 计算最终需要的偏导数值:
    反向传导


实现中应注意:在以上的第2步和第3步中,我们需要为每一个 反向传导 值计算其 反向传导。假设 反向传导 是sigmoid函数,并且我们已经在前向传导运算中得到了 反向传导。那么,使用我们早先推导出的 反向传导表达式,就可以计算得到 反向传导


最后,我们将对梯度下降算法做个全面总结。在下面的伪代码中,反向传导 是一个与矩阵 反向传导 维度相同的矩阵,反向传导 是一个与 反向传导 维度相同的向量。注意这里“反向传导”是一个矩阵,而不是“反向传导 与 反向传导 相乘”。下面,我们实现批量梯度下降法中的一次迭代:

 

  1. 对于所有 反向传导,令 反向传导 ,  反向传导 (设置为全零矩阵或全零向量)
  2. 对于 反向传导 到 反向传导
    1. 使用反向传播算法计算 反向传导 和 反向传导
    2. 计算 反向传导
    3. 计算 反向传导。 
  3. 更新权重参数:
    反向传导

现在,我们可以重复梯度下降法的迭代步骤来减小代价函数 反向传导 的值,进而求解我们的神经网络。

相关文章:

  • 2021-11-15
  • 2021-06-15
  • 2022-12-23
  • 2021-11-27
  • 2021-05-03
  • 2021-04-13
猜你喜欢
  • 2021-08-04
  • 2021-09-05
  • 2022-01-19
  • 2021-08-05
相关资源
相似解决方案