【问题标题】:Confused usage of dropout in mini-batch gradient descent小批量梯度下降中 dropout 的混淆使用
【发布时间】:2018-07-15 01:05:59
【问题描述】:

我的问题到最后了。

一个example CNN 使用 mini-batch GD 训练,并使用最后一个全连接层(第 60 行)中的 dropout 作为

fc1 = tf.layers.dropout(fc1, rate=dropout, training=is_training)

起初我认为tf.layers.dropouttf.nn.dropout 在列中随机将神经元设置为零。但我最近发现情况并非如此。下面的代码打印了dropout 的作用。我使用fc0 作为 4 x 10 特征矩阵,fc 作为 drop out 版本。

import tensorflow as tf
import numpy as np

fc0 = tf.random_normal([4, 10])
fc = tf.nn.dropout(fc0, 0.5)

sess = tf.Session()
sess.run(tf.global_variables_initializer())

a, b = sess.run([fc0, fc])
np.savetxt("oo.txt", np.vstack((a, b)), fmt="%.2f", delimiter=",")

在输出oo.txt(原始矩阵:第1-4行,丢弃矩阵:第5-8行):

0.10,1.69,0.36,-0.53,0.89,0.71,-0.84,0.24,-0.72,-0.44
0.88,0.32,0.58,-0.18,1.57,0.04,0.58,-0.56,-0.66,0.59
-1.65,-1.68,-0.26,-0.09,-1.35,-0.21,1.78,-1.69,-0.47,1.26
-1.52,0.52,-0.99,0.35,0.90,1.17,-0.92,-0.68,-0.27,0.68
0.20,0.00,0.71,-0.00,0.00,0.00,-0.00,0.47,-0.00,-0.87
0.00,0.00,0.00,-0.00,3.15,0.07,1.16,-0.00,-1.32,0.00
-0.00,-3.36,-0.00,-0.17,-0.00,-0.42,3.57,-3.37,-0.00,2.53
-0.00,1.05,-1.99,0.00,1.80,0.00,-0.00,-0.00,-0.55,1.35

我对 正确的? dropout 的理解是,在 mini-batch 中为每个样本剔除 p% same 单位>batch梯度下降阶段,反向传播更新“细化网络”的权重和偏差。然而,在example的实现中,一个批次中每个样本的神经元被随机丢弃,如oo.txt第5到8行所示,对于每个样本,“细化网络”是不同

作为比较,在随机梯度下降的情况下,样本被一个一个地输入神经网络,并且在每次迭代中,每个 tf.layers.dropout 引入的“细化网络”的权重都会更新。

我的问题是,在 mini-batch 或 batch 训练中,不应该实现为一批中的所有样本敲除相同的神经元吗?也许通过在每次迭代中对所有输入批次样本应用一个掩码? 比如:

# ones: a 1xN all 1s tensor
# mask: a 1xN 0-1 tensor, multiply fc1 by mask with broadcasting along the axis of samples
mask = tf.layers.dropout(ones, rate=dropout, training=is_training)
fc1 = tf.multiply(fc1, mask)

现在我在想example 中的 dropout 策略可能是更新某个神经元权重的加权方式,如果一个神经元保持在 10 个样本中的 1 个中mini-batch,它的权重将更新alpha * 1/10 * (y_k_hat-y_k) * x_k,与alpha * 1/10 * sum[(y_k_hat-y_k) * x_k]相比,在所有10个样本中保存另一个神经元的权重?

来自here的截图

【问题讨论】:

    标签: tensorflow machine-learning neural-network gradient-descent mini-batch


    【解决方案1】:

    Dropout 通常用于防止过拟合。在这种情况下,将一个巨大的权重应用于其中一个神经元。通过不时地将其随机设为 0,您可以强制网络使用更多的神经元来确定结果。为使其正常工作,您应该为每个示例删除不同的神经元,以便您计算的梯度更类似于您在没有丢失的情况下得到的梯度。

    如果您要为批次中的每个示例删除相同的神经元,我的猜测是您的梯度会不太稳定(可能对您的应用程序无关紧要)。

    此外,dropout 会放大其余值,以将平均激活值保持在大致相同的水平。没有它,当你关闭 dropout 时,网络会学习错误的偏差或过度饱和。

    如果您仍希望在批处理中删除相同的神经元,则将 dropout 应用于形状为 (1, num_neurons) 的全 1 张量,然后将其与激活值相乘。

    【讨论】:

    • 随机抽样的解释有助于理解 big-batch 梯度下降的情况。但是对于 mini-batch GD 案例,我认为没有足够的样本(几个到几十个)来模拟完整网络中的 GD。我猜它应该是淘汰相同的神经元并为每次迭代更新权重,这会在每个时期(更大的循环)而不是每个小批量中留下随机采样?
    • 就像我说的,它可能适用于您的情况,但在其他情况下可能会带来更多的不稳定性。
    【解决方案2】:

    当使用 dropout 时,您实际上是在尝试使用 Monte-Carlo 采样(通过积分符号下的微分,平均梯度等于平均梯度)。通过为每个小批量固定一个 dropout 掩码,您只是在连续梯度估计之间引入相关性,这会增加方差并导致训练速度变慢。

    想象一下,对小批量中的每张图像使用不同的 dropout-mask,但从同一图像的 k 个副本中形成小批量;很明显,这完全是白费力气!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-06-03
      • 1970-01-01
      • 1970-01-01
      • 2018-09-09
      • 2014-10-10
      • 2022-06-21
      • 2017-03-15
      • 2017-11-27
      相关资源
      最近更新 更多