【发布时间】:2020-06-22 01:16:36
【问题描述】:
我很困惑为什么我们在执行 dropout 正则化时需要保留预期输出的值。为什么在训练和测试阶段 layer l 的输出均值不同很重要? dropout 后不为零的权重只是其自身的一个稍微缩放的值,它如何影响神经网络的决策能力?
根据question 下的评论,如果不缩放,输出层 sigmoid 可能会将值解释为 0 而不是 1。但是无论如何丢弃的权重都没有贡献。
请稍作说明,我无法看到这个概念的大局。
【问题讨论】:
标签: machine-learning deep-learning neural-network regularized dropout