【发布时间】:2018-11-08 01:42:19
【问题描述】:
这里有人知道现有神经网络架构中的层之间是否存在任何类型的标准化或缩放?
缩放输入很常见,我熟悉 ReLU 爆炸。我看到的大多数模型都显示了小范围的值,例如 -2 到 +2,但我看不出如何在层与层之间保持这种状态。无论激活函数如何,第二层输出都是几十,第三层是几百,最终输出是几万。在最坏的情况下,该层返回 NaN。可以通过缩放或交替 ReLU/sigmoid 来解决,但我想知道这是否常见?
【问题讨论】:
标签: machine-learning neural-network deep-learning conv-neural-network perceptron