【发布时间】:2019-07-09 04:49:35
【问题描述】:
我试图弄清楚如何通过按比例缩放的点积注意力模型进行反向传播。 scaled dot production attention以Q(Queries),K(Keys),V(Values)为输入,进行如下操作:
注意力(Q,K,V ) = softmax((Q.transpose(K))/√dk )V
这里的√dk是比例因子,是一个常数。
这里 Q、K 和 V 是张量。我现在假设 Q=K=V。 所以我将公式 (softmax((Q.transpose(Q)))Q) 与 Q 进行微分。 我想答案是:
softmax((Q.transpose(Q))) + Q.derivativeOfSoftmax((Q.transpose(Q))).(2*transpose(Q))
因为我认为 Q.transpose(Q) wrt Q 的导数是 2*Q.transpose(Q)。
考虑到张量演算的规则,这是正确的方法吗?如果不是请告诉我如何进行。
可以参考给定论文中缩放点积注意力的概念: https://arxiv.org/pdf/1706.03762.pdf
【问题讨论】:
标签: backpropagation tensor attention-model