【发布时间】:2021-11-02 06:45:03
【问题描述】:
我正在阅读一些张量核心material 和简单 GEMM 上的相关代码。我有两个问题:
1、D=A*B+C使用张量核时,将两个fp16矩阵4x4相乘,并将乘积fp32矩阵加到fp32累加器中。为什么两个fp16输入乘法A*Bresults为fp32类型?
2、在代码example中,为什么需要比例因子alpha和beta?在示例中,它们被设置为2.0f
来自 NV 博客的代码 sn-p:
for(int i=0; i < c_frag.num_elements; i++) {
c_frag.x[i] = alpha * acc_frag.x[i] + beta * c_frag.x[i];
}
【问题讨论】:
标签: cuda