算法手撕面经系列(1)--手撕多头注意力机制

多头注意力机制

 一个简单的多头注意力模块可以分解为以下几个步骤:

  1. 先不分多头,对输入张量分别做变换,得到Q,K,VQ,K,VQ,K,V
  2. 对得到的Q,K,VQ,K,VQ,K,V按头的个数进行split;
  3. Q,KQ,KQ,K计算向量点积
  4. 考虑是否要添因果mask
  5. 利softmax计算注意力得分矩阵atten
  6. 对注意力得分矩阵施加Dropout
  7. 将atten矩阵和VVV矩阵相乘
  8. 再过一道最终的输出变换

代码

 给出一个dk=dv=dmodeld_k=d_v=d_{model}dk=

评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值