众力资讯网

什么是Multi-Head Attention? 这组图从 Self Atten

什么是Multi-Head Attention?
这组图从 Self Attention 的 Q、K、V 开始,一路拆到 Multi-Head Attention:为什么要“多头”、512 维怎么拆成 8 个 64 维的 Head,以及不同 Head 最后又是怎么拼回来的。

中间用 “I love AI” 做了一个很直观的小例子:同一句话,不同注意力头可以学到不同的关注模式,有的更关注主谓关系,有的更关注动宾关系。多个视角同时工作,再经过拼接和线性变换,最终得到信息更完整的表示。

最后也把它在 Transformer 里的三个典型位置串起来了:Encoder Self Attention、Decoder Masked Self Attention、Decoder Cross Attention。理解到这里,Transformer 里最核心的一块基本就顺下来了。
大模型 AI人工智能 人工智能未来 agent 多头注意力 Transformer AI工具 学习笔记