长篇博文:Transformer 全解 -- 完整拆解 Transformer 架构,并从零开始逐步编写一个类似 BERT 的模型。地址:www.vizuaranewsletter.com/p/the-transformers
这是一篇篇幅很长、偏入门和实操的 Transformer 教程。文章从“大语言模型如何预测下一个词”讲起,依次解释子词分词与 BPE、词嵌入和位置编码,随后用矩阵和数值示例详细推导 Query、Key、Value、缩放点积注意力、因果遮罩和多头注意力,再介绍 LayerNorm、前馈网络、残差连接,以及预训练、微调和迁移学习。
