AI的Transformer一直很模糊?一个汉堡让我终于懂了
公众号名称:小爽爽学智能体鸭
作者名称:小爽爽鸭
发布时间:2026-03-23 11:05

基于前面的一篇文章继续思考,神经网络是多层的,主流架构是Transformer。虽然以前接触过这个概念,但还是很模糊,以至于我很好奇它究竟是什么。
我试着向AI请教,它给出了一个形象的比喻:Transformer就像一个多层汉堡。
每一层结构相同(注意力 + 前馈网络),但参数独立不同。从输入到输出一层层堆叠,中间用残差连接 + 一层归一化当酱料固定。
PS:前馈网络(FFN)由两个全连接层加一个激活函数组成,对每个词独立进行非线性变换,词与词之间没有信息交互。MoE(混合专家)就是在原来放FFN的位置,换成多个并行的”专家”加一个路由器,让数据只找最对口的专家处理——活更精、人更省。

01 输入:从文字到向量
用户输入一句话,模型先拆成token,每个token转成一个向量——相当于这个词在高维空间里的一个坐标点。
一开始,向量只代表孤立的词义。比如”苹果”既可以是水果,也可以是公司,模型还不知道该往哪个方向理解。于是,它需要上下文。
原始文本 → 分词器(Tokenizer) → token ID 序列 → 嵌入层(Embedding Layer) → 初始向量序列 →多层Transformer堆叠 → 上下文感知的向量序列

02 注意力机制:每个词注意所有词
每一层最开始,所有词同时相互”打量”,看谁跟谁关系大。这个过程是并行的,不用排队等。
注:在GPT这类生成式模型中,每个词只能注意到它前面的词,不能“偷看”后面。
具体操作:
- 每个词通过三个不同的权重矩阵,从输入向量映射出查询(Q)、键(K)、值(V)
- 用Q和K匹配得到相关分数,归一化成权重
- 用权重加权求和所有词的V
结果:每个词的新向量里,混进了整句话中跟它最相关的信息。
这就是注意力机制——它让每个词都能从整句话里按相关性加权汇总信息,相当于把分散但相关的词语“聚合”到当前词的表示中,而不是简单地做聚类。

03 残差连接:每一层都要传递
Transformer每个子层(注意力层、前馈网络)后面都有一个固定操作:把输入和输出加起来,再传给下一部分。这叫残差连接。
作用很简单,让每一层保留原始输入的部分信息,即使堆到上百层,前面的信息也不会丢失,训练也更稳定。
04 前馈网络:每个词都要思考
注意力层让词与词完成了”交流”。接下来,每个词需要自己消化这些信息,做非线性变换,提取更高层特征。
这就是前馈网络(FFN)的作用,通常由两个全连接层加一个激活函数(如ReLU或SwiGLU)组成。
在普通模型里这一步就是FFN。但在很多现代大模型(如DeepSeek、Mixtral)中,这里换成了混合专家模型(MoE)——设置一组专家网络,加一个路由机制,每个词只激活最合适的少数专家来处理。
MoE的思路:
- 把原来一块”前馈肉饼”的位置,换成多个并排放着的小肉饼,每个叫一个”专家”
- 每个专家是一个独立的小型FFN,它们擅长的模式并非人工指定,而是在训练过程中,由路由机制自动分配。模型会自然地把不同类型的词或模式分配给不同的专家处理。
- 对每个词,路由器给所有专家打分,只挑分数最高的前几名(如前2个)来计算
- 最后按路由分数加权求和,得到这一层的最终结果
好处是:总参数可以非常大,但每个词实际用到的参数很少,既保证效果,又控制成本。

05 多层堆叠:词性语义,层层抽象
上面说的”注意力 → 前馈/MoE”只是一个层。Transformer由几十甚至上百个这样的层堆叠而成。
每一层在做不同抽象层次的工作:
- 底层:更关注局部搭配和词与词之间的邻近关系。比如“苹果”和“好吃”在位置上接近
- 中层:开始形成短语级别的语义,比如“苹果很好吃”被理解为一个整体描述
- 高层:学会逻辑、情感、全局意图。比如整句话是在表达喜好
汉堡包一层层往上,从字词理解走到句子理解,甚至段落理解。
06 用汉堡来概括整个架构
整个结构就像一个多层汉堡:
-
最底下是输入层(原始向量)
-
往上每一层都是两片肉饼:
-
第一片:多头注意力(词与词交流)
-
第二片:前馈网络或MoE(词自身思考)
-
两片肉饼之间,用残差连接 + 层归一化当酱料固定
-
一层做完再往上叠一层,结构相同,但每层参数不同
汉堡叠得越高,模型能学到的语义就越深。

07 为什么选Transformer架构?
为什么现在所有大模型都用这个”多层汉堡”,而不是以前的架构?
用比喻来理解三种架构的区别:
-
RNN
像按顺序看书,一行一行往下读,读到后面容易忘记前面,而且没法一目十行(难以并行)
-
CNN
用在视觉模型上,像用滑动窗口看句子,一次只看一小部分,想看远距离关联就得加深层数来逐步扩大感受野(感受野:一个神经元(或一个输出)能看到原始输入的“范围”有多大。)
-
Transformer
把整段文字摊开,每个词同时看所有词,通过注意力机制自动找出哪些词关系最紧密
RNN的短板:必须等上一步算完,串行导致慢,GPU使不上劲;难以做深,处理长句子时,早期信息经过层层传递后容易衰减或丢失(即梯度消失),导致模型记不住前面的内容。
CNN的短板:擅长捕捉局部模式,长距离依赖需要加深网络来间接扩大视野,不如Transformer直接。
Transformer的优势:
- 并行能力:所有词同时算注意力,训练快
- 长距离依赖:一层之内所有词直接相连,不管隔多远都能一步到位
- 训练稳定性:残差连接+层归一化,信息在每一层都保留原始副本,可稳稳堆上百层
- 扩展性:架构能大能深,配合MoE可做到万亿级参数
简单说,就是四个字:快、稳、深、大。

08 现代模型:在这个汉堡上做优化
现在的GPT、DeepSeek、LLaMA等主流模型,都长得像这个汉堡,但在细节上做了很多”食材升级”:
-
注意力
标准多头注意力(MHA)每个头都需要缓存KV,显存开销大。现在流行的分组查询注意力(GQA)让多个头共享KV缓存,省显存、速度快
-
位置信息
原来加固定”位置编号”作为绝对位置编码,限制了长度外推能力。现在换成旋转位置编码(RoPE),通过旋转矩阵编码相对位置,能更好地外推至更长文本
-
前馈
有的换成MoE——把一块大肉饼换成多个并行小肉丁,每次只挑最合适的几粒炒;有的将激活函数换成SwiGLU,换了一种更香的调料配方
-
归一化
原来在每层做完后才抹酱(后置归一化),容易训练不稳。现在大多改成先抹酱再煎肉饼(前置归一化),并把酱料简化成RMSNorm,既稳当又清爽
这些升级有的为了省显存、有的为了跑更快、有的为了能读更长文章。但不管怎么换,多层汉堡的结构始终没变:依然是”注意力 + 前馈”两块肉饼,中间用残差和归一化当酱料,一层层摞起来。

09 总结思考
Transformer就是一个多层汉堡:
-
神经网络是多层的
-
每一层结构相同,但参数独立不同
-
每一层都由注意力机制和前馈网络(或MoE)组成
-
中间用残差连接 + 层归一化固定
-
一层层堆叠,让理解从词性逐步抽象到语义
相比RNN和CNN,Transformer用注意力机制实现了彻底并行,用残差+归一化撑起了上百层深度,让大模型真正”大”了起来。
一个多层汉堡,每一层都夹着注意力与思考,再用残差把每一层的味道都留住。

从RNN按顺序一行行读,到Transformer基于注意力留意关键词之间的上下文、对不同关键词给予不同关注度,这是模型之间的演变过程。
我就在想:
这种过程很有意思,这种演变不只是技术上的,也像极了我们处理或者思考信息的一种方式。
从串行到并行、从局部到全局的思维演变。
看书的时候,如果按顺序一行行读,很容易读了后面忘了前面。但如果能”直接通过注意力”来读,先看清整体,再让关键概念之间彼此关联,根据不同重要性投入不同的关注度,理解就会深得多。

模型树阅读法,好像就是这个原理:读书时留意目标关注的句子,再关注句子中词语与词语之间的因果关系,进一步思考上下文关系。
文章来源于自己的疑惑,于是跟AI互动后形成,不是特别严谨,不过对于我对Transformer架构有了更深的理解。
模型树这里有个免费的卷,有兴趣的小伙伴可以看看。


原创 小爽爽鸭 小爽爽学智能体鸭
内容效果不满意?点此反馈