Clipping 微信公众号

AI的Transformer一直很模糊?一个汉堡让我终于懂了

by 小爽爽鸭 原文 ↗
Created: 2026-05-18

公众号名称:小爽爽学智能体鸭

作者名称:小爽爽鸭

发布时间:2026-03-23 11:05

基于前面的一篇文章继续思考,神经网络是多层的,主流架构是Transformer。虽然以前接触过这个概念,但还是很模糊,以至于我很好奇它究竟是什么。

我试着向AI请教,它给出了一个形象的比喻:Transformer就像一个多层汉堡。

每一层结构相同(注意力 + 前馈网络),但参数独立不同。从输入到输出一层层堆叠,中间用残差连接 + 一层归一化当酱料固定。

PS:前馈网络(FFN)由两个全连接层加一个激活函数组成,对每个词独立进行非线性变换,词与词之间没有信息交互。MoE(混合专家)就是在原来放FFN的位置,换成多个并行的”专家”加一个路由器,让数据只找最对口的专家处理——活更精、人更省。


01 输入:从文字到向量

用户输入一句话,模型先拆成token,每个token转成一个向量——相当于这个词在高维空间里的一个坐标点。

一开始,向量只代表孤立的词义。比如”苹果”既可以是水果,也可以是公司,模型还不知道该往哪个方向理解。于是,它需要上下文。

原始文本 → 分词器(Tokenizer) → token ID 序列 → 嵌入层(Embedding Layer) → 初始向量序列 →多层Transformer堆叠 → 上下文感知的向量序列


02 注意力机制:每个词注意所有词

每一层最开始,所有词同时相互”打量”,看谁跟谁关系大。这个过程是并行的,不用排队等。

注:在GPT这类生成式模型中,每个词只能注意到它前面的词,不能“偷看”后面。

具体操作:

- 每个词通过三个不同的权重矩阵,从输入向量映射出查询(Q)、键(K)、值(V)

- 用Q和K匹配得到相关分数,归一化成权重

- 用权重加权求和所有词的V

结果:每个词的新向量里,混进了整句话中跟它最相关的信息。

这就是注意力机制——它让每个词都能从整句话里按相关性加权汇总信息,相当于把分散但相关的词语“聚合”到当前词的表示中,而不是简单地做聚类。


03 残差连接:每一层都要传递

Transformer每个子层(注意力层、前馈网络)后面都有一个固定操作:把输入和输出加起来,再传给下一部分。这叫残差连接。

作用很简单,让每一层保留原始输入的部分信息,即使堆到上百层,前面的信息也不会丢失,训练也更稳定。


04 前馈网络:每个词都要思考

注意力层让词与词完成了”交流”。接下来,每个词需要自己消化这些信息,做非线性变换,提取更高层特征。

这就是前馈网络(FFN)的作用,通常由两个全连接层加一个激活函数(如ReLU或SwiGLU)组成。

在普通模型里这一步就是FFN。但在很多现代大模型(如DeepSeek、Mixtral)中,这里换成了混合专家模型(MoE)——设置一组专家网络,加一个路由机制,每个词只激活最合适的少数专家来处理。

MoE的思路:

- 把原来一块”前馈肉饼”的位置,换成多个并排放着的小肉饼,每个叫一个”专家”

- 每个专家是一个独立的小型FFN,它们擅长的模式并非人工指定,而是在训练过程中,由路由机制自动分配。模型会自然地把不同类型的词或模式分配给不同的专家处理。

- 对每个词,路由器给所有专家打分,只挑分数最高的前几名(如前2个)来计算

- 最后按路由分数加权求和,得到这一层的最终结果

好处是:总参数可以非常大,但每个词实际用到的参数很少,既保证效果,又控制成本。


05 多层堆叠:词性语义,层层抽象

上面说的”注意力 → 前馈/MoE”只是一个层。Transformer由几十甚至上百个这样的层堆叠而成。

每一层在做不同抽象层次的工作:

- 底层:更关注局部搭配和词与词之间的邻近关系。比如“苹果”和“好吃”在位置上接近

- 中层:开始形成短语级别的语义,比如“苹果很好吃”被理解为一个整体描述

- 高层:学会逻辑、情感、全局意图。比如整句话是在表达喜好

汉堡包一层层往上,从字词理解走到句子理解,甚至段落理解。


06 用汉堡来概括整个架构

整个结构就像一个多层汉堡:

  • 最底下是输入层(原始向量)

  • 往上每一层都是两片肉饼:

  • 第一片:多头注意力(词与词交流)

  • 第二片:前馈网络或MoE(词自身思考)

  • 两片肉饼之间,用残差连接 + 层归一化当酱料固定

  • 一层做完再往上叠一层,结构相同,但每层参数不同

汉堡叠得越高,模型能学到的语义就越深。


07 为什么选Transformer架构?

为什么现在所有大模型都用这个”多层汉堡”,而不是以前的架构?

用比喻来理解三种架构的区别:

  • RNN

    像按顺序看书,一行一行往下读,读到后面容易忘记前面,而且没法一目十行(难以并行)

  • CNN

    用在视觉模型上,像用滑动窗口看句子,一次只看一小部分,想看远距离关联就得加深层数来逐步扩大感受野(感受野:一个神经元(或一个输出)能看到原始输入的“范围”有多大。)

  • Transformer

    把整段文字摊开,每个词同时看所有词,通过注意力机制自动找出哪些词关系最紧密

RNN的短板:必须等上一步算完,串行导致慢,GPU使不上劲;难以做深,处理长句子时,早期信息经过层层传递后容易衰减或丢失(即梯度消失),导致模型记不住前面的内容。

CNN的短板:擅长捕捉局部模式,长距离依赖需要加深网络来间接扩大视野,不如Transformer直接。

Transformer的优势

- 并行能力:所有词同时算注意力,训练快

- 长距离依赖:一层之内所有词直接相连,不管隔多远都能一步到位

- 训练稳定性:残差连接+层归一化,信息在每一层都保留原始副本,可稳稳堆上百层

- 扩展性:架构能大能深,配合MoE可做到万亿级参数

简单说,就是四个字:快、稳、深、大。


08 现代模型:在这个汉堡上做优化

现在的GPT、DeepSeek、LLaMA等主流模型,都长得像这个汉堡,但在细节上做了很多”食材升级”:

  • 注意力

    标准多头注意力(MHA)每个头都需要缓存KV,显存开销大。现在流行的分组查询注意力(GQA)让多个头共享KV缓存,省显存、速度快

  • 位置信息

    原来加固定”位置编号”作为绝对位置编码,限制了长度外推能力。现在换成旋转位置编码(RoPE),通过旋转矩阵编码相对位置,能更好地外推至更长文本

  • 前馈

    有的换成MoE——把一块大肉饼换成多个并行小肉丁,每次只挑最合适的几粒炒;有的将激活函数换成SwiGLU,换了一种更香的调料配方

  • 归一化

    原来在每层做完后才抹酱(后置归一化),容易训练不稳。现在大多改成先抹酱再煎肉饼(前置归一化),并把酱料简化成RMSNorm,既稳当又清爽

这些升级有的为了省显存、有的为了跑更快、有的为了能读更长文章。但不管怎么换,多层汉堡的结构始终没变:依然是”注意力 + 前馈”两块肉饼,中间用残差和归一化当酱料,一层层摞起来。


09 总结思考

Transformer就是一个多层汉堡:

  • 神经网络是多层的

  • 每一层结构相同,但参数独立不同

  • 每一层都由注意力机制和前馈网络(或MoE)组成

  • 中间用残差连接 + 层归一化固定

  • 一层层堆叠,让理解从词性逐步抽象到语义

相比RNN和CNN,Transformer用注意力机制实现了彻底并行,用残差+归一化撑起了上百层深度,让大模型真正”大”了起来。

一个多层汉堡,每一层都夹着注意力与思考,再用残差把每一层的味道都留住。


从RNN按顺序一行行读,到Transformer基于注意力留意关键词之间的上下文、对不同关键词给予不同关注度,这是模型之间的演变过程。

我就在想:

这种过程很有意思,这种演变不只是技术上的,也像极了我们处理或者思考信息的一种方式。

从串行到并行、从局部到全局的思维演变。

看书的时候,如果按顺序一行行读,很容易读了后面忘了前面。但如果能”直接通过注意力”来读,先看清整体,再让关键概念之间彼此关联,根据不同重要性投入不同的关注度,理解就会深得多。

模型树阅读法,好像就是这个原理:读书时留意目标关注的句子,再关注句子中词语与词语之间的因果关系,进一步思考上下文关系。

文章来源于自己的疑惑,于是跟AI互动后形成,不是特别严谨,不过对于我对Transformer架构有了更深的理解。

模型树这里有个免费的卷,有兴趣的小伙伴可以看看。


cover_image

原创 小爽爽鸭 小爽爽学智能体鸭


内容效果不满意?点此反馈

输入关键词开始搜索