Transformer 架构全景:从 2017 年的原点到各大厂变种

2017 年 6 月,一篇研究机器翻译的论文 Attention Is All You Need 提出了纯注意力架构 Transformer。九年后,几乎所有旗舰大模型——GPT、Gemini、Llama、DeepSeek、Qwen——仍然跑在这个骨架上,变化的只是骨架上的部件:注意力被压缩、位置编码被旋转、前馈层被拆成上万个专家。这篇专题先把基础 Transformer 拆开讲透,再沿着三条演进主线梳理各大厂的变种,最后看看 Mamba 等挑战者的真实边界。

一、原点:纯注意力打赢机器翻译

Transformer 诞生的动机是干掉 RNN 的顺序计算:循环网络必须逐 token 串行处理,无法大规模并行。论文的做法是把序列建模完全交给自注意力——每个 token 直接与序列中所有 token 计算关联权重,一步到位。核心公式是缩放点积注意力 softmax(QK^T / √d_k)·V:查询 Q 与键 K 算相似度, softmax 归一化后对值 V 加权求和,√d_k 缩放防止点积过大把 softmax 推进饱和区。

在此基础上,论文做了两个关键设计。其一,多头注意力:把模型维度切成多份,每组独立做注意力,让不同头在各自子空间学习不同模式(语法、共指、位置关系等),最后拼接输出。其二,位置编码:自注意力本身对顺序无感,论文用不同波长的 sin/cos 函数给每个位置生成固定编码,加到输入嵌入上——并明确提到选正弦函数的部分考虑是可外推到训练中没见过的更长序列。

原始结构是 encoder-decoder 双塔:编码器双向编码源句,解码器带因果掩码逐 token 生成,两塔之间由交叉注意力连接(Q 来自解码器,K/V 来自编码器)。

graph TB
    subgraph ENC["编码器 × 6 层"]
        A["输入嵌入 + 位置编码"] --> B["多头自注意力(双向)"]
        B --> C["前馈网络 FFN"]
    end
    subgraph DEC["解码器 × 6 层"]
        F["输出嵌入 + 位置编码"] --> G["掩码多头自注意力(因果)"]
        G --> I["交叉注意力"]
        I --> K["前馈网络 FFN"]
        K --> M["线性层 + Softmax → 下一 token"]
    end
    C -->|"K、V"| I

当年成绩单放在今天看仍然惊人:base 版 65M 参数在 WMT 2014 英德翻译拿到 27.3 BLEU,big 版 213M 拿到 28.4 BLEU(超过此前含集成在内的最佳成绩 2 BLEU 以上),英法 41.8 BLEU,而 big 模型只用了 8 块 P100 训练 3.5 天。

配置 参数量 层数 模型维度 注意力头数 FFN 维度 WMT14 英德 BLEU
base 65M 6 512 8 2048 27.3
big 213M 6 1024 16 4096 28.4

小结:Transformer 用「并行 + 全连接式关联」替换了 RNN 的串行递推,encoder-decoder、多头注意力、位置编码三大件成为此后所有变种共享的家底。

二、三分天下:BERT、GPT 与 T5

原始论文的双塔很快被拆开,按「保留哪一塔、用什么目标训练」分化出三大分支:

分支 代表(年份) 结构 预训练目标 擅长场景
encoder-only BERT(2018,110M/340M) 双向注意力 掩码语言模型 MLM + 下一句预测 分类、检索、嵌入
decoder-only GPT-1(2018,117M)→ GPT-2(2019,1.5B) 因果注意力 自回归预测下一词 生成、通用 LLM
encoder-decoder T5(2019,最大 11B)、BART(2019) 完整双塔 text-to-text / 去噪重建 翻译、摘要等 seq2seq

三分支里笑到最后的是看起来最简单、只保留了单向解码器的 GPT 系。原因有几层:训练信号效率上,自回归目标对每个 token 都产生监督信号,掩码语言模型只对约 15% 被遮盖的 token 计损失;数据成本上,预测下一词只需要纯文本,MLM 的「完形填空」反而要精心设计掩码策略;推理工程上,因果注意力让历史 token 的 K/V 恒定不变,可以缓存复用,自回归解码天然高效。技术分析者 Cameron Wolfe 与 Sebastian Raschka 都指出过同一个事实:现代 LLM 的架构与 GPT 几乎一致,此后所有改良都在不动 GPT 骨架的前提下进行—— FlashAttention、RMSNorm、GQA、RoPE 换的都是零件。

encoder-decoder 一系也没有消失,T5 的 text-to-text 框架(所有任务统一成「文本进、文本出」)深刻影响了后来的指令微调格式,但它不再是旗舰基座的主流选择——2024 年以来的新旗舰清一色 decoder-only。

顺带一提,2020 年 Google 的 ViT 把图像切成 16×16 像素块当 token 喂给标准 Transformer,证明这个骨架不挑模态,为今天的多模态大模型铺了路。

小结:三分支殊途同归,decoder-only 凭训练信号密度、数据成本与 KV 缓存三项工程优势成为大模型时代的默认形态。

三、注意力的进化:一切为了 KV cache

标准注意力有两大痛点:训练时序列长度上的 O(n²) 计算量,以及推理时随上下文线性膨胀的 KV cache——解码每生成一个 token 都要把全部历史的键值对读一遍,瓶颈不在算力而在显存带宽。八年来所有注意力改良,本质上都在回答同一个问题:怎么让注意力少占显存、少走数据。路线有四条:

路线 代表工作(年份) 核心思路 收益与代价
稀疏化 Longformer、BigBird(2020) 滑窗 + 全局 token + 随机连接 复杂度降为线性,牺牲部分远程连接
线性近似 Linear Transformer、Performer(2020) 核映射替换 softmax O(n) 复杂度,近似有精度损失
IO 优化 FlashAttention v1/v2/v3(2022/2023/2024) 分块计算,减少 HBM 读写 精确不变,训练速度提升数倍
KV 压缩 MQA(2019)→ GQA(2023)→ MLA(2024) 共享或压缩键值头 显存大减,质量逼近完整 MHA

第三条路线最容易误解:FlashAttention 不是近似注意力,而是把注意力分块装进 GPU 片上内存(SRAM)、减少高频显存(HBM)往返的 IO 优化,数学结果与标准 softmax 注意力完全一致。它迭代到 2024 年的 v3(面向 H100 的异步流水线与 FP8 支持),早已是各家训练的默认组件。

真正写进各厂架构的是第四条。Shazeer 2019 年的 MQA 让所有头共享一组 K/V,推理提速明显但质量有损;Google 2023 年的 GQA 折中为「分组共享」,成为 Llama 3、Mistral、Qwen 全系的标配。最激进的变体是 DeepSeek 在 V2 中提出的 MLA(多头潜在注意力):把 K/V 低秩联合压缩成一个小的潜在向量,推理时只缓存压缩向量——官方论文给出的数字是 KV cache 只相当于 2.25 组的 GQA,性能却强于完整 MHA,相对自家 67B 稠密基座 KV cache 减少 93.3%、生成吞吐提升 5.76 倍。

另有一个常被误归为架构的组件需要澄清:vLLM 的 PagedAttention(SOSP 2023)是推理服务系统的显存管理技术——借鉴操作系统分页,把 KV cache 切成非连续小块按需分配,不改变模型本身的注意力计算。

小结:注意力改良的主线不是「换掉 softmax」,而是围绕显存做文章——先让精确注意力跑得快(FlashAttention),再把必须缓存的 K/V 压到最小(GQA/MLA)。

四、位置编码:从固定正弦到旋转外推

位置编码这条线的驱动力是长上下文。BERT、GPT 早期改用可学习的位置嵌入表,效果不错但有个硬伤:训练时最长 512/1024 个位置,推理给更长就直接越界,完全无法外推。

转折点是 2021 年苏剑林等人的 RoPE(旋转位置编码):把向量的每两维看成一个二维平面,用与位置成正比的角度只旋转 Q 和 K(不旋转 V)。妙处在于两个旋转后向量的内积只依赖位置差——以绝对位置的写法天然获得相对位置依赖,且不引入额外参数。RoPE 此后成为 Llama、Qwen、DeepSeek 等几乎所有开源模型的标准配置。另一条思路是 ALiBi(ICLR 2022):不加位置嵌入,直接在注意力分数上叠加与距离成正比的线性惩罚,不同头用不同斜率,换取平滑的长度外推。

RoPE 系真正的主战场是上下文扩展。2023 年密集出现了三件套:Meta 的位置插值(PI)把位置坐标线性压缩回训练范围,约千步微调即可把 LLaMA 扩到 32K;社区(Reddit r/LocalLLaMA 与 kaiokendev,非正式论文)提出的 NTK-aware 缩放按频率区别对待——高频分量插值、低频分量外推,免微调即可扩上下文;Nous Research 等人的 YaRN(ICLR 2024)把前者系统化为按频率分段插值加注意力温度缩放,千步训练把 LLaMA 扩到 128K。DeepSeek-V3 的 128K 上下文、Qwen 的长上下文版本,用的都是 YaRN 一系方法。

小结:位置编码从「给模型位置感」的配角,演变成决定上下文窗口上限的主角;RoPE 加外推缩放,是今天长上下文的事实标准。

五、MoE:让万亿参数只激活一小撮

稠密模型有个残酷的算术:每增加一个参数,每个 token 都要为它付费。混合专家(MoE) 的解法是把 FFN 拆成多个并行「专家」,由路由器为每个 token 挑选少数几个激活——参数量与计算量就此解耦。

这条线的里程碑依次是:Google GShard(2020)把稀疏 MoE 推到 600B 参数、确立 top-2 路由;Switch Transformer(2021)简化到 top-1、冲上 1.6T,同算力预训练提速最高 7 倍;Mistral 的 Mixtral 8x7B(2023-12)用 8 专家取 2 的克制设计第一次让开源社区摸到 MoE——总参数 46.7B、每 token 只激活 12.9B,官方评测口径下效果对齐大得多的稠密模型。

2024 年底 DeepSeek-V3 把这套玩法定到了新高度:细粒度专家(每层 256 个路由专家、每 token 激活 8 个,专家切得更碎、组合更灵活)加共享专家(1 个常驻专家吸收通用知识),总参数 671B、每 token 仅激活 37B。工程上它还解决了 MoE 的老大难「负载均衡」——传统方案靠辅助损失强行拉平各专家负载,但辅助损失会干扰主目标;V3 改用免辅助损失的偏置调节:每个专家带一个只参与路由、不进门控值的偏置项,过载就调低、闲置就调高。训练目标上还叠加了多 token 预测(MTP),每个位置额外预测 1 个未来 token,推理时可丢弃或用于投机解码。官方报告给出的训练成本口径是 2.788M H800 GPU 小时、按每小时 2 美元折算约 557.6 万美元——并注明不含前期研究与消融实验。

小结:MoE 的演进是从「能路由」到「路由得好」——专家更碎、均衡不再伤模型,2025 年起旗舰开源模型几乎全是 MoE。

六、2026 年的旗舰架构地图

把各家旗舰摊开对比,能看清八年来改件的组合方式。截至 2026-10-09 的公开信息如下:

模型(发布) 厂商 注意力 位置编码 FFN 参数(总/激活) 上下文 开源
GPT-4 及之后(2023+) OpenAI 未公开 未公开 未公开 未公开 未公开 ✗
Gemini 1.5/2.5(2024+) Google 未公开(报告确认稀疏 MoE) 未公开 MoE 未公开 1M–2M ✗
Llama 3.1 405B(2024) Meta GQA(8 组 KV) RoPE(base 500K) SwiGLU,稠密 405B / — 128K ✓
Mixtral 8x7B(2023) Mistral GQA + 滑窗(4096) RoPE 8 专家取 2 46.7B / 12.9B 32K ✓
DeepSeek-V3(2024-12) DeepSeek MLA RoPE + YaRN 256+1 专家取 8 671B / 37B 128K ✓
Llama 4(2025-04) Meta GQA + iRoPE RoPE,交替插入无位置编码层 16–128 专家 109B–400B / 17B 官方宣称 10M ✓
Qwen3-235B(2025) 阿里 GQA + QK-Norm RoPE + YaRN 128 专家取 8 235B / 22B 128K(2507 版 256K) ✓

这张表背后有三个值得展开的观察。

**第一,没有架构革命,只有零件升级。**对照 2017 年的原型,今天的旗舰仍然是「嵌入 + 多头注意力 + FFN 堆 N 层」,换掉的是:注意力里的 KV 头(GQA/MLA)、位置编码(RoPE 系)、FFN(MoE)、归一化(RMSNorm、Pre-Norm)与激活(SwiGLU)。2025 年的推理模型浪潮同样不涉及新基座——DeepSeek-R1 就是在 V3-Base 上直接大规模强化学习(GRPO)的产物,架构与 V3 完全一致;OpenAI o1/o3 走的同是 RL 后训练路线(基座是否变化属业界推断,官方未披露架构文件)。

**第二,dense 转 MoE 是 2025 年的分水岭。**Llama 3 的 405B 还是官方明确表态的「标准稠密 Transformer」;到 Llama 4,Scout 与 Maverick 全部转为 MoE(17B 激活、16/128 专家),并引入 iRoPE——多数层用 RoPE、交替插入无位置编码的注意力层,配合推理时注意力温度缩放,宣称支持 10M 上下文(该数字为官方口径,社区实测有质疑)。Qwen3 旗舰同样 MoE 化,并引入 QK-Norm 替代 QKV 偏置来稳定训练。

**第三,透明度两极分化。**开源阵营把架构公开到专家数量乃至 GPU 小时;OpenAI 自 GPT-4 起以竞争与安全为由不再披露架构,Google 的 Gemini 技术报告确认「稀疏 MoE」但不含任何参数与结构数字。研究社区对这种透明度收缩已有明确批评。

小结:2026 年旗舰的公式可以概括为「decoder-only + RoPE 系位置编码 + KV 压缩注意力 + MoE + RL 后训练」,各家差异只在零件的选型与配比。

七、挑战者的边界:Mamba、RWKV 与 Transformer 的软肋

Transformer 并非没有软肋,挑战者也从未停止出现。Mamba(2023-12)用选择性状态空间模型(SSM)实现线性复杂度与常数推理内存,推理吞吐约为 Transformer 的 5 倍,此后迭代到 Mamba-2 与 2026 年 3 月的 Mamba-3;社区驱动的 RWKV 走 RNN 式线性推理路线,已迭代到 RWKV-7(2025-03);AI21 的 Jamba 则干脆把 Mamba 层与注意力层、MoE 混在同一模型里,主打 256K 上下文下的低成本部署。

但「取代 Transformer」的命题至今未被证实。反方证据链相当扎实:Repeat After Me(2024)证明固定大小的隐状态让 SSM 在复制与上下文检索这类任务上有原理性瓶颈,Transformer 则能轻松胜出;NVIDIA 的 RULER 基准(2024)发现宣称 32K 以上上下文的模型约一半在实际测试中不合格;NoLiMa(2025)在去掉字面匹配线索后,多数模型的长上下文性能跌破短上下文基线的一半;Lost in the Middle(2023)揭示了注意力对上下文中间位置的信息遗忘。截至 2026-10-09,没有任何一家旗舰采用纯线性架构,存活下来的形态是 Jamba 式混合——用 SSM 层省成本,保留少量注意力层管精确检索。

对 Transformer 自身的批评也值得记录。ICML 2021 那篇标题唱反调的 Attention is not all you need 证明:没有残差连接的纯注意力网络,输出秩随深度双指数坍缩,所有 token 表示趋同——真正托住深度 Transformer 的其实是残差连接而非注意力本身。至于大模型幻觉,Hallucination is Inevitable(2024)从可计算性理论出发论证任何可计算的 LLM 都无法消除幻觉——这是所有架构共享的先天限制,不能简单归罪于 Transformer。

小结:挑战者证明了 Transformer 的低效,也暴露了自身的检索瓶颈;八年过去,答案是混合而非替换。

结语

回头看,这九年是一场「骨架不动、杠杆越撬越远」的进化:注意力本体始终是那个 softmax 点积,但 KV cache 被压到几十分之一,上下文从 512 撑到百万级,参数从 213M 涨到万亿而单 token 成本近乎不变。所谓「各大厂的变种」,本质是各家用同一副骨架回答同一组工程约束——显存、带宽、算力——的不同解。下一个十年会不会出现真正改写骨架的架构,Mamba-3 与它的同行者们还在排队;但至少今天,「Attention is all you need」的后半句依然是:attention,加一堆精心设计的工程改良。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?