「XX 架构将取代 Transformer」是 AI 圈最经久不衰的标题党题材,而线性注意力是喊得最久的那一个。到 2026 年,结局浮出水面,却与「取代」毫无关系:Qwen3-Next、Kimi Linear、Kimi K3、IBM Granite 4 这些一线模型把 softmax 注意力的层占比从 100% 压到了 10%-25%,其余 75% 以上的层换成了 Mamba、Gated DeltaNet、KDA 这类常数状态层。注意力没有被杀死——它被稀释了。这场稀释是怎么发生的,为什么要留那 25%,是本文要回答的两个问题。
一、诱惑:O(1) 状态对上无界账单
softmax 注意力的推理账单有两项绕不开:每生成一个 token 要按上下文长度重读 KV Cache(每步 O(n)),且缓存随对话无限增长。而 RNN 式模型的记忆是一个固定大小的状态矩阵,每步 O(1),内存恒定。线性注意力的开山之作《Transformers are RNNs》(arXiv 2006.16236,2020)正是点破了这层关系:把注意力写成核特征图的线性点积 φ(Q)(φ(K)ᵀV),利用矩阵乘法结合律把复杂度降到 O(n),自回归形式随之改写成 RNN 递推。Performer(arXiv 2009.14794)则用正交随机特征对 softmax 核做无偏近似。理论上很美,但这两代模型的质量始终追不上 softmax——问题出在哪,两年后才被讲清楚。
二、早期失败:短板叫「召回」
2023 年底,斯坦福 Hazy Research 的 Zoology 研究给出了关键测量:17 个预训练模型里,门控卷积类(非注意力)模型在语言建模上的差距,82% 来自上下文召回;一个 70M 参数的注意力模型在召回任务上能赢过 1.4B 的非注意力模型。他们设计的 MQAR(多查询联想记忆)基准成了这条战线的标准试金石。随后 Jelassi 等人从理论上补刀(arXiv 2402.01032):固定状态的模型在复制任务上有天然的长度天花板,而两层注意力就能复制指数长的字符串。Merrill 等人(arXiv 2404.08819)进一步证明 SSM 的表达力不超出电路复杂度类 TC⁰,在棋步跟踪、代码求值这类状态跟踪任务上可证失败。
一句话:线性模型记得住「平均」,记不住「精确」——而无界的精确检索恰恰是语言模型的核心能力。
三、三条复兴线:SSM、RNN 与 Delta Rule
失败没有终结这条路线,反而逼出了三代改进。
SSM 线:S4(arXiv 2111.00396)用结构化状态空间横扫长序列基准——顺序 CIFAR-10 做到 91%、Long Range Arena 全项领先、生成比 Transformer 快 60 倍;Mamba(arXiv 2312.00752,2023-12)补上致命一环——选择机制,让 SSM 参数随输入变化、按内容决定记住什么遗忘什么,配合硬件感知扫描做到推理吞吐 5 倍于 Transformer、序列线性扩展,3B 尺寸追平两倍大的 Transformer。Mamba-2(arXiv 2405.21060)用 SSD 框架证明 SSM 与线性注意力本是同一类结构化矩阵的不同分解,核心层再快 2-8 倍——「取代」在数学上被重新定义为「同一枚硬币的两面」。
RNN 复兴线:微软 RetNet(arXiv 2307.08621)的多尺度衰减——一次建模、三种算式,训练并行、推理递归、长序列分块各取最优、社区驱动的 RWKV 一路迭代到 v7(广义 delta rule,宣称状态跟踪能力超越注意力的 TC⁰ 极限;v5 与 v6 由 31 人社区团队完成,1.12T token 训练、Apache 2.0 开源)、Hochreiter 团队的 xLSTM(arXiv 2405.04517)矩阵记忆复活 LSTM——各成一家但共同证明了常数状态模型的可行性。不过 xLSTM-7B 的公开成绩(MMLU 五样本 58.9)提醒我们:架构可行与生态成熟是两回事。
Delta Rule 线:真正影响 2025-2026 格局的是 Gated DeltaNet(NVIDIA,arXiv 2412.06464,ICLR 2025)。它在状态更新里引入 delta rule——用「写入量减去被覆盖的旧值」做精准替换,配合门控遗忘,兼顾了召回与吞吐,在上下文检索与长度外推上明显胜过 Mamba-2。
四、混合架构的一线实证:配方决定成败
单打独斗没人赢,混合出场。工业级的分水岭是 NVIDIA 的 8B 对照实验(arXiv 2406.07887,3.5T token 训练):纯 Mamba 在复制、五样本 MMLU 等任务上输给同规模 Transformer,但 43% Mamba-2 加 7% 注意力的混合版在全部 12 个标准任务上反超 8B Transformer(平均高 2.65 分),推理最多快 8 倍——混合第一次在工业规模上同时赢了质量与成本。
2025 年起混合配方全面开花:
| 模型 | 配方 | 关键数字 |
|---|---|---|
| Jamba(AI21) | 注意力:Mamba = 1:7,MoE | 256K 上下文 KV Cache 仅 4GB,Mixtral 要 32GB |
| MiniMax-01 | lightning 线性注意力混合 | 456B/45.9B,训练 1M、外推 4M 上下文 |
| Qwen3-Next 80B | Gated DeltaNet:Gated Attention = 3:1 | 80B/3B,512 专家;训练成本仅 Qwen3-32B 的 10%,32K 以上吞吐 10 倍 |
| Kimi Linear 48B | KDA:MLA = 3:1 | KV Cache 需求最多降 75%,1M 上下文解码吞吐 6 倍 |
| Granite 4(IBM) | 注意力:Mamba-2 = 4:36 | 注意力仅 10%,Apache 2.0 |
| Kimi K3 | 建在 KDA 之上 | 2.78T/104B,线性注意力首次进入前沿规模 |
其中最值得展开的是 Kimi Linear(arXiv 2510.26692)。KDA(Kimi Delta Attention)是 Gated DeltaNet 的细粒度门控升级——遗忘率从整通道细化到每个维度独立。它做了一场难得的公平实验:1.4T token、与 MLA 版完全同配方对训,结果 MMLU-Pro 51.0 对 47.2、长上下文均值与强化学习曲线全面占优——这是线性系架构第一次在受控对比下全面胜过全注意力。加上 KV Cache 省 75%、百万 token 解码的每 token 时间快 6.3 倍(1.84ms 对 11.48ms),5.7T token 的最终训练直接把它推成了可用产品,K3 更把 KDA 顶到了 2.78T 的前沿规模。
配方的排列方式也在多样化:Qwen3-Next 与 Kimi Linear 是串行交错,Falcon-H1 与 Hymba 让注意力与 SSM 并行双头,Nemotron-H 与 Granite 4 干脆让 Mamba 占绝对主体——Granite 4 的注意力层只占 10%。小模型端 Hymba 1.5B 的数据很有煽动性:缓存比同尺寸 Llama 小 11.67 倍,吞吐 3.49 倍,直指端侧。
为什么混合比例普遍是 3:1 或 7:1?Kimi 的消融给了直接证据:3:1 验证困惑度最优,纯注意力反而最差,1:1 质量相近但推理开销大增——注意力提供的「精确检索」只需要少量层就能补齐,边际收益递减,而它的 KV Cache 成本线性上涨。注意力是昂贵的调料,不是主食。
五、争论:为什么还要留 25%
「线性能不能彻底赢」在 2026 年仍有两派,而且证据都在变硬。
质疑方的论据:一是理论上限——Merrill 的 TC⁰ 结论与固定状态的召回天花板仍在;二是工业界的用脚投票,发明 lightning attention 的 MiniMax 在旗舰 M2 上回归了全注意力(config 里 62 层全部是标准注意力,GQA 48:8),官方未解释动机,社区普遍归因于线性注意力在多轮 agent 任务上的召回短板;三是 DeepSeek 旗舰路线选择了稀疏 softmax 而非线性,两家头部实验室用行动给「纯线性路线」投了反对票。不过给 MiniMax 补一句背景:它的 M1 用 lightning attention 混合做推理模型,全量强化学习只花了约 51 万美元租金(512 张 H800 跑 3 周)——线性注意力的性价比没有人比它更清楚,M2 的回退更像是对 agent 召回场景的权衡,而非路线否定。
支持方的论据也在升级:Hedgehog(arXiv 2402.04347)证明可学习特征图能恢复 99% 以上的 Transformer 质量,说明差距在特征图设计而非路线本身;RWKV-7 与 DeltaProduct 把状态跟踪能力推向 TC⁰ 之外;而 Kimi Linear 的全面胜出与 K3 的前沿规模落地,是「线性系可以当主角」的最强实证。机制层面,研究也在把差距越定越细:2025 年的分析(arXiv 2504.18574)指出 Transformer 里只有少数注意力头承担「聚拢-聚合」,线性模型输在无法完成这种尖锐的注意力转移;delta rule 的理论基础则在变硬——Grazzi 等人证明转移矩阵允许负特征值后,线性 RNN 可以学会任意正则语言的状态跟踪。2026 年甚至出现了混合架构表达力的正面理论证明:特定检索任务下,DeltaNet 加注意力的混合比任何单一架构都更强。
更冷静的视角来自 Mamba-2 的 SSD 框架:线性注意力与 SSM 本是同一结构的不同分解,「谁取代谁」是个伪命题,真问题只有配比。
六、格局:从「换架构」到「算预算」
生态已经就位。FLA 库把 Gated DeltaNet、KDA、RWKV-7 等几乎所有线性注意力层做成了 Triton 内核;vLLM 原生支持 Qwen3-Next、Kimi Linear、Nemotron-H、Falcon-H1、Granite 混合等一整个家族,SGLang 也已支持 Qwen3-Next 的 MTP 投机解码;RWKV 社区则守着端侧低延迟的生态位。应用侧,恒定内存的吸引力正在 agent 长会话上兑现——百万级上下文的持续工具调用里,线性混合模型的成本曲线比全注意力平缓得多;Kimi K3 的百万级 agentic 强化学习表明,这个优势已经被用进了前沿训练管线。
回头看,这六年的战争给出了一个反高潮的答案:架构之争的度量衡,已经从「哪个架构更好」变成了「每个 token 激活多少注意力预算」。MoE 决定每 token 激活多少参数,混合架构决定每 token 花多少注意力——两者是同一个思路在不同维度上的应用:把贵的计算配给最需要的位置。2017 年的 Transformer 赢来了这个局面,也把自己变成了这个局面里的一个可调参数。下一场争论大概率是:这份预算该压到多少——10%?5%?还是干脆归零,把精确检索整个外包给检索系统?
参考资料
- Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention ——线性注意力开山之作
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces ——选择机制与硬件感知扫描
- Transformers are SSMs (Mamba-2 / SSD) ——SSM 与注意力的统一框架
- An Empirical Study of Mamba-based Language Models ——混合架构的工业级对照实验
- Zoology: Measuring and Improving Recall in Efficient Language Models ——MQAR 与召回短板的经典测量
- Qwen3-Next-80B-A3B 模型卡 ——3:1 混合与成本数据
- Kimi Linear: An Ultra-Fast Hybrid Attention Language Model ——KDA 与受控对比实验
- Gated Delta Networks (ICLR 2025) ——Delta Rule 路线的代表作
读者留言
COMMENTS 暂无还没有留言,来说第一句?