注意力没有被取代,而是被稀释:线性注意力、Mamba 与混合架构的 2026

「XX 架构将取代 Transformer」是 AI 圈最经久不衰的标题党题材,而线性注意力是喊得最久的那一个。到 2026 年,结局浮出水面,却与「取代」毫无关系:Qwen3-Next、Kimi Linear、Kimi K3、IBM Granite 4 这些一线模型把 softmax 注意力的层占比从 100% 压到了 10%-25%,其余 75% 以上的层换成了 Mamba、Gated DeltaNet、KDA 这类常数状态层。注意力没有被杀死——它被稀释了。这场稀释是怎么发生的,为什么要留那 25%,是本文要回答的两个问题。

一、诱惑:O(1) 状态对上无界账单

softmax 注意力的推理账单有两项绕不开:每生成一个 token 要按上下文长度重读 KV Cache(每步 O(n)),且缓存随对话无限增长。而 RNN 式模型的记忆是一个固定大小的状态矩阵,每步 O(1),内存恒定。线性注意力的开山之作《Transformers are RNNs》(arXiv 2006.16236,2020)正是点破了这层关系:把注意力写成核特征图的线性点积 φ(Q)(φ(K)ᵀV),利用矩阵乘法结合律把复杂度降到 O(n),自回归形式随之改写成 RNN 递推。Performer(arXiv 2009.14794)则用正交随机特征对 softmax 核做无偏近似。理论上很美,但这两代模型的质量始终追不上 softmax——问题出在哪,两年后才被讲清楚。

二、早期失败:短板叫「召回」

2023 年底,斯坦福 Hazy Research 的 Zoology 研究给出了关键测量:17 个预训练模型里,门控卷积类(非注意力)模型在语言建模上的差距,82% 来自上下文召回;一个 70M 参数的注意力模型在召回任务上能赢过 1.4B 的非注意力模型。他们设计的 MQAR(多查询联想记忆)基准成了这条战线的标准试金石。随后 Jelassi 等人从理论上补刀(arXiv 2402.01032):固定状态的模型在复制任务上有天然的长度天花板,而两层注意力就能复制指数长的字符串。Merrill 等人(arXiv 2404.08819)进一步证明 SSM 的表达力不超出电路复杂度类 TC⁰,在棋步跟踪、代码求值这类状态跟踪任务上可证失败。

一句话:线性模型记得住「平均」,记不住「精确」——而无界的精确检索恰恰是语言模型的核心能力。

三、三条复兴线:SSM、RNN 与 Delta Rule

失败没有终结这条路线,反而逼出了三代改进。

SSM 线:S4(arXiv 2111.00396)用结构化状态空间横扫长序列基准——顺序 CIFAR-10 做到 91%、Long Range Arena 全项领先、生成比 Transformer 快 60 倍;Mamba(arXiv 2312.00752,2023-12)补上致命一环——选择机制,让 SSM 参数随输入变化、按内容决定记住什么遗忘什么,配合硬件感知扫描做到推理吞吐 5 倍于 Transformer、序列线性扩展,3B 尺寸追平两倍大的 Transformer。Mamba-2(arXiv 2405.21060)用 SSD 框架证明 SSM 与线性注意力本是同一类结构化矩阵的不同分解,核心层再快 2-8 倍——「取代」在数学上被重新定义为「同一枚硬币的两面」。

RNN 复兴线:微软 RetNet(arXiv 2307.08621)的多尺度衰减——一次建模、三种算式,训练并行、推理递归、长序列分块各取最优、社区驱动的 RWKV 一路迭代到 v7(广义 delta rule,宣称状态跟踪能力超越注意力的 TC⁰ 极限;v5 与 v6 由 31 人社区团队完成,1.12T token 训练、Apache 2.0 开源)、Hochreiter 团队的 xLSTM(arXiv 2405.04517)矩阵记忆复活 LSTM——各成一家但共同证明了常数状态模型的可行性。不过 xLSTM-7B 的公开成绩(MMLU 五样本 58.9)提醒我们:架构可行与生态成熟是两回事。

Delta Rule 线:真正影响 2025-2026 格局的是 Gated DeltaNet(NVIDIA,arXiv 2412.06464,ICLR 2025)。它在状态更新里引入 delta rule——用「写入量减去被覆盖的旧值」做精准替换,配合门控遗忘,兼顾了召回与吞吐,在上下文检索与长度外推上明显胜过 Mamba-2。

四、混合架构的一线实证:配方决定成败

单打独斗没人赢,混合出场。工业级的分水岭是 NVIDIA 的 8B 对照实验(arXiv 2406.07887,3.5T token 训练):纯 Mamba 在复制、五样本 MMLU 等任务上输给同规模 Transformer,但 43% Mamba-2 加 7% 注意力的混合版在全部 12 个标准任务上反超 8B Transformer(平均高 2.65 分),推理最多快 8 倍——混合第一次在工业规模上同时赢了质量与成本。

2025 年起混合配方全面开花:

模型 配方 关键数字
Jamba(AI21) 注意力:Mamba = 1:7,MoE 256K 上下文 KV Cache 仅 4GB,Mixtral 要 32GB
MiniMax-01 lightning 线性注意力混合 456B/45.9B,训练 1M、外推 4M 上下文
Qwen3-Next 80B Gated DeltaNet:Gated Attention = 3:1 80B/3B,512 专家;训练成本仅 Qwen3-32B 的 10%,32K 以上吞吐 10 倍
Kimi Linear 48B KDA:MLA = 3:1 KV Cache 需求最多降 75%,1M 上下文解码吞吐 6 倍
Granite 4(IBM) 注意力:Mamba-2 = 4:36 注意力仅 10%,Apache 2.0
Kimi K3 建在 KDA 之上 2.78T/104B,线性注意力首次进入前沿规模

其中最值得展开的是 Kimi Linear(arXiv 2510.26692)。KDA(Kimi Delta Attention)是 Gated DeltaNet 的细粒度门控升级——遗忘率从整通道细化到每个维度独立。它做了一场难得的公平实验:1.4T token、与 MLA 版完全同配方对训,结果 MMLU-Pro 51.0 对 47.2、长上下文均值与强化学习曲线全面占优——这是线性系架构第一次在受控对比下全面胜过全注意力。加上 KV Cache 省 75%、百万 token 解码的每 token 时间快 6.3 倍(1.84ms 对 11.48ms),5.7T token 的最终训练直接把它推成了可用产品,K3 更把 KDA 顶到了 2.78T 的前沿规模。

配方的排列方式也在多样化:Qwen3-Next 与 Kimi Linear 是串行交错,Falcon-H1 与 Hymba 让注意力与 SSM 并行双头,Nemotron-H 与 Granite 4 干脆让 Mamba 占绝对主体——Granite 4 的注意力层只占 10%。小模型端 Hymba 1.5B 的数据很有煽动性:缓存比同尺寸 Llama 小 11.67 倍,吞吐 3.49 倍,直指端侧。

为什么混合比例普遍是 3:1 或 7:1?Kimi 的消融给了直接证据:3:1 验证困惑度最优,纯注意力反而最差,1:1 质量相近但推理开销大增——注意力提供的「精确检索」只需要少量层就能补齐,边际收益递减,而它的 KV Cache 成本线性上涨。注意力是昂贵的调料,不是主食。

五、争论:为什么还要留 25%

「线性能不能彻底赢」在 2026 年仍有两派,而且证据都在变硬。

质疑方的论据:一是理论上限——Merrill 的 TC⁰ 结论与固定状态的召回天花板仍在;二是工业界的用脚投票,发明 lightning attention 的 MiniMax 在旗舰 M2 上回归了全注意力(config 里 62 层全部是标准注意力,GQA 48:8),官方未解释动机,社区普遍归因于线性注意力在多轮 agent 任务上的召回短板;三是 DeepSeek 旗舰路线选择了稀疏 softmax 而非线性,两家头部实验室用行动给「纯线性路线」投了反对票。不过给 MiniMax 补一句背景:它的 M1 用 lightning attention 混合做推理模型,全量强化学习只花了约 51 万美元租金(512 张 H800 跑 3 周)——线性注意力的性价比没有人比它更清楚,M2 的回退更像是对 agent 召回场景的权衡,而非路线否定。

支持方的论据也在升级:Hedgehog(arXiv 2402.04347)证明可学习特征图能恢复 99% 以上的 Transformer 质量,说明差距在特征图设计而非路线本身;RWKV-7 与 DeltaProduct 把状态跟踪能力推向 TC⁰ 之外;而 Kimi Linear 的全面胜出与 K3 的前沿规模落地,是「线性系可以当主角」的最强实证。机制层面,研究也在把差距越定越细:2025 年的分析(arXiv 2504.18574)指出 Transformer 里只有少数注意力头承担「聚拢-聚合」,线性模型输在无法完成这种尖锐的注意力转移;delta rule 的理论基础则在变硬——Grazzi 等人证明转移矩阵允许负特征值后,线性 RNN 可以学会任意正则语言的状态跟踪。2026 年甚至出现了混合架构表达力的正面理论证明:特定检索任务下,DeltaNet 加注意力的混合比任何单一架构都更强。

更冷静的视角来自 Mamba-2 的 SSD 框架:线性注意力与 SSM 本是同一结构的不同分解,「谁取代谁」是个伪命题,真问题只有配比。

六、格局:从「换架构」到「算预算」

生态已经就位。FLA 库把 Gated DeltaNet、KDA、RWKV-7 等几乎所有线性注意力层做成了 Triton 内核;vLLM 原生支持 Qwen3-Next、Kimi Linear、Nemotron-H、Falcon-H1、Granite 混合等一整个家族,SGLang 也已支持 Qwen3-Next 的 MTP 投机解码;RWKV 社区则守着端侧低延迟的生态位。应用侧,恒定内存的吸引力正在 agent 长会话上兑现——百万级上下文的持续工具调用里,线性混合模型的成本曲线比全注意力平缓得多;Kimi K3 的百万级 agentic 强化学习表明,这个优势已经被用进了前沿训练管线。

回头看,这六年的战争给出了一个反高潮的答案:架构之争的度量衡,已经从「哪个架构更好」变成了「每个 token 激活多少注意力预算」。MoE 决定每 token 激活多少参数,混合架构决定每 token 花多少注意力——两者是同一个思路在不同维度上的应用:把贵的计算配给最需要的位置。2017 年的 Transformer 赢来了这个局面,也把自己变成了这个局面里的一个可调参数。下一场争论大概率是:这份预算该压到多少——10%?5%?还是干脆归零,把精确检索整个外包给检索系统?

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?