看一眼 2025 到 2026 年的前沿模型清单:Llama 4、gpt-oss、Qwen3、DeepSeek-V3、Kimi K2、MiniMax-M2、GLM-5——几乎清一色是 MoE(Mixture of Experts,混合专家)。这套「参数量与计算量解耦」的技术,用了三十多年从论文里的设想变成前沿的默认架构。它到底省了什么、又没省什么,值得算一笔明白账。
一、两个起点:1991 与 2017
MoE 的思想起点比深度学习热潮早得多。1991 年 Jacobs、Jordan、Nowlan 与 Hinton 的《Adaptive Mixtures of Local Experts》提出:让多个「局部专家」竞争同一任务,由门控加权分配输入,正反馈会让专家自然分化。分工的思想有了,但当时没有让它发挥威力的载体。
2017 年,Shazeer 等人的《Outrageously Large Neural Networks》(arXiv 1701.06538)补上了载体:在 LSTM 层之间插入带门控的 MoE 层,门控只把每个 token 送进上千个专家中的少数几个——稀疏激活。模型最高做到 137B 参数,容量提升超过 1000 倍而计算量近似不变。这篇论文还留下了此后纠缠 MoE 十年的问题:路由器会「富者愈富」,需要 importance 与 load 两个辅助损失去对抗专家坍缩。它当年的结构(LSTM 与 MoE 层交替)今天已无人在用,但「噪声 top-k 门控」「辅助损失」「专家容量」这三件套全部沿用至今。
一句话总结 MoE 的本质:总参数撑能力,激活参数定账单。
二、Google 时代:把稀疏激活推上万亿
2020 年的 GShard(arXiv 2006.16668)把翻译 Transformer 扩到 600B 以上,确立了沿用至今的三板斧:top-2 路由、专家容量因子(超出容量的 token 溢出)、辅以随机路由的负载均衡;600B 模型在 2048 块 TPUv3 上 4 天训完,算力随规模只呈次线性增长。2021 年的 Switch Transformer(arXiv 2101.03961)更加激进——每 token 只路由给 1 个专家,最大档做到 1.6T 参数、2048 个专家,同等 FLOPs 下预训练加速 7 倍以上,多个尺寸上把 T5-XXL 甩开 4 倍。GLaM 的推理侧账单同样醒目:每 token 推理 FLOPs 仅为 GPT-3 的一半。同年末的 GLaM(arXiv 2112.06905)给出关键验证:1.2T 总参、64 专家选 2,每 token 只激活 96.6B(约 8%),训练能耗仅为 GPT-3 的三分之一,却在 29 项基准上反超 GPT-3 175B——「总参多少、激活多少」从此成为 MoE 模型的一对身份证号。
GLaM 证明了那件事可以被规模化:大参数不等于贵推理。不过整个 Google 时代,MoE 只存在于巨头内部,开源世界看得见摸不着。
三、Mixtral:开源世界的引爆点
转折点是 2023 年 12 月 Mistral 放出的 Mixtral 8x7B:46.7B 总参、每 token 只激活 12.9B,8 个专家选 2,Apache 2.0 协议,性能匹敌甚至超越 Llama 2 70B 与 GPT-3.5。它第一次让普通开发者在本机跑动「千亿级」模型,也把「路由器就是个线性层加 softmax」这件事变成了公众常识。四个月后的 Mixtral 8x22B(141B/39B)沿同配方放大。开源 MoE 的心智占领,从这一刻开始。值得一提的是它的配方简单到近乎简陋:每层 8 选 2、没有共享专家,路由器就是一行矩阵乘。Mixtral 证明的不是 MoE 有多强,而是开源世界也玩得起稀疏化。Mixtral 论文自己分析过专家的分工,结论有点反直觉:看不出按主题分配的模式,专家更多按 token 类型与语法分化——「专家」更像特征处理器,而不是「数学专家」「历史专家」。
四、DeepSeek 路线:细粒度、共享专家与无辅助损失
2024 年起,MoE 的创新中心移到了中国公司手里。DeepSeekMoE 论文(arXiv 2401.06066)提出两个关键改动:细粒度专家——把少量大专家切成大量小专家,同样激活量下组合数指数级增长,表达更精细;共享专家隔离——通用知识固定走共享专家,路由专家专注分工。效果立竿见影:DeepSeekMoE 16B 用约 40% 的计算量追平 LLaMA2 7B,145B 版用 28.5% 的计算追平 DeepSeek 67B。
到 DeepSeek-V3(arXiv 2412.19437,2024-12),这条路线成熟为:671B 总参、37B 激活,256 个路由专家加 1 个共享专家、每 token 激活 8 个,前 3 层保持稠密。两个工程创新尤其重要:
- 无辅助损失负载均衡。给每个专家一个偏置项加到亲和分上决定 top-k,偏置只参与路由、不进梯度,按负载过载或欠载动态增减——绕开了辅助损失干扰主目标的经典矛盾。这套 sigmoid 加 noaux_tc 的方案随后被 Kimi K2、Kimi K3、GLM-5 整体沿用,已成事实标准。
- node-limited routing。每 token 的专家分布限制在至多 M 个节点内;自研的 all-to-all kernel 同时吃满 InfiniBand 与 NVLink 两级带宽,DualPipe 流水线把通信完全藏进计算——官方称保持计算通信比恒定,跨节点专家并行的通信开销就能趋近于零。
结果是那张著名的账单:14.8T token、2048 张 H800 共 278.8 万 GPU 小时,按官方假设的每小时 2 美元租价折算约 557 万美元——以远低于外界想象的成本完成了前沿级训练。另一个容易被忽略的记录是稳定性:全程无不可恢复的 loss spike、无回滚。
把镜头拉近看,路由器本身朴素得出奇:一个小线性层给每个专家打分,softmax 后取 top-k,再配容量因子防止个别专家过载。MoE 的全部魔法不在路由器,而在「大量小专家 + 好的均衡策略」这个组合——专家切得越细,同样激活量下的组合空间呈指数扩大,分工也越精确。
五、2025-2026:MoE 成为前沿默认
截至 2026-10 的主力 MoE 模型(数据来自官方模型卡与 config):
| 模型 | 总参/激活 | 专家配置 | 值得注意的细节 |
|---|---|---|---|
| Llama 4 Scout | 109B/17B | 16 专家 | 官方宣称 10M 上下文,iRoPE |
| Llama 4 Maverick | 400B/17B | 128 专家 | 从未发布的 Behemoth 蒸馏而来 |
| Qwen3-235B-A22B | 235B/22B | 128 选 8 | 明确移除共享专家 |
| gpt-oss-120b | 117B/5.1B | 128 选 4 | MXFP4 量化,单张 80GB 可跑 |
| Kimi K2 | 1T/32B | 384+1 选 8 | MuonClip,15.5T token 零 spike |
| Kimi K2 Thinking | 1T/32B | 同上 | 原生 INT4 量化感知训练 |
| MiniMax-M2 | 230B/10B | 256 选 8 | 主打 agent 与编码的低成本 |
| GLM-5 | 754B/— | 256+1 选 8 | 2026-02 发布,沿用 noaux_tc |
| Kimi K3 | 2.78T/104B | 896+2 选 16 | 建在线性注意力 KDA 之上 |
| Grok-1(2024-03) | 314B/— | 官方仅确认 MoE | xAI 首个开源大 MoE |
| Llama 4 Behemoth | 约 2T/288B | 16 专家 | 官方宣布训练中,未发布 |
三条趋势清晰可见:
- 专家更多更小:8 → 256 → 384 → 896,同时每个 token 激活的专家数 k 从 2 回升到 8-16,用更多小步组合替代少数大专家;
- 激活比例持续下降:GLaM 约 8%,DeepSeek-V3 5.5%,gpt-oss 4.4%,Qwen3-Next 3.7%,Kimi K2 3.2%——每 token 的算力账单一压再压;
- 均衡方案收敛:辅助损失(2017-2021)→ router z-loss(ST-MoE,2022)→ 无辅助损失的动态偏置(DeepSeek-V3 起成为事实标准)。
- 工程生态补齐:vLLM、SGLang 等推理框架对 MoE 与专家并行已是一线支持,LoRA 家族等微调栈对 MoE 的适配也基本补齐——2024 年「MoE 不好伺候」的生态抱怨,2026 年已大体消解。
六、工程账本与未解的批评
省的是算力,不是显存。 Mixtral 名义上只激活 12.9B,但 46.7B 权重必须全量驻留显存——MoE 是拿显存换 FLOPs。批越大、路由越分散,吞吐优势越大;反过来单条请求可能比同激活量的稠密模型更慢。这也解释了 MoE 的商业模式偏科:它天然适合 API 集群——海量并发把所有专家都摊满;而不太适合单用户本机——激活省下的算力,被「全量权重驻留」的显存成本吃了回去。「MoE 单请求慢」的算术根源就在这里,gpt-oss 用高稀疏加 4bit 量化塞进单卡,算是工程界对内存墙的正面回应。相对地,稠密模型的拥趸也有自己的论据:同等激活量下稠密模型单请求延迟更低、微调行为更可预测——这解释了 Gemma、Phi 等稠密系在开发者社区的顽强生命力。
微调难。 Switch Transformer 论文自己承认:同等 FLOPs 下参数更多,「在小下游任务上可能导致更严重的过拟合」。专家坍缩、微调掉点至今是开源社区的高频吐槽,MoE 的全参数微调门槛依然显著高于同激活量的稠密模型——优化器状态要覆盖全部 46.7B 参数,显存门槛先劝退一批人。
训练不稳。 大规模 MoE 的路由波动是真实风险。Kimi K2 用 MuonClip(Muon 优化器加 QK-Clip 注意力 logit 裁剪)才做到 15.5T token 零 spike;ST-MoE 的 router z-loss 也是为此而生。
成本争议。 「557 万美元」是官方口径的最终训练成本,不含消融实验、失败运行与研究阶段的前期投入——Interconnects 的 Nathan Lambert 在 2025 年初就指出这一点。这笔账本身没错,错的是传播中被简化成「前沿模型只要几百万美元」。它证明的是训练效率的跃迁,不是研发成本的消失。
有没有大厂放弃 MoE?截至 2026-10,没有可验证的案例;反面证据反而更强——2025-2026 的新旗舰几乎全部是 MoE。稠密架构仍统治小尺寸与端侧(Gemma、Phi、Qwen 稠密系),但那是生态分工,不是路线放弃。
结语:MoE 的本质九年来从未改变:在恒定的每 token 算力预算下,用稀疏路由换取总容量。变的是工程精度——专家更小、路由更稳、账单更薄。激活比例还能压到多低,K2 的 3.2% 会不会是极限,是这条路线剩下的最大悬念。而对使用者,MoE 的启示很朴素:看模型先看激活参数,再看总参数——前者决定账单,后者决定上限。
参考资料
- Outrageously Large Neural Networks: Sparsely-Gated Mixture-of-Experts Layers ——稀疏门控 MoE 的起点
- Switch Transformers: Scaling to Trillion Parameter Models ——top-1 路由与万亿参数
- GLaM: Efficient Scaling of Language Models with Mixture-of-Experts ——8% 激活比例的经典验证
- Mixtral of Experts ——开源 MoE 的引爆点
- DeepSeek-V3 Technical Report ——细粒度专家、无辅助损失均衡与训练成本
- Kimi K2: Open Agentic Intelligence ——万亿参数与 MuonClip
- The Llama 4 Herd ——Meta 官方发布博客
- ST-MoE: Designing Stable and Transferable Sparse Expert Models ——router z-loss 与训练稳定性
读者留言
COMMENTS 暂无还没有留言,来说第一句?