一篇读懂 MoE:大模型「大而不贵」的经济学

打开 2026 年任何一份前沿开源模型的技术报告,你都会看到一对矛盾的数字:DeepSeek-V3 总参数 671B,每个 token 只激活 37B;Kimi K2 总参数 1T,激活只有 32B;Qwen3-235B-A22B 连名字里都写着答案——235B 总参、22B 激活。参数是算力的十几倍甚至三十倍,这不是财务造假,而是混合专家架构(Mixture of Experts,MoE)在起作用:它把「模型有多大」和「每个 token 花多少算力」这两件在传统架构里锁死在一起的事,拆开了。

先解决什么问题:dense 模型的容量两难

Transformer 里的前馈层(FFN)占了全部参数的三分之二左右,它是标准的 dense 结构:每个 token 进来,所有参数都要参与计算。这带来一个两难。

一方面,Scaling Laws 告诉我们模型参数越多、训练数据越多,损失就越低——想要更聪明,就得把模型做大。另一方面,dense 模型每增加一分参数,每个 token 的训练和推理 FLOPs 就同步增加一分,成本线性上涨。参数规模在 dense 世界里是一条单行道:大,就意味着每个 token 都贵。

MoE 的思路是把 FFN 层复制多份,每份叫一个「专家」(expert),再加一个调度员——门控网络(router)——决定每个 token 该去找哪些专家。关键是:每个 token 只走少数几个专家,其余专家对它来说不存在。这样总参数(决定模型容量)和每 token 计算量(决定 FLOPs)第一次解耦了。你可以造一个知识总量巨大的模型,但每个 token 只付其中一小部分的钱。

MoE 怎么工作:专家团与调度员

把 Transformer 里的 FFN 层换成 MoE 层,结构上是这样的:一层里有 N 个专家(每个专家本身就是一个小 FFN),一个可学习的门控网络。token 向量进来后,门控先给每个专家打分,选出得分最高的 top-k 个,token 只发给这几个专家计算,最后把结果按门控权重加权合并。用公式写就是 y = Σ G(x)_i · E_i(x),其中 G(x) 是门控分数,E_i 是第 i 个专家。

flowchart LR
    T[token 输入] --> R[门控网络 Router]
    R -->|得分 0.62| E1[专家 2]
    R -->|得分 0.31| E3[专家 7]
    R -.落选.- E2[专家 1]
    R -.落选.- E4[专家 8]
    E1 --> M[加权合并]
    E3 --> M
    M --> O[token 输出]

图中落选的专家(虚线)完全不参与这个 token 的计算——这就是「稀疏激活」。DeepSeek-V3 每层有 256 个路由专家加 1 个共享专家,每个 token 只走 top-8;Mixtral 8x7B 更简单,8 个专家走 top-2。门控网络不是人工规则,它和模型其他参数一起,从预训练数据里学出来。

这个思想并不新。1991 年 Jacobs 和 Hinton 等人的论文《Adaptive Mixtures of Local Experts》就提出了「多个专家网络 + 门控联合训练」的框架;2017 年 Shazeer 等人的《Outrageously Large Neural Networks》把它做进千亿参数 LSTM,并留下了沿用至今的 Noisy Top-K Gating——在打分时加点噪声、只留 top-k 再归一化,防止门控过早收敛到固定路径。

从论文到量产:三个时代

MoE 走进主流大模型,大致分三步。

规模化探索(2020–2022):Google 的 GShard 把 Transformer 推到 600B 参数做翻译,引入 top-2 路由、专家容量和辅助负载均衡损失;Switch Transformer 更激进,每个 token 只走 1 个专家,训出 1.6 万亿参数模型,比同架构 dense 版预训练最快快 4 倍;GLaM 以 1.2T 总参、每 token 只激活 97B(8%)的质量匹敌 GPT-3,训练推理能耗约三分之一。这一阶段证明了 MoE 能省算力,但工程门槛极高,外界只能看热闹。

开源破圈(2023–2024):Mixtral 8x7B 在 2023 年 12 月横空出世——46.7B 总参、每 token 激活 12.9B,多数基准胜过 Llama 2 70B 且推理更快,Apache 2.0 协议让所有人都能下载拆解。2024 年 12 月的 DeepSeek-V3 则把 MoE 的性价比推到极致:671B 总参、激活 37B,全部训练只花了 278.8 万 H800 GPU 时,按官方定价约 557.6 万美元——一个 671B 模型的完整训练成本,还比不上许多公司一个季度的 GPU 租金。

全面主流化(2025 至今):Qwen3-235B-A22B、Kimi K2(1T/32B)、GLM-4.5(355B/32B)、Llama 4(Meta 首个 MoE 版本,Scout 16 专家、Maverick 128 专家,激活均 17B)——前沿开源模型几乎全面 MoE 化。2025 年 9 月的 Qwen3-Next-80B-A3B 把激活比压到 3.75%,512 个路由专家只激活 10 个,官方口径下以约 10% 的训练成本胜过自家的 32B dense 模型。

模型 发布 总参数 激活参数 专家配置
Mixtral 8x7B 2023-12 46.7B 12.9B 8 专家、top-2
DeepSeek-V3 2024-12 671B 37B 256 路由 + 1 共享、top-8
Llama 4 Maverick 2025-04 约 400B 17B 128 专家
Qwen3-235B-A22B 2025-04 235B 22B 128 专家、top-8
Kimi K2 2025-07 1T 32B 激活比 3.2%
Qwen3-Next-80B-A3B 2025-09 80B 3B 512 路由 + 1 共享、激活 10+1

(Llama 4 总参数为第三方汇总口径,Meta 官方只公布了激活参数与专家数。)

真功夫在调度:负载均衡

MoE 论文里最厚的章节从来不是结构,而是训练稳定性。因为门控有一个天然的恶性循环:少数专家因为随机初始化的运气稍微好一点,就会被分到更多 token,于是得到更多训练、变得更强,进而被分到更多 token——「赢者通吃」,其余专家闲置,MoE 退化成一个又大又不均匀的 dense 模型。

工程上有三代解法。第一代是辅助负载均衡损失(GShard/Switch Transformer 时代):在训练目标里加一项惩罚,强制各专家的负载接近均匀。它的麻烦在于力度难调——太强会伤害模型质量,太弱则均衡不住,只能靠「专家容量因子」兜底:给每个专家设一个容量上限,超出的 token 直接丢弃(经残差连接传给下一层),容量因子 1.25 意味着允许 25% 的超额。第二代是 router z-loss(ST-MoE,2022):惩罚进入门控 softmax 的大数值,抑制舍入误差,稳定训练且不掉点。

第三代是 DeepSeek 在 V3 上用的无辅助损失均衡:干脆不加辅助损失,改为给每个专家维护一个偏置项,偏置只参与「选谁」的 top-k 排序、不进加权计算的分数。哪个专家最近负载低,就把它的偏置调高一点,动态微调而不直接扭曲梯度。配合一个系数极小(0.0001)的序列级辅助损失兜底,DeepSeek-V3 的技术报告特意强调:14.8T token 的全程训练没有一次不可恢复的 loss spike、没有回滚。对经历过 MoE 训练崩盘的团队来说,这句话的分量比任何基准分数都重。

DeepSeekMoE:把专家切细、把公知隔离

2024 年初的 DeepSeekMoE 论文贡献了两个如今被广泛抄作业的设计。

细粒度专家:把传统的 N 个大专家切成 mN 个小专家、激活 mK 个(组合数从 C(N,k) 暴涨到 C(mN, mk))。直觉是:专家越细,模型「凑组合」的自由度越高,同一批 token 可以命中更精准的知识组合。代价是路由计算和通信开销变大,DeepSeek-V3 的 256 选 8 就是这个思路的量产形态。

共享专家隔离:设置 1 个(或几个)永远激活的共享专家,专门吸收所有 token 都需要的公共知识(比如通用语法、常见搭配),让路由专家们腾出容量去做更专的事,减少它们之间的冗余。Qwen3-Next 的「10 + 1」配置(10 个路由专家加 1 个共享专家)就是同一套设计。

边界一:省的是 FLOPs,不是显存

MoE 最常见的误解是「激活 37B 所以比 70B dense 模型小」。错。推理时所有专家的权重都必须驻留显存,无论这个 token 会不会走到它——DeepSeek-V3 跑起来,显存占用是按 671B 算的,不是 37B。Mixtral 的计算量约等于一个 12B dense 模型,显存却要按 47B 准备,所以「8x7B」这个命名本身就是营销修辞:它不是 56B(8 × 7B),也远不止 12.9B。

解码阶段是显存带宽瓶颈:每生成一个 token,都要把被激活专家的权重从显存完整读一遍,这个开销 MoE 省不掉。所以 MoE 真正的优势区间是算力受限但显存充裕的场景——大规模训练集群、数据中心推理。反过来,在显存是第一约束的地方(消费级显卡、手机),一个装得下的 dense 小模型往往比装不下的 MoE 更实用。这也解释了开源世界的分工:Llama 3 的小中杯继续走 dense,而冲前沿的 DeepSeek、Qwen、Kimi 全面 MoE 化——前者服务「人人跑得动」,后者服务「堆得出最强」。

顺带纠正一个流行算法:「激活参数 = 总参数 ÷ 专家数」。不成立。注意力层、embedding 这些非 MoE 部分两边共享,激活参数从来不是简单的除法关系。

边界二:专家不是「领域专家」

给 MoE 画架构图时,人们喜欢画「数学专家」「代码专家」「生物专家」,仿佛模型内部有一群按学科分科的教授。Mixtral 论文自己拆解后发现了尴尬的事实:专家的分化与领域无关。路由选择和 token 的位置、缩进、句法结构等表层特征的相关性,远高于和主题领域的相关性——没有「数学专家」,只有「句法专家」。Hugging Face 的 MoE 综述在 encoder 模型里观察到专家按标点、专有名词分化,多语言训练里也不按语言分化。

这对使用者意味着什么?意味着 MoE 的可解释性红利比想象的小:你不能指望把「法律问题」定向路由给某个专家来调试模型行为。专家是模型自己长出来的分工,不是人类预设的科室。另外,专家数量有边际递减——超过 256 到 512 个之后,继续加专家的收益就很有限了。

怎么选:一张决策表

把上面的分析收拢成一张表(本文作者观点,供选型参考):

场景 倾向 原因
大规模预训练、冲质量上限 MoE 同算力预算下质量显著更高,训练成本优势已被反复验证
数据中心大吞吐推理 MoE 每 token FLOPs 低,批处理摊薄显存压力
消费级显卡 / 单机部署 dense 小模型或量化 MoE 显存是硬约束,全量专家驻留装不下
端侧(手机、PC) dense 为主 专家卸载可行但工程复杂,内存足迹是第一瓶颈
需要频繁微调的小团队 谨慎选 MoE 稀疏模型更易过拟合,宜小 batch、高学习率,或只微调非 MoE 层

端侧值得一提:MoE 的稀疏激活理论上很适合边缘设备(每 token 计算小),学术界也在推专家卸载、专家压缩、提高路由复用等方案,但截至 2026 年,内存足迹仍是绕不过去的第一瓶颈,「MoE 上手机」还停留在工程演示阶段。

结语

MoE 的本质是一笔交换:用显存和工程复杂度,换训练算力与推理 FLOPs。它没有推翻 Scaling Laws,而是改写了 Scaling Laws 的付款方式——容量照常增长,算力账单打折。2023 年 Mixtral 让所有人第一次下载得起「八专家模型」,2024 年底 DeepSeek-V3 用 557.6 万美元的训练账单把这条路线的性价比钉死在行业认知里,2025 年之后,前沿开源模型已经没有 denser 了。理解了 MoE,你就能读懂今天几乎所有开源大模型参数表里那对「总参 / 激活」数字——它们不是套话,是一笔明码标价的经济学。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?