DeepSeek-V3 采用多头潜在注意力(MLA)与 DeepSeekMoE 无辅助损失的负载均衡策略,总参数 671B、每 Token 仅激活 37B。通过 FP8 混合精度训练与 DualPipe 流水线并行等工程创新,完整训练仅消耗约 278.8 万 H800 GPU 小时,成本远低于同级别模型。
V3 在数学、代码、中文与综合基准上进入第一梯队,证明'架构与工程创新可以大幅压低前沿模型成本'。它为一个月后的 DeepSeek-R1 震荡全球奠定了基础,也让全球重新审视中国 AI 团队的研究能力。