DeepSeek-V3 开源:MoE 架构与极致工程效率

DeepSeek-V3 采用多头潜在注意力(MLA)与 DeepSeekMoE 无辅助损失的负载均衡策略,总参数 671B、每 Token 仅激活 37B。通过 FP8 混合精度训练与 DualPipe 流水线并行等工程创新,完整训练仅消耗约 278.8 万 H800 GPU 小时,成本远低于同级别模型。

V3 在数学、代码、中文与综合基准上进入第一梯队,证明'架构与工程创新可以大幅压低前沿模型成本'。它为一个月后的 DeepSeek-R1 震荡全球奠定了基础,也让全球重新审视中国 AI 团队的研究能力。

阅读原文(DeepSeek)↗ ← 返回资讯列表