R1-Zero 首次验证了不依赖监督微调、纯用强化学习(GRPO)即可让模型自发涌现出长思维链推理能力;R1 在此基础上引入冷启动数据,可读性进一步提升。在 AIME、MATH-500 等基准上与 OpenAI o1 正面对标,开源权重(MIT License)加蒸馏小模型全家桶同步放出。
R1 的发布引发美股 AI 板块剧烈波动,被称为'AI 界的 Sputnik 时刻'。它把推理模型的使用成本降低了一个数量级,直接推动各大厂商降价与推理模型全面普及,也验证了'训练成本可以数量级下降'的工程路线。