o1 系列在回答前会生成较长的内部思维链,通过大规模强化学习优化推理策略。在 AIME 数学竞赛、Codeforces 编程与 GPQA 科学基准上,o1 相比 GPT-4o 实现代际级提升,Codeforces 达到 89 百分位。
更重要的是范式的转变:性能不再只随训练算力增长,还能随'推理时思考时间'增长。这条 Test-time Compute 路线被普遍视为通往更可靠复杂推理的关键,直接启发了后续 DeepSeek-R1 等开源推理模型的爆发。
o1 系列在回答前会生成较长的内部思维链,通过大规模强化学习优化推理策略。在 AIME 数学竞赛、Codeforces 编程与 GPQA 科学基准上,o1 相比 GPT-4o 实现代际级提升,Codeforces 达到 89 百分位。
更重要的是范式的转变:性能不再只随训练算力增长,还能随'推理时思考时间'增长。这条 Test-time Compute 路线被普遍视为通往更可靠复杂推理的关键,直接启发了后续 DeepSeek-R1 等开源推理模型的爆发。