思维链为什么有效:推理时计算的研究脉络

一个奇怪的现象

让大模型做数学应用题,直接给答案错一大片;在提示里加一句「让我们一步一步思考」,或者给几个带解题过程的示例,正确率明显上升。答案的格式变了,模型并没有变——多出来的不是知识,而是「思考」这个动作本身。这个现象背后的机制,是近几年推理方向研究的起点。

思维链的经典做法

思维链(Chain-of-Thought,CoT)最初的形式是 few-shot 提示:在提示里给两三个「问题、一步步推理、答案」的完整示例,模型模仿这个格式,把中间推理步骤写出来,再给最终答案。随后的 zero-shot 版本更简单:不加示例,只在问题后面补一句「让我们一步步思考」,效果就会出现。这两步确立了一个事实:推理行为可以被提示唤起,模型本身早已具备写出推理步骤的能力,只是需要被要求。示例不用多,两三个就够;更要紧的是示例里推理过程本身的质量——模型会连示例的坏习惯一起模仿。

为什么有效:把内隐计算外化

核心洞察一句话:Transformer 每做一次前向传播,能完成的串行计算深度是固定的。一个 token 从进模型到出模型,走过的「计算步数」恒定;而复杂推理需要的串行步数超过这个预算,一次前向根本算不完。

CoT 的机制就是把算不完的部分摊到生成过程里:模型每写出一个中间 token,这个 token 就会拼回输入,触发一次完整的前向计算。写出「设苹果有 3 个」,等于追加了好几次完整的串行计算步。推理被外化成可见的 token 序列,推理时的计算量随思维链长度动态增长——模型不再是「想好了才说」,而是「边说边想」,中间产物又成为下一步计算的输入。这就是思维链有效的根本原因:它是一种不改动模型、纯靠生成过程实现的推理时扩容。

自一致性:多条路径投票

既然推理是生成出来的,就可能这次推理对、下次错。自一致性(self-consistency)利用了这一点:同一个问题采样多条不同的推理路径(把温度调高,让模型走不同的思路),各自得出答案,最后投票取多数。直觉是:正确的推理路径往往殊途同归,错误的路径则错得五花八门。代价是计算量成倍增加——用算力换准确率。

奖励模型:看答案还是看过程

要让模型「多想」而且想得对,需要奖励信号告诉它什么算想得好。结果奖励模型(ORM,outcome reward model)只看最终答案对不对,过程一概不问;过程奖励模型(PRM,process reward model)对每一步推理打分,中间哪步错了就指出来。差别类似只批答案的老师和逐行批过程的老师:ORM 的数据容易获得(对答案即可),但可能奖励「碰巧对」的坏过程;PRM 监督更精细,但每一步的标注成本高得多。推理模型「先想后答」的行为,很大程度上是这类奖励信号塑形出来的。

测试时扩展:多想一会儿成为能力维度

这系列工作的汇合点是测试时扩展(test-time compute scaling):推理时投入更多计算——更长的思维链、更多的采样路径、更多的自我检查——能换来稳定的能力提升,而且这条提升曲线与「更大的模型」那条曲线相互独立。推理难度不再只由参数量决定,「想多久」成了和「模型多大」并列的两个旋钮。从工程视角看,这相当于把「算力换质量」做成显式可调的档位:同一个模型,便宜档应付日常问题,深度档攻坚难题,算力按需分配。

边界与残留问题

三件事要泼冷水。其一,CoT 不是免费午餐:简单任务上写思维链是纯开销,更慢、更贵,有时还把本来能直接答对的题「想错」。其二,模型可能写出假推理:结论正确,过程却是凑出来的——先「猜」到答案,再倒推出一套看似合理的步骤,或者步骤之间并无真实的逻辑依赖。书面推理的条理清晰,不等于计算真的有效。其三,验证仍是瓶颈:生成多条推理容易,可靠地判断哪条推理真的对很难,PRM 的标注成本与可靠性都还没到让人放心的程度。

一句话总结:思维链的本质,是把固定深度的前向计算扩展成随生成长度增长的动态计算。下一步值得追的问题是:怎样的中间步骤才算「真的在算」,以及验证成本能不能降到与生成同一个量级。

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?