RLHF 把模型调得乐于助人,但它有两个昂贵的天生缺陷:人类偏好标注又贵又慢(每轮迭代都要雇人对比打分),人类红队又危险又低效(让真人想尽办法诱导模型作恶)。Anthropic 2022 年 12 月的论文《Constitutional AI: Harmlessness from AI Feedback》(Bai et al., arXiv:2212.08073)给出的答案是:把「什么算好回答」写成一部成文原则,让模型自己照着批评自己。RLHF 的全景背景见站内《RLHF 全景》,本文精读 CAI 的两段机制。
第一阶段:自我批评 + 修订(监督学习)
CAI 的第一步不是训练偏好模型,而是造数据:
- 先用一个普通 RLHF 模型对有害提示生成初始回答(此时它多半是拒答或含糊);
- 把一部「宪法」——论文版本约 75 条成文原则——喂给模型,让它对照原则批评自己的回答(「这个回答是否符合『不助长非法行为』的原则?问题在哪?」);
- 让模型按批评修订原回答;
- 可以多轮迭代,逐条套用不同原则。
所有(提示、修订后回答)对构成新数据集,拿去做监督微调。这一步的产物已经不同寻常:一个不回避但无害的模型——论文标题里的 harmlessness 正来自于此。传统 RLHF 的有害性训练容易把模型调成一个「什么都不敢说」的客服(过度拒答),CAI 的作者明确把「non-evasive(不逃避)」写进目标:模型该解释为什么不能帮、给出安全边界内的替代方案,而不是冷冰冰地拒绝。
第二阶段:AI 反馈替代人类反馈(RLAIF)
第二阶段做偏好训练,但比较标签来自 AI 而非人类:
- 让模型对同一提示生成两个回答;
- 把宪法原则(每次一条)作为评判标准写进提示:「哪个回答更好地遵循了原则 X?」——模型输出偏好判断;
- 这些 AI 偏好对训练出偏好模型(或直接用做 DPO 式优化),再跑强化学习。
人类的角色从「逐条标注」退到「制定原则」:几千条人类红队标签的工作量,被几十条原则 + 模型自我生成的偏好数据替代。论文口径下,人类标注量级显著下降,且无害性维度主要靠 AI 反馈达成。
与 RLHF 的对照:改了什么、留了什么
| RLHF | Constitutional AI | |
|---|---|---|
| 偏好标签来源 | 人类标注员 | AI 按原则生成(RLAIF) |
| 对齐标准存在于哪 | 隐含在标注分布里 | 显式成文(可审计、可修改) |
| 有害性数据 | 人类红队对抗 | 模型自我批评 + 修订 |
| 人类角色 | 大规模标注 | 撰写与迭代原则 |
| 风险 | 标注员负担与暴露 | AI 评判的系统性偏差 |
CAI 最被低估的贡献是对齐标准的显式化:RLHF 的「价值观」埋在几万条标注的统计分布里,外人无法审计;CAI 把它写成一纸宪法——Anthropic 后来公开了自己的宪法文本并征集公众意见,原则可讨论、可修订、可追责。这份「对齐的可解释工程化」影响了整个行业对 AI 政策的写法。
遗留问题:AI 给 AI 打分的循环
CAI 没有解决的三个问题:
- 评判偏差的遗传:AI 反馈学的是「模型眼里的好」,如果基础模型对某类内容系统性误判,RLAIF 会把这个偏差放大并固化——评判模型自身的校准成为新瓶颈;
- 原则之间的冲突:诚实与无害、自主与服从在具体案例里常打架,75 条原则没有给出裁决顺序,冲突场景的实际行为靠训练的随机性决定;
- 宪法由谁定:Anthropic 的公众征集是同行的先声,但「一家公司的价值观写进所有用户的模型」这个治理问题,CAI 只是把它显式化了,并没有回答。
结语
Constitutional AI 的核心洞察一句话:对齐不必藏在标注数据里,它可以被写成文字。把价值观显式化之后,「改对齐」从重新标注几万条数据,变成修订一页原则文档再跑一轮自动化流程——工程效率的跃升之外,更重要的是它把 AI 的行为准则变成了可公开讨论的对象。今天各家模型规范(模型卡、使用政策、系统提示词里的行为准则)的写法,都能看到这篇论文的影子。
读者留言
COMMENTS 暂无还没有留言,来说第一句?