Agent 工程 · 第 13 章|前沿专题:后训练管线、数据飞轮、语音、编码智能体

第 13 章 · 前沿专题

前十二章覆盖了 2026 年 Agent 工程的"生产共识"。本章是三个高薪高门槛的前沿方向:用训练提升 Agent 能力上限、全双工语音、编码智能体内核。每个方向给"能落地"的深度——原理、管线、工具链、与前面章节的衔接点。

13.1 后训练:Agent 能力上限的来源

Prompt 工程与工具设计有天花板;模型自身的能力上限由**后训练(post-training)**决定。2026 年的标准管线:

阶段一 SFT(监督微调)
  数据:成功轨迹(messages + tools + 助手的完整输出序列)
  作用:教会"形态"——怎么用工具、输出什么格式。稠密监督但 off-policy
        (数据来自别的策略分布,学生只会模仿没见过自己的错误)

阶段二 偏好优化 / 可验证强化
  DPO:同场景 成功/失败 轨迹配对,直接优化偏好(简单稳定,无需奖励模型训练)
  RLVR:可验证奖励的强化学习(GRPO/DAPO 算法族)——奖励由"验证器"给出:
        单元测试通过、断言满足、工具调用正确。on-policy(模型在自己的分布上
        探索),但奖励稀疏(长轨迹只有终局一个信号)

阶段三 On-Policy Distillation(OPSD,2026 年兴起)
  学生模型自己滚动采样,教师模型对每个学生动作给稠密反馈
  ——把"RL 学到的能力"压缩进更小/更快的模型,解决 RL 后的部署成本问题

Agentic RL 的两大工程难点(也是岗位 JD 里"通过 SFT、RL 提升 Agent 能力上限"的实际内容):

  1. 长程 credit assignment:一个 50 步任务只有终局成功信号——第 3 步的错误和第 47 步的错误被同等惩罚,训练信号噪声极大。前沿方向:过程奖励模型(PRM)、步级信用分摊(MileGPO 类工作);
  2. 可验证奖励需要可靠执行环境:数学题的验证器是答案比对,Agent 任务的验证器是执行环境——代码跑不跑得通、断言过不过、文件状态对不对。这就是第 6 章沙箱(尤其快照与确定性回放)被称为"RL 基础设施"的原因:没有可重复的执行环境,就没有可信的奖励信号。

数据飞轮:从生产轨迹到训练集

前九章的建设在这里收网——你已有的评测、轨迹、反馈系统就是数据飞轮的上游:

完整轨迹采集(第 9 章 9.4,按会话归档)
  + 结果信号(任务成败 / 用户反馈 / 评测分)
  → 导出 schema:messages 序列 + tools 声明 + reward
  → SFT 集:成功轨迹(过滤:评测分达标 + 无敏感信息,脱敏复用第 11 章审计链路)
  → DPO 对:同一场景的 成功/失败 轨迹配对
  → 训练(TRL / LLaMA-Factory:SFT → DPO → GRPO 逐段可插拔)
  → 回灌验证:微调后模型跑同一评测集,pass_rate 对比

这条管线的每一环都在前面的章节建好了——评测体系就是训练数据的质量门禁,没有第 9 章就没有可信的"微调后变好了"。

13.2 全双工语音 Agent

回合制语音(说完 → 转文字 → 生成 → 逐句播)与全双工(可随时打断、自然抢话)的差距是纯工程,三块积木:

  • 流式 ASR:音频分块进流式识别(faster-whisper 流式解码),拿到带时间戳的部分假设——不等说完就开始理解;
  • VAD(语音活动检测):判断用户在说话/停顿,管理轮次——当前句尾静音 > 500ms 判定说完(阈值是体验的核心调参点);
  • Barge-in(打断):AI 播报期间检测到用户开口 → 立即停止 TTS 播放 → 中断当前的生成链 → 用户的插话进入新一轮。工程关键在取消语义:TTS 是分句排队播放的,打断要清空播放队列 + 终止正在合成的句子 + 取消进行中的 LLM 调用(否则退了播放声音还在烧 token)。

端到端延迟预算(全双工体验的硬指标,目标 < 1.5s):

用户停止说话 → VAD 判定(~100-300ms)
→ 流式 ASR 出文本(~200-400ms)
→ LLM 首 token(~300-800ms,流式)
→ TTS 首包音频(~200-300ms,逐句流式合成)

升级路径:WebRTC 传输(替代 WebSocket 音频,抗抖动/回声消除)、Omni 端到端模型(语音直接进模型,跳过 ASR/TTS 两跳延迟,但可控性下降)。Proteus 已有的 STT→Agent→TTS 流水线与分句 TTS 是第一版 barge-in 的现成底座。

13.3 编码智能体内核

AI Coding 工具(Claude Code / Codex / Cursor 类)是当前商业上最成功的 Agent 形态,其岗位(AI Coding 工具研发专家)考察的就是"harness 内核"的理解。分析框架:

编码智能体 = 模型 + Harness。模型决定能力上限,harness 决定兑现率。对 11 个编码智能体的源码研究(《Harness Engineering》,2026)显示:各家差异集中在循环控制、上下文管理、扩展机制三处,而非工具本身。

harness 的六个核心机制(与前面章节一一对应,这正是"通法"的证据):

机制 在编码 Agent 里的形态 对应章节
Agent Loop 读文件→改代码→跑测试→修错的循环,带轮数/token 预算 02
上下文管理 项目记忆文件(常驻约定)+ 对话压缩 + 子智能体隔离脏活 03
工具编排 文件读写/shell/搜索 + 权限分级(只读直通、写操作确认) 05、11
沙箱执行 测试与命令跑在受限环境 06
Hook 生命周期拦截(提交前跑 lint、工具调用前后审计) 05
Skill/子智能体 专项能力包 + 派生研究任务 03、07

动手路径(这是三个方向里最"自助"的):以任意开源 CLI Agent(如你自己实现的第 2 章升级版)为对象,逐机制与 Claude Code 公开文档对照,写"它怎么做 ↔ 我怎么做 ↔ 我会怎么改"的三方笔记。做完这份笔记,编码工具岗位的核心面试题(Agent Loop / 上下文 / 权限 / Hook / Skill / MCP)每一条你都有第一手答案。

13.4 方向选择建议

你的背景/兴趣 建议切入点 先修章节
评测/数据功底,想碰训练 数据飞轮(13.1)——轨迹导出 + 微调回灌 06、09
音视频工程背景 全双工(13.2)——barge-in 的取消语义 02、12
系统工程背景、求职 Coding 工具岗 内核拆解(13.3)——三方对照笔记 02-07 全部
研究倾向 Agentic RL 的 credit assignment 06、09、13.1

三个方向的共同点:都建立在前十二章之上——没有可靠的执行环境、评测与数据管道,三个方向都无法起步。这也是为什么它们"前沿"却不是空中楼阁。

实现作业

  1. 数据飞轮:给第 9 章的评测轨迹加导出器——SFT(JSONL:messages+tools)与 DPO(同场景成败配对)各一份,跑通 LLaMA-Factory 或 TRL 的一次小模型微调,用原评测集对比前后 pass_rate;
  2. Barge-in:给语音流水线加打断——TTS 分句播放 + VAD 检测 + 播放队列清空 + LLM 调用取消,实测端到端响应 < 1.5s;
  3. 内核对照笔记:选 5 个机制(循环/压缩/权限/Hook/子智能体),对照一个开源 CLI Agent 与 Claude Code 文档,产出三方对照文档——这份文档同时是求职作品。

深入材料

  • Nathan Lambert, RLHF Book 与 Post-Training Course(rlhfbook.com,后训练系统教材)
  • TRL 文档(github.com/huggingface/trl,SFT/DPO/GRPO 工具链)
  • arXiv 2609.31900(SFT/RLVR/On-Policy Distillation 协同的机制研究)
  • Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents(2026,11 系统源码研究)
  • LiveKit Agents / Pipecat 文档(实时语音 Agent 框架)
  • WebRL、Agent Q(agentic RL 的代表性工作)
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?