系列说明:这是「智谱 RSI 最新进展深度研究」的下篇,共三篇。上篇 复盘事件并拆解三个工程案例;中篇 做 RSI 分级定位与七组数字口径核查;下篇(本文)谈五条边界线、五条给工程师的可复用做法、五个给管理者的评审问题与四个给投资者/产品经理的跟踪指标,并附完整附录(时间线、术语表、分级来源清单、核查记录)。
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(下)· 边界、风险与行动清单
上篇讲技术,中篇做定位与核查。下篇要做的是把它变成可用的东西——同时把不该被叙事盖住的线,一条条划出来。
六、与站内"算子篇"的分工:两份证词,互补而不重复
9 月 17 日同一天,站内还有一篇高度相关的文章——《当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环》。它讲的是 DeepSeek 算子工程师刘胜与的长文自白:一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师,公开判断"未来半年到一年,AI 自主评估调度方案、设计并实现端到端极致算子的能力,大概率追平甚至超越顶级人类工程师——包括他自己"。
两篇放在一起读,刚好构成一组对照。它们的差异不是观点之争,而是视角、证据类型与时间尺度的不同:
| 维度 | 算子篇(DeepSeek / 工程师视角) | 本系列(智谱 / 厂商视角) |
|---|---|---|
| 讲述人 | 一线算子工程师的公开自白 | 创始人 + 团队长文,配官方发布文与财报口径 |
| 证据类型 | 个人经历 + 行业案例溯源(AlphaEvolve、Kevin-32B、DGM) | 内部工程案例 + 上游 PR + 生产流量 + 资本安排 |
| 闭合的回路 | 算子层 → 训推效率 → 实验次数 → 更强模型 → 更会写算子 | 推理服务栈全栈(算子/并行/并发/缓存/调度)→ 承载线上流量 → 反哺下一代训练方式 |
| 关键判断 | "AI 不必修改自己,只要参与制造更快的自己" | "模型优化系统,系统承载模型" |
| 风险侧重 | 人类侧:工程根基被效率捷径抽空、监督带宽下降 | 治理侧:安全能力改变格局、人守边界 |
| 证据弱点 | 个人观察为主,量化偏少 | 内部口径为主,缺外部独立复测 |
值得注意的是,两位讲述人指向同一个瓶颈位:算子篇里那位同行说"除了方案不能替我敲定之外,别的都可以帮助我完成";智谱长文里说"工程师定义优化目标与系统约束……审核涉及数值语义、并发行为和线上风险的关键修改"。"方案/目标/边界的敲定权",是两条线共同承认的、尚未被自动化的一格。
七、边界与风险:五条不该被叙事盖住的线
7.1 第一条线:判断侧仍然空着
执行侧的自我改进真实且迅猛;判断侧几乎还是零。
智谱的长文自己把这条线画得很清楚——工程师的三项职责是"定义优化目标与系统约束""构建 Agent 可以直接使用的反馈环境""审核涉及系统架构、异步并发和线上风险的关键修改",而"选择目标、设定边界、判断风险,仍然是人的工作"。
站内框架把这一点表述为"方向设定权,目前没有任何自动替代方案":验证层级能回答"这个结果对不对",回答不了"什么值得被评估"。三个案例里,所有优化目标——5% 的性能差距约束、精度误差要求、端到端收益的判断标准——都是人先写下来的。Agent 找到了更好的答案,但问题一直是人出的。
7.2 第二条线:能力与风险同源
长文开篇那段关于安全的叙述,其实比"取代我们"更值得警惕:
"2025 年 10 月,我们开始启动安全能力增强研究……不到一年,安全伙伴使用 GLM 在真实代码库中发现了数千个漏洞。模型开始改变网络安全的格局,也带来了过去不曾存在的危险。为了让这种能力能够被负责任地使用,我们不得不为它设计受信访问计划。"
这段话包含一个不容易拒绝的结构性事实:同一个模型写代码越强,找漏洞就越强;让系统优化自身基础设施的能力,与让系统发现自身基础设施漏洞的能力,是同一份能力。 智谱中报也提到其在 CyberGym 上取得 84.5%、ExploitGym 上完成 130 项任务——网络安全是其能力迁移最快的方向之一。
对采用者来说,可操作的含义是:当你把"让 AI 改自己的系统"从演示推进到生产,你就同时引入了两个新变量——更快的修复能力,和更快的攻击面扩张速度。 受信访问、审核闸门不是配套工作,而是前置条件。
7.3 第三条线:内部口径的自我循环
本次证据链最明显的弱点是:所有效果评估都由内部完成。
- 基线是自家的初始实现(W8A8 基线);
- 验收标准是自家工程师定的(5%、精度误差);
- 优化收益是自家 Profiling 与分层测试测出来的;
- 骨架库的积累与复用率没有外部可见度;
- 3 倍吞吐的独立第三方复测尚不存在。
这不构成对结论的否定——稠密反馈体系本身就是被设计来服务内部判定的。但它意味着:任何把这次的数字当作"外部基准"来引用的做法,都需要加限定语。 长期看,这个领域的可信度会取决于一件事:是否出现跨机构、可比的"加速指标"(这也是站内 RSI 讨论里反复出现的一条治理建议)。
7.4 第四条线:成本曲线自主,但供应链集中
10 万卡级国产芯片规模化推理,加上单位 token 成本较年初下降 80%,在成本侧是一个真实的战略成果——用中报的原话说,这意味着"成本曲线已经开始掌握在我们自己手里"。
但要同时看到另一面:
- 芯片型号与供应商未公开,互联靠"自研高带宽网络"——一旦某一个环节的供给或适配出问题,替换成本不低;
- 生态不成熟(长文原话:"生态不成熟,算子不完备,许多文档基本靠猜")意味着大量知识需要自己重建,短期是护城河,长期是维护负担;
- 公告中的应对是把算力供给做成"来源多元且可灵活调配",并把"芯片适配、算子开发、集群互联和性能调优"列为明确投入项——承认了适配层本身是持续成本,而非一次性工程。
7.5 第五条线:叙事与资本的自我强化
这是最需要冷静的一条,因为它不涉及真假,只涉及激励结构:
- 7 月,内部信把"完全自我训练"列为四大引擎之一;
- 8 月,模型上线,官方发布文出现"模型优化系统,系统承载模型"的循环表述;
- 9 月 12 日,融资公告把 60% 募资(约 235 亿港元)指向"下一代 GLM 与完全自训练体系";
- 9 月 17 日,创始人长文把这一切命名为"RSI 的早期形态"。
这条链上的每一步都合规、都有实物支撑。但同时,它构成了一个**"进度叙事 → 融资能力 → 算力采购 → 进度叙事"的正反馈**:叙事越强,融资越顺;融资越顺,算力越多;算力越多,越容易拿出新的进度。这不等于造假——它恰恰是当前 AI 竞争的真实机制(唐杰在内部信里也承认速度本身就是最重要的变量)。但对读者而言,需要知道估值叙事与工程进度之间存在相互放大,因此在评估"RSI 进度"时,应尽量使用可核查的物证(上游代码、可下载权重、独立复测),而不是使用叙事的密度。
7.6 一条附带的副作用:标签通胀
本次之后,"RSI"在中文语境里大概率会被更频繁地使用。按本次事件再校准一次常见混淆:
| 说法 | 实际在说什么 | 属于哪一侧 |
|---|---|---|
| "智谱实现了 RSI" | Infra Agent 参与优化了自身推理系统 | RSI 前体(L3,第三支柱的单点实证) |
| "模型能自己训练自己了" | GLM-6.0 的目标定位,尚未发布 | 目标,不是已发生的事实 |
| "3 倍提速,AI 已经能改自己了" | 同硬件基线上的工程优化收益 | 工程成果,不等于改权重 |
| "取代我们" | 内部人对自己工作被加速的描述 | 修辞,同一篇文章已自我限定 |
判断任何"RSI 进展"的说法,只需三个问题——改的是什么(产物/harness/系统/权重)?验证信号来自哪一层?改动能不能回流成下一轮的起点?
八、行动建议:把这篇报告变成可用的东西
8.1 给平台 / Infra 工程师:稠密反馈的可复用清单
按落地难度排序,前三条几乎立刻可用:
- 把性能约束写成可执行的验收条件。 不要写"优化 KV 传输性能",要写"相同 workload 下,Prefill + KV Transfer 与单独 Prefill 的性能差距不超过 5%"。约束一旦可验证,"没达到预期"就自动变成一个可归因的偏差。
- 给每个子系统配一个"低成本验证入口"。 算子级正确性比对、局部微基准、单算子 Profiling——让 Agent(和人)在每次修改后不必等完整部署。验证周期决定了迭代速度上限。
- 把执行 Trace 和运行时事件当成一等公民。 GIL 持锁那个问题,静态读代码几乎不可能发现,是时间线暴露了"传输从未与 dispatch 重叠"这个模式。
- 建立"并行策略 → 算子实现"的映射表。 这是正确性验证的索引:一种并行配置涉及哪些算子、输入如何切分、哪些路径需要与非切分实现对照。
- 保留同版本内已知正确的对照路径。 DeepEP v1.2.1 里
internode_dispatch已释放 GIL 而intranode_*没有——代码库里的不一致,是最好的 bug 线索。 - 让优化产物带条件沉淀,而不是只留下这一版代码。 骨架库的四要素(适用条件、变换方式、资源约束、验证证据)值得照搬;同时把验证通过的修复合并回上游,收益会随社区扩散,也是未来最省力的技术债偿还方式。
- 允许"有解释的退步"。 KDA Decode 的 v1(ReplaySSM 以算换存)比 v0 慢 10%,但它是 v3 达到 1.71× 的前提。评估机制若只看单版指标,这类必要退步会被误杀。
8.2 给技术管理者:评审"AI 改系统"方案的五个问题
| # | 问题 | 好答案长什么样 | 危险信号 |
|---|---|---|---|
| 1 | 反馈从哪来? | 分层:算子测试/微基准/Trace/端到端,各有职责 | 只有端到端压测,"跑得慢就再试" |
| 2 | 如何归因? | 能给出"现象 → 假设 → 对照实验 → 根因"的完整链条 | 只给现象和结果,中间靠"模型判断" |
| 3 | 人卡在哪里? | 目标设定、系统边界、数值语义/并发/线上风险审核 | "全自动,人只看报表"——通常意味着验证薄弱 |
| 4 | 产出会回流吗? | 骨架库/测试用例/上游 PR/验收标准均可复用 | 一次性成果,无沉淀机制 |
| 5 | 失败如何回滚? | 可 diff、可回放、有回归门禁 | 依赖"结果看起来更好"作为唯一验收 |
一个粗略的经验法则:第 3 题的答案越具体,方案的可靠性越高。 反过来,声称"人完全退出"的方案,多数是把"没人看"当成了"不需要看"。
8.3 给投资者与产品经理:四个可跟踪指标
先说明:本系列不做估值判断。 下面只把"哪些数字值得盯、各自意味着什么"列清楚,全部口径来自公开材料。
| 跟踪指标 | 当前值 | 为什么重要 | 下一步该看什么 |
|---|---|---|---|
| 单位 token 推理成本 | 较年初 −80%(中报口径) | 直接决定 MaaS 毛利与价格战可持续性 | 是否继续下行;下行中有多少来自架构与国产卡,多少来自 Agent 加速 |
| MaaS 规模与损耗 | 中报口径 ARR 月度 16 亿美元/周度 20 亿美元;Token 调用较年初 +40 倍;付费日活 +603% | 判断"能力兑现"是否真实转化为收入 | 单位经济(每 token 毛利)与留存,而非只看调用量 |
| 国产算力占比与集群规模 | "10 万卡级"、单位成本下降 80% | 决定成本曲线自主程度与地缘风险敞口 | 芯片型号披露、集群互联自研程度、多元供给落地 |
| RSI 进度的"物证密度" | 目前:上游 PR + 开源权重 + 生产流量 | 区分叙事与进度的唯一可行办法 | GLM-6.0 发布时是否给出"预测/中训/后训自产数据占比"这类可核查指标 |
三条机制性观察:
- 资本节奏与算力节奏强绑定。 公告明确说明"算力资源从签约到部署上线需要一定周期",融资是为了让新增算力部署与扩张计划衔接,且承诺 2028 年 6 月 30 日前用完——未来六个季度存在一条相对可预测的算力投放路径。
- "RSI 叙事"当前是成本叙事,不是收入叙事。 三支柱中已兑现的第三支柱直接作用于成本与供给(吞吐、单位成本、国产化),而非直接的收入增量。收入侧仍由 Coding/Agent 产品驱动,两条曲线不要混算。
- 最大的估值风险不是技术路线,而是验证的独立性。 目前所有"3 倍""−80%"都是内部口径。若未来出现第三方复测或客户侧公开的成本对比,叙事可信度会显著上升;反之,长期缺少外部验证会压制估值中的长期想象空间。
九、结语:这次真正被生产出来的东西
唐杰与 GLM 团队说自己意识到"我们的继任者,正是我们亲手创造出来的 AI";同一篇文章的结尾又写:"这条线不会因为我们希望它慢一点就慢下来"。
但把修辞全部剥掉,2026 年 9 月真正被生产出来的,其实是三样:
第一,一套可复用的反馈工程方法。 端到端指标只能说明"变差了";而"局部、低成本、可客观验证"的稠密反馈能说明"哪里变差了、为什么、下一步该验证什么"。这套方法不依赖智谱的芯片,也不依赖 GLM——它是整个事件里最容易被别的团队拿走的部分。
第二,一次"回路闭合"的工程演示。 模型写的优化,改进了承载模型的系统;改进后的系统,又让模型以更低成本服务更多人。"模型优化系统,系统承载模型"这句话,第一次有了两周、3 倍、10 万卡这种可以写进季报的数字。
第三,一条被划得更清楚的线。 执行侧(提出假设、写代码、跑实验、看 Trace、改算子)交给 Agent 的部分在快速变多;判断侧(选目标、定边界、判风险)仍然是人的工作。这条线不是被技术宣布的,是被工程实践一遍遍确认的——长文里那句"在相当长的时间里,这条线应当由人来守",是今年所有 RSI 讨论里最值得记住的一句人话。
所以对"智谱 RSI 最新进展"这个问题,最准确的回答是:
它没有走到 RSI。它做到的是把 RSI 三根支柱中最容易验证的那一根,从路线图变成了可核查的工程账本——并且顺手示范了一件事:在 AI 能自我改进之前,人类先把"如何让 AI 改进系统"这件事,做成了一套可以交接的手艺。
至于这条路会走多快,最后留一个问题:当"改什么"的答案从"代码"变成"承载自己的系统",下一个被交出去的,会是"选什么目标",还是"判定什么算对"? 这两件事,目前都还开着。
附录 A|事件时间线(2026-04 → 2026-09)
| 日期 | 事件 | 性质 |
|---|---|---|
| 04-29 | 智谱官方博客《Scaling Pain:超大规模 Coding Agent 推理实践》:PD 分离下 KV Cache 竞态修复(异常率万分之十几 → 万分之三以下)、HiCache 加载时序修复(合入 SGLang PR #22811)、LayerSplit 分层存储(40k–120k 长度区间吞吐 +10%~132%) | 工程前史 |
| 07-11 | 唐杰内部信《巨浪已来》,提出"摸高计划":长程任务、自治智能体系统、完全自我训练、极致安全治理 | 战略定调 |
| 08-17 | DeepSeek 实施峰谷定价、高峰提价,平台日调用量从峰值回落超一半,空出近 10 万亿 token 的日常需求缺口 | 行业背景 |
| 08-26 | GLM-5.3-Flash(320B-A18B)上线并 MIT 开源;官方认领匿名模型 Ox-Alpha;发布文出现"模型优化系统,系统承载模型"表述 | 产品发布 |
| 08-27 | 智谱(02513.HK)收涨 12.62%,报 1160 港元,市值重返 5000 亿港元;同日 fla-org 仓库合入 PR #1180(tf32x3 in KCP) | 市场反应 + 代码物证 |
| 08-28 | 媒体报道:集群规模 10 万卡级、累计处理请求流量 62T token、Ox-Alpha 终结 DeepSeek 连续 56 天霸榜 | 第三方转述 |
| 08-31 | 2026 中报电话会:GLM-6.0 方向是"自进化";All-in-Infra;单位 token 推理成本较年初 −80%;infra agent 使算子开发周期缩短一半;上半年营收 9.54 亿元(+399.7%) | 财务口径 |
| 09-12/13 | 港交所公告:配售 + 可转债合计净募约 393 亿港元;60%(约 235 亿港元)投向下一代 GLM 与"完全自训练"体系;定义三支柱:数据自产、环境自造、基础设施自我优化 | 资本安排 |
| 09-17 | 唐杰与 GLM 团队长文发布;同日站内发布《当 AI 开始写算子》 | 叙事公开 |
附录 B|术语表
| 术语 | 英文 / 缩写 | 本系列中的含义 |
|---|---|---|
| 递归自我改进 | RSI | 系统改进"自己改进的能力",改进产物回流为下一轮输入;按 L0–L5 分级使用 |
| 完全自训练 | Fully Self Training | 智谱对 RSI 的具体技术表述,含数据自产、环境自造、基础设施自我优化三支柱 |
| 稠密反馈 | Dense Feedback | 把正确性测试、日志、Trace、运行时事件、微基准、端到端指标组织成可反复调用、局部、低成本、可客观验证的反馈体系 |
| Infra Agent | — | 由 GLM-5.3 驱动、用于开发与优化推理基础设施(算子、服务栈、性能诊断)的智能体 |
| 上下文并行 | CP (Context Parallel) | 把长上下文按分片切分并行计算,分片间需合并状态 |
| TF32 / tf32x3 | — | TF32 为 Tensor Core 的默认低精度模式;tf32x3 用三次 TF32 运算组合出更高精度结果 |
| 优化骨架 | Optimization Skeleton | 从存量 Kernel 提炼的优化经验,含适用条件、变换方式、资源约束、验证证据四要素 |
| EPD 分离 | Encode–Prefill–Decode | 将多模态编码、提示词预填充、逐 token 解码拆为可独立调度与扩缩容的工作池 |
| ReplaySSM | — | 以算换存的显存优化手段(KDA Decode v1 引入,导致执行时间先变长) |
| LayerSplit | — | KV Cache 分层存储:每卡只保存部分层的 KV Cache,计算前广播 |
| KDA | — | 线性注意力算子(本次精度与性能两类问题的对象) |
| 受信访问计划 | Trusted Access | 智谱为高风险安全能力设计的访问控制机制 |
附录 C|来源清单(按证据等级)
A 级:官方一手 / 可核查物证
- 唐杰、GLM 团队长文(InfoQ 整理,2026-09-17)
- 智谱官方发布文《GLM-5.3-Flash:前沿智能进入普惠时代》,2026-08-26
- 智谱官方博客《Scaling Pain:超大规模 Coding Agent 推理实践》,2026-04-29
- fla-org/flash-linear-attention PR #1180:
[CP] use tf32x3 affine chain in kcp,2026-08-27 - 智谱港交所融资公告释义("完全自训练"定义、三支柱、资金用途分配),2026-09-12/13
- 智谱 2026 中期业绩电话会记录(唐杰、刘德兵发言),2026-08-31
B 级:权威媒体 / 第三方整理
- 量子位《智谱提前剧透下一代 GLM:完全自训练方法公开了》,2026-09-14
- 观察者网《智谱认领"牛来"模型,跑在 10 万张国产芯片上》,2026-08-28
- 钛媒体《GLM-5.3-Flash 发布,多模态终于来了》(含"1/40 是价格比而非硬件成本比"的关键提示)
- 财联社《10 万张国产算力卡扛起"牛来":智谱开源 GLM-5.3-Flash》
- 雷递网《唐杰解读智谱半年报:Scaling 从未停止,GLM-6 方向是自进化》,2026-09-02
- 36氪《独家|智谱创始人唐杰发内部信:「GLM 时刻」之后,什么是更重要的事》(《巨浪已来》全文),2026-07
C 级:需谨慎引用
- 关于芯片供应商的"知情人士透露"类报道(华为 / 摩尔线程 / 海光)——未获官方确认
- 社交平台对长文的转述与二次评论——仅作氛围参考,不作为事实依据
附录 D|站内延伸阅读
- 概念篇|什么是 RSI(递归自我改进):定义、谱系与判定手册
- 对比篇|RSI vs 智能体自进化:同一个闭环,两种野心
- 证据分级篇|递归自我改进(RSI)证据分级深度报告 2026-09
- 算子篇|当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
- 全景篇|递归自我改进(RSI)深度研究 2026:从智能爆炸到接管全球主机节点
- 专题地图|RSI 与 Agent 自进化:站内内容地图与三条阅读路线
附录 E|核查记录(本系列做了什么、没做什么)
做了什么
- 逐条比对了官方发布文、中报口径、融资公告与长文表述之间的一致性;
- 核实了长文提及的上游 PR #1180 确实存在、日期吻合、描述一致;
- 交叉核对了"3 倍""1/40""10 万卡""62 万亿""6 天""两周""缩短一半"七个数字的来源与口径差异;
- 检索中文与英文公开信息,未发现对该次优化成果的技术性反驳或独立复测。
没做什么(并说明原因)
- 未做独立性能复测:无对应国产卡集群环境,无法验证 3.22×;
- 未做第三方交叉访谈:未接触智谱内部或供应链相关方;
- 未做估值建模:本系列不做投资建议,仅整理可跟踪指标;
- 未引用未公开材料:全部依据公开可查来源。
一处日期口径说明:8 月 26 日发布文称"过去一周"进行匿名盲测;8 月 28 日媒体报道称集群"累计处理请求流量高达 62T Token";中报电话会口径为"6 天调用总量超过 62 万亿"。三者指向同一事件的不同时点表述,本系列按各自来源分别引用,未做统一换算。
全系列小结:上篇交付方法(稠密反馈),中篇交付定位与口径(L3 命中、L4 未到;七个数字成立的条件),下篇交付边界与清单(五条线、五条做法、五个问题、四个指标)。
回到上篇:从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(上)|回到中篇:(中)RSI 分级定位与七组数字口径核查
本系列为公开信息整理与工程逻辑分析,不构成投资建议;涉及"是否已实现"的判断以公开证据为准,凡未经官方确认的媒体报道均已标注证据等级。数据截至 2026 年 9 月 17 日。
读者留言
COMMENTS 暂无还没有留言,来说第一句?