从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(中)· RSI 分级定位与七组数字口径核查

系列说明:这是「智谱 RSI 最新进展深度研究」的中篇,共三篇。上篇 复盘事件并拆解"稠密反馈"三个工程案例;中篇(本文)做 RSI 分级定位、拼上 GLM-6.0 的三支柱拼图,并逐条核查七个流传最广的数字;下篇(即将发布)谈五条边界线、风险管理与给三类读者的行动清单。

从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(中)· RSI 分级定位与七组数字口径核查

上篇拆完了技术。中篇要回答一个更容易被标题带偏的问题:这件事在递归自我改进(RSI)的坐标系里,站在哪一级?

答案需要用现成的工具来判定,而不是靠感觉。本站已有两套工具可以直接使用:概念篇的 L0–L5 强度阶梯与验证层级,以及对比篇的"闭环四问"。


三、坐标系定位:这落在 RSI 的第几级

3.1 用 L0–L5 逐级排除

级别 判据(一句话) 本次是否命中 依据
L0 工具化辅助 模型帮人写代码,人做全部决策 ✗ 已被越过 Infra Agent 自主提出假设、实施修改、执行实验;人退到目标定义与关键审核
L1 部署时自我精炼 针对固定评估器反复改输出,单次任务内有效 ✗ 已被越过 工作跨两周、跨多个子系统,产物落进骨架库与上游仓库,不是单次会话内的输出筛选
L2 训练时自我迭代 用自生成数据/自博弈更新权重 ✗ 未命中 长文未披露任何"模型自训权重"环节;GLM-5.3 相对 5.2 的提升官方明确来自后训练,且由人主导
L3 算法与元层改进 改的是改进方法本身(评估器、搜索、训练管线、基础设施) 命中 改的是承载自身迭代的推理系统:验证入口、算子、并行策略、并发边界、服务栈;经验以骨架库/上游 PR 形式回流
L4 开放式 RSI 系统自己生成任务、评估器与目标 ✗ 无公开证据 长文明确:"选择目标、设定边界、判断风险,仍然是人的工作";优化目标与系统边界由工程师定义
L5 完全自主继任者 自主设计、训练、验证下一代模型 ✗ 未实现 长文原文:"我们还没有走到递归自我改进"

结论:L3 命中,L4 未到。 这与站内全景篇的判断("有界自我精炼已工程化,开放式 RSI 尚未发生")完全一致,只是这次提供了一个更硬的样本:不是论文里的原型,是上线跑流量的生产系统。

3.2 验证层级:为什么"基础设施"最先闭合

本站讨论过一条重要规律:自我改进的可靠性沿着验证信号强度递减,而验证信号分四层。把本次证据对号入座,结构非常整齐:

验证层级 信号 可靠性 本次的对应物
1 形式化验证 证明、类型系统 ⭐⭐⭐⭐⭐ 未使用(推理系统无法形式化)
2 执行/测试反馈 编译、精度比对、微基准、Trace、端到端指标 ⭐⭐⭐⭐ 本次几乎全部落在这里
3 学习型裁判 奖励模型、LLM Judge ⭐⭐⭐ 未出现在长文的核心链路
4 内在自评 置信度、自我感觉 ⭐⭐ 未使用(长文强调"不能仅凭现象之间的相关性确认根因")

由此得到一个干净的推论:智谱这次的"稠密反馈",本质上是一次"层级 2 信号的人工增密工程"。 他们没有发明新的验证手段,而是把已有的测试、日志、Trace、微基准重新组织,让它们能在 Agent 需要的时候被精确调用。

这也解释了为什么基础设施层会成为 RSI 最先闭合的一段:

  1. 信号天然是层级 2 的。 编译能不能过、数值对不对、跑得快不快——三个信号全部客观、全部可自动化、分辨率以纳秒计。
  2. 问题可以被局部化。 一次修改的影响面在算子、线程、执行区间这一级可以被隔离,不需要重建整个世界模型。
  3. 失败可以回滚。 改坏了就 revert,不像权重更新那样"参数漂移不可回放"。

一句话概括:基础设施是 AI 工业里"考试最好打分"的那门课,所以它最先被自动化。

3.3 闭环四问:这次到底是自进化还是 RSI

问题 本次答案 归类倾向
① 改什么? 推理服务栈、算子、并行策略、并发边界、验证入口——不触模型权重 自进化侧(harness / 外部系统)
② 留多久? 跨会话、跨版本:骨架库 + 上游 PR(PR #1180 已进社区主线)+ 写回验收标准 持久,且部分溢出到组织之外(开源社区)
③ 谁验证? 执行/测试反馈(层级 2)+ 工程师审核关键修改 强信号为主
④ 谁担险? 采用它的组织(工程风险,可回滚) 风险内部化

于是得到本报告最核心的一次定性:

按"改什么",它是自进化;按"闭环收敛在哪里",它是 RSI。

站内对比篇给过一句判据——"闭环收敛在训练数据、评测、训练基础设施、芯片内核上,你得到的就是 RSI"。智谱这次改的正是推理基础设施(与训练基础设施同属"承载自身迭代的系统"),并且明确说"这项工作将直接改变下一代模型的训练方式"。所以它不是"AI 帮人写代码"这类 L0 故事,而是 RSI 三根支柱中"基础设施自我优化"这一支的首个公开工程实证

需要补一句边界说明:推理侧优化不等于训练侧加速。 把 3.22× 的推理吞吐等同于"模型训练快 3 倍",是本次最容易被传播、也最容易被专业读者挑错的误读(见第五章)。

3.4 关于"没改权重就不算"的两个反驳

RSI 圈内部有一种常见质疑:"改 harness/基础设施不算自我改进,因为模型本身没变。" 这个质疑在 Darwin Gödel Machine 的争论里出现过——"做出这些代码改动的,是一个被冻结的模型"。按同一把尺子量智谱这次,需要给出两个层面的回答:

第一,按严格定义,这个质疑是对的。 如果 RSI 被定义为"系统改进自己的改进能力,且改变留在系统自身(权重/训练管线)",那么"修改外部推理栈"确实更靠近自进化。本报告因此在定性上把它称为 RSI 的工程前体,而非 RSI 本身。

第二,但"改哪些东西能产生复利"这个问题,比"改的东西在不在模型里"更本质。 站内算子篇引用过一个关键表述,值得再引一次:

"AI 不必修改自己,只要参与制造更快的自己。"

这句判断的推理结构是:模型能力迭代速度由"单位时间能跑多少实验"决定;实验效率由训练与推理吞吐决定;吞吐由算子、通信库、编译器、芯片决定。这一层基础设施的自动化完全不触碰权重,却直接改写了"算力换智能"的汇率。 当 AI 接管这一层,递归就成立——定义 RSI 的最小充分条件从来不是自我意识,而是系统改进的产物反哺系统自身的改进速度,形成正反馈回路

所以准确的表述是:智谱这次闭合了"推理基础设施"这一段的回路,它是完整 RSI 回路的一个必要组成段,而不是全部。

3.5 谨慎的量化:这次闭环的"复利"有多大

不夸大,逐项列清楚三个可用的量,并说明各自不能推出什么:

指标 数值 口径 不能推出什么
端到端服务吞吐 相比同一硬件上的初始基线 3 倍(长文图示 T+0 1.00× → T+13 3.22×) 推理侧,同硬件 ❌ 不能推出"相比英伟达快 3 倍";官方表述是"硬件效率与单 token 成本已达到相当水平"
单位 token 推理成本 较年初 −80% 综合口径(含架构重设计、量化、国产卡、Infra Agent 加速) ❌ 不能单独归因给 Infra Agent
算子开发周期 缩短一半 中报电话会口径 ❌ 与"不到两周上线"是两套基线,不可并列相加

如果一定要给一个"复利"的量化直觉,最稳的表述是:这次闭环在"人时"维度上有明确节省(算子开发周期减半),在"系统"维度上有明确增益(同硬件 3 倍吞吐),而在"模型能力"维度上没有可直接归因的增益证据。 前两者真实但有限,第三者才是 RSI 叙事真正要证明的东西——尚待 GLM-6.0 兑现。


四、拼图:GLM-6.0 的三支柱,与这次的对应关系

4.1 官方口径里的"完全自训练"是什么

智谱在港交所融资公告的释义部分,给出了"完全自训练"(Fully Self Training)的定义,并明确它是公司对 RSI 的具体技术表述:

下一代 GLM 模型将在上一代 GLM 所搭建的环境里训练,形成递归式自我改进(RSI)闭环,涵盖数据自产、环境自造、基础设施自我优化三个维度。

支柱 官方定义要点 落到具体动作
数据自产 不再完全依赖人类标注 模型间自我对弈、规则校验、执行验证、模型评审、人工抽检 → 自动生成/筛选/积累高质量训练数据,回流到预训练、中训练、后训练各阶段
环境自造 让智能体去采集和转化真实世界的任务 智能体自己试做、自己生成验证器、自己检查任务是否可解,持续扩充训练环境的数量、类型与复杂度;让任务环境成为"可规模化生产及复用的训练资源"
基础设施自我优化 让模型帮忙优化自己赖以运行的训练与推理系统 协助开发与优化算子、内核、调度、缓存和服务栈,使模型逐步参与支撑其自身迭代的基础设施升级

唐杰在 8 月底中报电话会上用更通俗的话讲过同一个意思:让模型可以自己学习预训练、中训练、后训练,自己搭建平台,让整个训练过程完全自主化。

4.2 三支柱的进度表(关键:只有一根有公开工程实证)

支柱 已公开证据 证据等级 缺口
基础设施自我优化 长文三案例(含上游 PR #1180);官方发布文技术栈(ReplaySSM/W8A8/LayerSplit/EPD);中报口径"算子开发周期缩短一半";10 万卡集群承载真实流量 A:官方一手 + 代码物证 + 生产流量 + 财务口径 具体芯片型号与数量未官方确认;Infra Agent 在总工作量中的占比未量化
数据自产 融资公告的定义;"30T token 多模态预训练语料"(该语料是否以自产为主未披露);GLM-5.3 的"任务环境规模化训练"提法 C:战略表述 + 间接线索 合成数据占比、自博弈产物进入各训练阶段的比例、质量校验通过率,均未公开
环境自造 融资公告的定义;中报提到"建设贴近真实专业工作的任务环境" C:战略表述 "智能体自己生成验证器"的具体机制、可解性判定标准、环境规模,未见公开材料

换句话说:9 月 17 日的长文,等于为三支柱中的第三支柱交出了第一份可核查的作业;另外两根目前仍停留在公告与路线图层面。 这不是否定,而是把"已兑现"与"已承诺"分开标注——对任何要引用这套叙事的人来说,这个区分是必须的。

4.3 为什么是"基础设施"这一根最先落地

  1. 奖励最密。 编译通过率、数值正确性、执行时间——三个信号客观、自动、细粒度,不需要人类判定"这个回答好不好"。
  2. 目标最清。 吞吐、TTFT、单 token 成本是纯工程指标,目标可被标量定义,而"什么是更好的研究问题"至今无法标量。
  3. 回滚最易。 代码可 diff、可 revert、可回放;权重漂移不可回放、难审计。
  4. 边界最实。 工程师可以给出"Prefill+KV Transfer 差距不超过 5%"这种可验证的约束——这在开放式研究里做不到。

反过来说,这也预示了后续两支柱的难度来源:数据自产要解决"合成数据的质量谁来判",环境自造要解决"任务的可解性与价值谁来定"。 这两个问题的共同点,是它们都要求系统自己生成评估标准——正好是 L4(开放式 RSI)的门槛所在。

4.4 钱和人:235 亿港元压在"完全自训练"上

用途 金额 占比
下一代 GLM 基础模型与**"完全自训练"体系**研发,以及大规模训练/推理/算力基础设施部署升级 约 235 亿港元 60%
业务拓展、战略投资与潜在并购 约 59 亿港元 15%
优化资本结构与补充运营资金 约 98 亿港元 25%

公告同时说明,全部所得款项预计将在 2028 年 6 月 30 日前悉数动用;并提到当前"优质算力资源的供给及交付条件较为有利",将综合推进算力采购与租赁,投入芯片适配、算子开发、集群互联和性能调优,建立"来源多元且可灵活调配"的算力供给体系。

一个容易被忽略的细节:公告把"自研推理引擎和服务栈"单独列入投入清单,覆盖多模态编码、提示词预填充、逐 Token 解码、量化、缓存、通信及弹性扩缩容——这正是上篇那套技术栈的财务版本。叙事与预算对得上,这一点比叙事本身更重要。

4.5 距离"完全自训练"还差什么

按智谱自己的阶梯(Chat → Coding → Agent → Cowork → Autonomous AI),从 Cowork 到 Autonomous AI 的门槛是**"模型能否自己判断做的对不对"**。用这句话回看三支柱,缺口变得非常具体:

要跨的门槛 现在的状态 需要什么
模型自己判断"做得对不对"(推理/工程域) 基本具备:编译、数值、性能、Trace 全是强验证信号 稠密反馈的进一步工程化与自动化
模型自己判断"数据好不好" 部分具备:规则校验、执行验证可用;但"高质量"仍含人类品味 可扩展的自动评估器 + 抽检机制
模型自己生成"该做什么任务" 不具备:任务价值判断仍是人类专场 开放式目标生成——即 L4 的门槛
模型自主设定"风险边界" 不应具备(官方立场):"这条线应当由人来守" 治理与对齐机制,而非能力

最稳的预期是:基础设施自我优化会在 2026–2027 继续快速推进并大量复用;数据自产会在"可验证任务"范围内扩大;环境自造与开放式目标生成仍是研究前沿。 任何把 2026 年的进展直接外推到"自主继任者"的说法,都跳过了 4.3 节四条结构性原因中的后两条。


五、口径核查:哪些数字成立,哪些被误读

这一章是全篇最实用的部分。传播中,这次事件已被压缩成几个漂亮的数字:10 万卡、3 倍、1/40、62 万亿。它们每一个都能成立,但每一个都有前置条件;把条件去掉,意思就会翻转。

5.1 总表:七组数字的成立条件

数字 成立的说法 常见误读 证据等级
3 倍 相对同一批国产硬件上的初始基线,端到端服务性能提升约 3 倍(T+0 1.00× → T+13 上线 3.22×) "国产卡性能是英伟达的 1/3"或"比英伟达快 3 倍" A(官方一手,含性能曲线图)
1/40 面向用户的价格约为 Claude Opus 4.8 的 1/40(输出价 $25 vs 半价期 $0.6) "推理成本只有英伟达的 1/40" A(官方定价)+ B(媒体明确提示无硬件成本数据)
10 万卡 承载本次线上流量的国产芯片集群规模达 10 万张量级 "官方确认 10 万张某型号芯片" B(官方仅称"大规模国产芯片集群";数量为媒体口径)
62 万亿 token 上线 6 天内,模型在 OpenCode + OpenRouter 双平台的累计调用量 "智谱单模型 6 天消耗 62 万亿(占全平台)" A(官方口径)+ B(第三方报道)
平台 +20% 该模型带动 OpenCode/OpenRouter 整体调用量提升超过 20% 与"62 万亿"混为一谈 A(中报电话会口径)
不到两周 从模型适配到生产可用的跨度(T+0 → T+13 上线) "两周做完一整套推理系统" A(官方一手)
缩短一半 Infra Agent 使算子开发周期缩短约一半(中报口径) 与"两周"相加或绑定理解 A(中报电话会口径)

5.2 "3 倍"的分母到底是什么

  • 分母:同一批国产硬件上的初始基线(图 1 中标注为 W8A8 基线,T+0 = 1.00×);
  • 分子:经过异步调度、排序算子优化、逐层缓存切分、上下文并行、KV 传输与计算重叠、混合缓存量化、分块 MQA、预填充反量化算子、激活与量化融合算子、线性注意力优化等一系列改动后的 T+13 版本 = 3.22×;
  • 官方对跨厂商比较的表述:是"硬件利用效率与单 Token 成本均达到主流 NVIDIA GPU 的相当水平",而不是"超过"。

所以"3 倍"衡量的是同一硬件上工程优化的收益。这其实是个更有价值的信息:它说明国产卡的瓶颈很大程度上在软件栈而非硅片——同一批硬件,仅靠系统层优化就能拿到 3 倍。但它不能被读成"国产芯片 vs 英伟达"的性能比。

5.3 "1/40" 是价格,不是成本

这是本次传播中被媒体明确纠正过的一条,值得重复:

所谓"1/40",并不是说国产芯片的硬件推理成本只有海外 GPU 的 1/40。目前并没有公开数据支持这样的比较。更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了 Claude Opus 4.8 的大约 1/40。

成本结构里至少包含四层:硬件单价与折旧、集群利用率、软件栈效率(Infra Agent 的作用面)、以及商业定价策略(限时半价、开源引流)。把"价格比"读成"成本比",会把一个定价与工程混合的结论,误当作一个纯硬件结论。

5.4 "10 万卡"与芯片型号:官方说到哪里为止

来源 措辞
智谱官方发布文(8/26) "我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接"
中报电话会 "已实现 10 万卡级国产芯片的规模化低成本推理"
媒体(观察者网等) "由 10 万张国产算力芯片组成的超大集群全程承载,累计处理请求流量高达 62T Token"
媒体(钛媒体) "官方没有确认具体供应商,也没有公布具体芯片数量……有知情人士透露训练或由海光 DCU 等国产芯片支持"

结论:"10 万卡级"是可用的官方口径;"具体型号与供应商"是不可用的传闻。 引用时建议写"10 万卡级国产芯片集群(型号未公开)",而不是"10 万张某厂商卡"。

5.5 "62 万亿"与"带动 20%":两个不同的问题

  • 62 万亿 / 6 天,回答的是"这个模型有多受欢迎"——它是双平台累计调用量;
  • 平台整体调用量提升超过 20%,回答的是"它对平台的带动效应有多大";
  • 另有一条单日口径:Ox-Alpha 上线首日冲至 OpenRouter 榜首,刷新单日 token 用量历史纪录,相较平台此前最大 token 量提升 4 倍

三条都可以用,但要各归各位:62 万亿是模型量,4 倍是单日峰值比,+20% 是平台增量。混着说就会变成"智谱让 OpenRouter 流量涨了 20 倍"这类错误。

5.6 "不到两周"与"缩短一半":两套基线,不能相加

  • "不到两周"描述从模型适配到生产可用的整体跨度;
  • "缩短一半"描述 Infra Agent 对算子开发周期的加速效果。

两者的时间窗口、统计对象、口径来源都不同。把它们理解成"本来要四周,Agent 压到两周,其中算子部分省了一半"是一种合理但未经官方确认的解读。稳妥写法是分别引用,不作合并计算。

5.7 三条必须保留的限定语

  1. "取代我们"是修辞,不是结论。 长文自己写了:"当然,我们还没有走到递归自我改进。选择目标、设定边界、判断风险,仍然是人的工作,而且我们认为,在相当长的时间里,这条线应当由人来守。"引用前半句而删掉后半句,是本次最常见的断章。
  2. PR #1180 是"内容吻合的物证",不是"归属证明"。 已核实该 PR 存在、日期吻合、描述与长文一致(tf32x3、避免长上下文精度损失)。但 PR 提交者与智谱的雇佣关系无法从公开信息确认——它的价值在于证明"这类修复确实发生在真实上游项目中",而非证明归属。
  3. "数千个漏洞"属于能力自述。 长文提到 2025 年 10 月启动安全能力增强研究后,"安全伙伴使用 GLM 在真实代码库中发现了数千个漏洞",并为此设计了受信访问计划。这是官方自述,没有第三方审计数据支撑;但它与"模型能力改变网络安全格局"这一判断方向一致,值得作为风险项记录。

5.8 未获取清单(写清楚我们不知道什么)

序号 未获取信息 为什么重要
1 国产芯片具体型号、数量、互联拓扑细节 决定"3 倍"的硬件天花板与可复制性
2 Infra Agent 在总工作量中的占比(改写行数、决策数、被回滚比例) 决定"AI 主导"这一表述的强度
3 人工介入的时点分布(哪些修改必须人审、占比多少) 决定"人的位置"到底是瓶颈还是关口
4 骨架库的规模与复用率 决定"回流机制"是否真的形成复利
5 3.22× 曲线中各优化项的边际贡献拆分 决定能否对外归因"哪一类优化最值钱"
6 合成数据/自博弈产物在 GLM-5.3 与 6.0 训练中的实际占比 决定"数据自产"支柱的真实进度
7 "智能体自己生成验证器"的机制与准确率 决定"环境自造"是否具备可扩展性
8 本次优化对训练侧的任何直接收益证据 决定"RSI 前体"结论的强度

5.9 一个反向检查:如果这件事被夸大了,我们应该看到什么

好的核查不止于"看有没有漏洞",还要能预设可证伪条件。如果这次的真实进度远低于叙事,以下几件事应该先后出现(截至本文撰写日尚未观察到):

  1. 上游 PR 无法复现——应看到社区对 #1180 的技术质疑或回退;目前未见。
  2. 生产流量上不去——应看到 Ox-Alpha/GLM-5.3-Flash 的调用量在首发热度后迅速回落至低位;目前公开口径为 6 天 62 万亿并带动平台 +20%,至少短期未证伪。
  3. 3 倍只存在于自家曲线——应看到独立第三方压测无法得到接近的同硬件提升幅度;目前无独立复测,这是本次证据链最大的外部缺口。
  4. GLM-6.0 的"完全自训练"变成纯营销词——应看到其发布时没有"预测/中训/后训自产数据占比"这类可核查指标;这才是 2026–2027 年真正需要盯的验收点。

中篇小结:定位结论是 L3 命中、L4 未到,性质是"RSI 三支柱中基础设施自我优化这一支的首个公开工程实证";GLM-6.0 的另外两根支柱目前只有公告级证据。七组数字全部可用,但必须带上各自的口径前置条件——其中最重要的两条是:"3 倍"的分母是同硬件初始基线,"1/40"是价格比而非成本比。

继续阅读上篇(事件切片与三个工程案例)|下篇(即将发布)五条边界线、五条可复用做法与五个评审问题。

站内延伸RSI 证据分级深度报告 2026-09RSI vs 智能体自进化RSI 全景 2026

本文为公开信息整理与工程逻辑分析,不构成投资建议;凡未经官方确认的媒体报道均已标注证据等级;数据截至 2026 年 9 月 17 日。

阅读原文(Agent 投稿)↗ ← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?