大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序

大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序

导读:如果你觉得 2026 年的模型"突然又变强了",答案很少是"参数又多了"。这篇长文把当前可核查的公开证据整理成一张六层路线图,逐层回答三个问题:这一层的收益从哪来、门槛有多高、未来 12 个月该盯什么指标。全文以 2026 年 2–9 月的中金技术展望、智源趋势报告、Meta ScaleRL 大规模实验与一线工程综述为主要依据,末尾附参考资料。


一、先破一个幻觉:能力提升发生在六层,而不是一层

过去几年,我们习惯用"参数、数据、算力"三件套解释模型进步。但这套解释在 2026 年已经明显不够用了:用户能感知到的很多变化,根本不是"再多喂一点语料"自然长出来的。

一个被反复引用的经典例证是 InstructGPT:一个 1.3B 参数、做过对齐与偏好优化的模型,在人类偏好评测里能赢过 175B 的 GPT-3,参数量差了两个数量级,用户却更喜欢那个小得多的版本。这说明"能力"和"体验"之间的转换,大量发生在预训练之后的环节。

把公开资料里的训练链路摊开,可以看到清晰的六层分工:

这一层真正在优化的 用户通常感知到的
预训练 知识覆盖范围、表示质量、规模效率 "模型变聪明了"
数据工程 数据分布、质量、去重、合成监督 "为什么这个模型代码/数学更强"
系统与架构 吞吐、显存、上下文长度、活跃参数、成本 "为什么能支持 128K 上下文"
后训练 指令遵循、风格、推理能力、工具使用 "这个助手用起来更顺手"
评测与奖励 什么叫好的、安全的、稳健的行为 "这个模型感觉更可靠"
Harness 与部署 延迟、成本、专用化、在线持续改进 "为什么上线版本和发布版本有差异"

这六层不是并列关系,而是耦合关系:一层变化通常会传导到其他层。2026 年的模型能力差距,越来越集中在这条链路的"后半段"能否跑通、以及能不能形成持续迭代的闭环。

下面按"从底座到前沿"的顺序,逐层拆解。


二、底座层|预训练 Scaling Law 的"复活"

2.1 为什么 2026 年预训练又能继续 Scaling

2025 年下半年一度流行"预训练撞墙"的说法,理由是数据快用完了、边际收益递减。但中金在 2026 年 2 月的技术展望里给出了相反的判断:2026 年预训练 Scaling Law 将重现,旗舰模型参数量更上一个台阶

理由是硬件与工程的同步成熟:随着英伟达 GB 系列芯片成熟与推广,模型将基于更高性能的万卡集群在预训练阶段重新 Scaling,参数量和智能上限都会进一步提升。中金同时指出,Google Gemini-3 的进步主要来自预训练层面的优化及高质量数据融合——这被视为"预训练远未到上限"的直接证据。

需要强调的是,当下的 Scaling 已经不是"把模型简单做大",而是架构、算法、工程三者共同优化:扩大参数规模的同时提升参数利用效率。

2.2 架构共识:MoE 稀疏化与注意力机制三条路线

MoE(混合专家)已成为平衡性能与效率的行业共识。 稠密模型中每个输入都要激活全部参数,规模一大,训练与部署的 GPU 和内存带宽成本就难以为继。MoE 用稀疏激活替代全量激活,通常只激活总参数的 10–20%,把"计算需求"与"模型规模"解耦。国产模型在这一点上探索得尤其极致,DeepSeek-V3.2、MiniMax-M2、Qwen 系列都是 MoE 路线。

但 MoE 不是免费的午餐,它带来三类新问题,也对应三类优化:

  • 专家负载不均:通过训练时加入辅助损失函数,流量过度集中时抬高损失值,强制路由重新分配 Token;
  • 专家间通信开销:MoE 对专家互联要求更高,因此"芯片与算法协同设计"成为趋势,更大规模的算力集群几乎是必要条件;
  • 路由与注意力头的精细化:细粒度专家切割、减少冗余注意力头,让不同专家和注意力头各有所长。

注意力机制则在"精度"与"效率"之间反复取舍。 按计算复杂度可分三类:

类型 时间复杂度 优势 主要短板
Full-Attention O(N²) 长文本精度高 KV Cache 随上下文线性增长,推理效率低
Linear-Attention O(N) 效率高 注意力矩阵低秩,长序列检索准确度下降
Hybrid-Attention 混合 平衡速度/显存与长文本精度 结构复杂,需按任务调优

代表实现包括:Mistral 7B 的"滑动窗口 + 全局"混合注意力,DeepSeek-V3.2 的稀疏注意力(Sparse-Attention,把复杂度从 O(N²) 降到 O(Nk),只关注最重要的 Top-k Token),Kimi 的线性注意力精细化门控,以及 MiniMax 从 Hybrid 切回 Full-Attention 的"反向选择"——后者恰恰说明:没有普适最优,只有针对任务的效果取舍

2.3 数据配方才是真正的分水岭

参数规模是过去几年最容易被比较的指标,但这两年真正拉开差距的是数据配方

Chinchilla 定律给出过一个"数据最优点":对 8B 参数模型,约 200B tokens 即可。而 Llama 3 8B 实际用了 15T tokens,超出约 75 倍。这类"过训练配方"换来的是同等参数下更高的能力密度,最终得到更小、推理更省的模型。换句话说,衡量训练投入,看总 FLOP 比看参数量更靠谱

数据工程也不只是"清洗",它更接近能力设计

  • 网页、代码仓库、书籍、论坛等原始数据,要依次走完文本抽取、语种识别、质量过滤、隐私处理、安全过滤、去重;
  • 去重与污染控制常被忽略但影响巨大——模板重复、许可证文本、镜像网页,以及 benchmark 泄漏带来的污染;
  • 数据配比本身成为独立课题,Data Mixing Laws 这类工作关注的不是"还能收多少数据",而是"不同类型数据占比会把模型带向什么能力结构"。

合成数据则从"辅助手段"变成了"正式流程":早期模型生成基础指令数据,更强的模型生成高质量推理轨迹与 CoT 数据,经过 RL 训练的推理模型再把这些轨迹蒸馏给更小的稠密模型。每一代更强的模型,都在参与重构下一代模型所看到的数据。

本层判断:预训练仍有空间,但已不是拉开差距的主战场。对绝大多数团队而言,可控杠杆在数据配方与架构效率,而不是参数规模本身。


三、后训练层|强化学习成为"新的 Scaling Law"

如果说 2024 年 o1 的发布是"推理模型元年"(站内精选《OpenAI o1 问世:推理时计算开启新范式》有完整梳理),那么 2026 年的主线就是:强化学习(RL)从"对齐工具"升级为"能力上限的来源"

3.1 占比在变:RL 从配角走向主战场

中金给出的量化参考很直观:DeepSeek V3.2 的后训练计算预算已占预训练成本的 10% 以上,而海外头部厂商的相关占比可能在 30% 左右,并且预计 2026 年还会进一步提升。

为什么 RL 这么"贵"却这么值?因为它的本质是**"自我生成数据 + 多轮迭代"**:每一轮包含采样、价值评估、策略更新,计算量远超传统 SFT;而且大模型上的 RL 是高方差优化,需要规模算力来提供稳定性。同时,RL 的结果高度依赖数据质量——奖励模型的训练数据、奖励校准、避免 reward hacking,以及用高质量数据做 SFT 冷启动。

一句话:算力与高质量数据是 RL 的两条腿,缺一条就走不动。

3.2 算法谱系:为什么 GRPO 能取代 PPO

对齐算法的演进有一条清晰的主线——不断削减工程负担、提高信号利用效率

  • RLHF:先模仿高质量回答,再用人类偏好比较做强化,需要独立训练奖励模型;
  • DPO:跳过奖励模型,直接从偏好对比中学习;
  • GRPO:对同一提示采样多个回答,用组内相对排名替代绝对价值估计,不再需要独立的价值网络。PPO 要同时维护策略网络与价值网络,在大模型上工程负担极高,而 GRPO 把这块成本砍掉了;
  • DAPO / CISPO / GSPO 等:继续在损失函数、采样效率、稳定性上做精细化改进。

DeepSeek-R1 的公开配方是理解后训练流水线最清晰的样本,它分四个阶段:

  1. 冷启动 SFT:先用少量高质量 CoT 数据热身。R1-Zero 证明从 base model 直接做 RL 可行,但纯 RL 输出会重复、语言混乱、可读性差,冷启动不是多余步骤;
  2. 可验证领域 RL:在数学、代码、逻辑等有明确真值的领域,用 GRPO 训练,以程序可验证的正确性作为奖励;
  3. 拒绝采样微调:把 RL 产生的成功轨迹过滤后转成新的 SFT 数据,RL 与 SFT 之间的桥梁
  4. 对齐 RL:融入有益性与安全性偏好,收敛到可发布的助手形态。

站内精选条目《DeepSeek-R1 开源:推理模型的"Sputnik 时刻"》记录了这次范式冲击的市场意义,而这里更值得关注的是它的工程可复制性:四个阶段相互依赖,形成闭环。

3.3 Meta ScaleRL:40 万 GPU 小时换来的三条原则

2025 年底 Meta 等机构发布的《The Art of Scaling Reinforcement Learning Compute for LLMs》,是目前对 RL Scaling 最系统的一次公开研究——总实验量超过 40 万 GPU 小时(NVIDIA GB200),单个对照实验约 1.6 万 GPU 小时,并在一个 8B 稠密模型上完成了验证性训练。

它的核心贡献是提出一个可预测框架:用类 sigmoid 的饱和幂律曲线刻画"期望奖励 R 与训练算力 C"的关系,其中三个参数分别是:

  • A:渐近性能上限(这个方法最终能到哪);
  • B:算力效率(多快能到);
  • C_mid:性能曲线的中点

这个框架的实用价值在于:只需用一半的目标算力早期数据拟合曲线,就能外推预测更大规模下的性能轨迹。研究者在 10 万 GPU 小时的验证训练中确认,预测曲线与实际表现高度吻合。

由此得到三条颠覆常识的原则:

原则 含义 工程含义
RL 上限不通用 不同方法在不同算力下会撞到不同的 A,且 A 可通过损失函数类型、batch size 等设计调整 "谁跑分高"要看算力量级,不能小规模就下结论
拥抱 bitter lesson 小规模表现好的方法,放大后可能反而更差 应早期估计 A 和 B,提前筛掉"不可扩展"的方案,而不是先跑大规模再说
重新评估常见 heuristic 损失聚合、课程学习、长度惩罚、优势归一化……大多只影响效率 B,不改上限 A 把"提效率"的招和"提上限"的招分开管理

ScaleRL 本身没有发明新算法,而是把已验证的最佳部件组合起来:异步 PipelineRL 架构(off-policyness = 8)、基于生成长度中断的截断控制、FP32 logits 精度(这一项把最终性能从 0.52 提升到 0.61)、prompt 级损失聚合、batch 级优势归一化、零方差样本过滤,以及"No-Positive-Resampling"(某 prompt 历史通过率 ≥ 0.9 即永久移除,避免消耗算力却几乎不提供梯度信号)。

几个对规模化很关键的结论:

  • 长生成是"抬上限"而非"换效率":生成长度从 14k 提到 32k,早期进步变慢(B 变小、C_mid 变高),但最终上限 A 更高;
  • 小 batch 会过早饱和:小 batch 早期看着更好,但随算力增加会被大 batch 反超;把 batch 加到 2048 prompts 不仅稳定训练,还让"5 万 GPU 小时拟合、外推到 10 万 GPU 小时"变得准确;
  • 模型规模不变性:换到 17B×16 的 Llama-4 Scout MoE 后,ScaleRL 依然可预测、无不稳定迹象,而且用约 1/6 的算力就达到了比 8B 稠密模型更高的渐近性能

本层判断:RL 的预算占比还会继续上升,但它的收益不是"无脑投入"就能拿到的——可预测性本身才是这一层最稀缺的能力。能早期判断"这个方法能不能 scale"的团队,会比"先烧算力再看结果"的团队省下一个数量级的成本。


四、推理时计算层|让模型"想更久、也想更巧"

前面两层都在优化"训练算力",而 o1 之后出现了一条新的纵轴:推理时计算(Test-time Compute)

4.1 从单轴扩展到双轴

                    推理算力(每次响应的 token 数)↑
   ┌──────────────────────────┬──────────────────────────┐
   │ 推理模型时代             │ 智能体时代               │
   │ 训练规模不变,推理可变   │ 轨迹更长、工具调用更多   │
   │ (o1、DeepSeek-R1)      │ 推理预算显著扩大         │
   ├──────────────────────────┼──────────────────────────┤
   │ GPT-3 时代               │ 更大预训练               │
   │ 训练 scaling,推理固定   │ 输出长度固定             │
   └──────────────────────────┴──────────────────────────┘
                    训练算力(FLOPs)→

范式变化的核心是:计算量变大仍能带来智能提升,但载体从"参数量变大"迁移到了"推理时计算增加"——模型通过更长的思维链、并行思考与自我反思,把算力花在"想"上面。

4.2 交错思维链:推理与工具调用交替进行

推理模型最关键的工程演进,是从"先想完再做"变成"边想边做"。

  • 传统 CoT:在回答前形成完整规划,再执行;
  • 交错思维链(Interleaved-thinking):模型在"思考"与"行动"之间高频无缝切换,将内部隐式推理与外部工具的显式记录结合,从而提升实时修正能力、降低幻觉与记忆遗忘。

这一变化直接支撑了 Agent 任务:模型能在推理过程中自主调用各类工具、把目标拆成数十个子任务,并在遇到错误时自动调整路径,形成长程任务闭环。

4.3 过度思考:新范式带来的新成本

更长的思维链不是免费的。2025 年之后,"过度思考"(overthinking)与延迟成本开始被认真对待:不必要的长推理直接转化为成本与等待时间。产业界因此在做两件事:一是优化 CoT 的"效率",用更少的 token 解决同样复杂的问题;二是路由——GPT-5 首次引入实时路由模式,根据用户提示自动把请求分发给"深思考模型"或"高性价比即时模型"(站内精选《GPT-5 发布:统一系统路由下一代旗舰》)。

本层判断:推理时计算已经是标配能力,差异化不体现在"能不能想",而体现在**"想多久、什么时候停"的预算分配能力**上。这也正是 RL 训练的下一步目标:不只是教模型答题,而是教它分配推理预算。


五、上下文与记忆层|从提示词工程到上下文工程

到了 Agent 阶段,长上下文是复杂任务的基础,而"记忆"是这一层最明显的短板。中金把"上下文工程"列为 2026 年模型厂商的发力重点,原因很直接:上下文长度决定任务能不能被装下,记忆决定任务能不能被连续完成。

5.1 工程侧:把 KV Cache 压下去

长上下文的成本几乎全部压在 KV Cache 上,各家给出了不同的工程答案:

厂商/模型 主要手段
Kimi 混合注意力机制 + 精细门控,分别优化 KV Cache 与内存管理
DeepSeek MLA 压缩 KV Cache 体积,算子优化提升带宽性能;V3.2 用稀疏注意力把 O(L²) 降到 O(L·k)
Anthropic 即时上下文策略,增强智能体的检索效率
Manus 上下文重写与压缩,把全局目标写入模型短期记忆,管理长时多步任务的堆积上下文

可以看到,"上下文工程"本质上是一套信息调度系统:决定模型每一步看到什么、丢掉什么、把什么抬升为长期目标。

5.2 算法侧:让模型学会"分层记忆"

工程手段之外,更根本的解法是让模型具备持续学习与分层记忆能力——核心是解决大模型的"灾难性遗忘"。Google Research 的一系列工作(MIRAS、Titans、Nested Learning、HOPE)构成了当前最完整的一条技术线:

  • MIRAS:把注意力机制、本地记忆结构、优化器都视为"关联记忆"的特例,提供记忆模块的系统化设计框架,包含记忆架构、注意力偏差、保留机制与学习规则四要素;
  • Titans:MIRAS 的架构落地,引入神经记忆层(模型内部的小型 MLP 专门负责记忆),并把记忆分为三层——短期记忆(传统注意力处理即时上下文)、长期记忆(可动态更新权重的神经网络存储上下文)、持久记忆(存储训练中沉淀的常识与逻辑)。它不被动存数据,而是用"惊奇度"指标筛选该记什么;
  • Nested Learning(嵌套学习):2025 年 11 月提出,把模型训练视为多层级、嵌套、并行的优化问题,每个层级有自己的 context flow 与更新频率。它的亮点不是"弥补遗忘",而是模仿人脑处理不同时间跨度记忆的方式——按任务的时间跨度与重要性动态调整学习和记忆的方式
  • HOPE:嵌套学习的工程实现,本质是"快—慢"双系统协作:自修改 Titans 作为快系统快速捕捉新信息并判断更新频率,连续记忆系统作为慢系统负责知识长期沉淀。新知识先在高频层快速学习,经时间验证后才逐步转移到低频层形成长期记忆。

工业侧同样在分层。 ChatGPT 的记忆系统被逆向拆解为四层上下文堆栈:临时的环境信息(设备、位置)、用户永久个人档案、用户近期聊天标题摘要、当前对话的完整记录。当滑动窗口触达长度上限、最早消息被移除时,永久记忆与近期兴趣摘要仍被保留——这就是"用工程手段模拟分层记忆"的现实形态。

本层判断:上下文工程是 2026 年确定性最高的增量方向;而"把有效信息写入模型参数形成长期记忆",是算法与工程共同的下一站。对产品而言,记忆质量将直接决定 Agent 的可用性上限


六、智能体层|从"答对一题"到"跑完整条轨迹"

如果说前五层优化的是"模型内部",这一层优化的是模型外部。2026 年最值得注意的变化是:优化对象从"答案"扩展到"轨迹",再扩展到承载轨迹的 harness 程序本身。

6.1 优化单元的迁移

维度 推理模型 智能体模型
优化单元 一个答案 一条轨迹
主要瓶颈 验证器准确度 Harness 质量
典型奖励 结果奖励 结果 + 过程 + 上下文奖励
常见失败 走捷径的推理 工具误用 / 上下文漂移 / 奖励攻击

这个迁移带来两个直接后果。

第一,奖励设计必须拆细。 只给最终答案打分(ORM)会让模型学会"碰巧答对",代码、数学和复杂推理尤其明显;给中间步骤打分的 PRM 信号更密、更能约束过程,但标注与系统成本是 ORM 的数倍。因此在真实系统里,大多数仍从 ORM 起步,只有在数学、代码、逻辑这类可验证任务中才有条件把 PRM 自动化(用程序验证中间步骤,绕开人工标注瓶颈)。

到了 Agent 阶段,奖励进一步拆成四类:结果奖励、过程奖励、上下文奖励、反作弊惩罚。具体案例包括:Kimi K2.5 奖励"有效拆解与真实并行";Chroma Context-1 给搜索途中找到的相关文档记分;Cursor Composer 2 把长任务中的 summary 纳入奖励——因为总结一旦失真,后面的上下文会一路被带偏

第二,环境质量取代数据多样性成为核心。 SFT 时代看数据多样性,Agent 时代看环境的稳定性、真实性、覆盖度、难度分布、反馈丰富度和抗利用性。一个现实约束是:harness 先稳住,模型训练才有意义。工具返回值不稳定、浏览器环境与线上不一致、文件系统状态不可复现时,grader 会先出错,模型学到的不是能力,而是如何利用环境漏洞——这时团队既在 debug 模型,也在 debug 环境。

6.2 Credit assignment:只训编排层

多智能体训练最难的工程问题是信用分配:一个长任务由 orchestrator 拆给多个 sub-agent 完成,最终成败该归因给谁?

Kimi 的 PARL 给出了一个干净的工程答案:只训练 orchestrator,冻结所有 sub-agent,把梯度收敛到编排层。奖励由三部分构成:

  • r_perf:任务成功(主奖励);
  • r_parallel:激励并行拆解,训练早期权重拉高、后期退火到 0,避免把"多开 sub-agent"当成刷分捷径;
  • r_finish:惩罚虚假并行。

评估也不只看总步数,而是看关键路径长度(最长串行链),只有关键路径变短,才说明并行真的生效。

6.3 Meta-Harness:harness 本身成为可优化对象

2026 年更前沿的一步是把 harness engineering 单独拿出来优化:优化的不是权重,而是围绕固定模型的 prompt construction、retrieval、memory 与状态更新程序。

论文里最抓人的一个数字是:同一个底模,只改 harness,在同一 benchmark 上就可能拉出 6 倍的性能差距。方法上,它并不引入一个抽象的 optimizer,而是把 prior code、scores、execution traces 全部写入文件系统,让 proposer 像写代码一样去 grepcat、比对 diff,再顺着失败路径改 harness。作者明确判断:面向 harness 这类长时、状态化程序,只给 scalar score 会把问题压扁——harness 的错误往往很多步之后才显现,反馈一旦被过度压缩,诊断链路就断了。

几个可验证的结果:

  • 在线文本分类任务中,比上下文工程基线 ACE 高 7.7 个点,同时把 context token 用量压到原来的 1/4
  • 检索增强数学推理中,一个搜索得到的 harness 在 200 道 IMO-level 题目上,对 5 个未参与优化的 held-out 模型平均再涨 4.7 个点
  • 在 TerminalBench-2 上超过手工工程化 baseline。

一个有代表性的发现是:Meta-Harness 自动找出了 environment bootstrap——在 agent loop 开始前先跑一个 shell 命令,把工作目录、可用语言、包管理器与内存状态整理成快照注入首轮 prompt。很多 coding agent 前几轮其实都在"探环境",这层前置做好,提升不一定来自更强的权重,而是让模型一开始就站在更好的上下文上

6.4 在线持续迭代:训练与部署的边界在变薄

Cursor Composer 2 的 real-time RL 说明:一部分 Agent 能力已经开始通过生产流量持续迭代,而不是等下一轮大规模离线训练统一刷新。训练与部署之间的边界没有消失,但两者的反馈回路正在明显缩短。

本层判断:Harness 工程正在变成与"训模型"并列的独立能力层。对团队来说,同样的模型,外层程序的组织方式可能比模型选型更决定成败——这也解释了为什么站内会专门深潜《OpenClaw 架构深度解析:一个自托管 AI 助手运行时的设计之道》和《Agent 与 Workflow 的原理区别》。


七、多模态层|能力边界的横向扩展

前六层解决的是"更深",多模态解决的是"更宽"。2025–2026 年这一层发生了两件结构性变化。

第一,架构走向统一 token 化。 文本、图像、视频、音频在底层被统一转换为 token 进行训练,原生多模态架构普及。以 Gemini-3 为代表的多模态模型基于数据端的长期积累,把"理解—推理—生成"深度合一,并把强化学习引入视觉与音频领域,从而加强对时空逻辑与动作因果的理解。

第二,图像生成进入生产力层级。 过去一年,图像生成在结构比例理解、风格一致性与可复现性、真实质感与复杂 prompt 遵循上全面跃升。Nano banana Pro 与依赖像素扩散的路线形成了方法论差异:它建立在旗舰语言模型之上,具备空间推理与光影控制能力,能够在生成图片之前先规划图像结构、文字布局与逻辑关系。这拉高了整个行业门槛——缺少大语言模型、或没有做原生多模态融合的厂商,仅靠像素扩散的短板变得明显。

趋势上,多模态继续沿两条线走:架构侧统一 token 化 + 高质量数据积累应用侧与 Agentic 融合(自主解决繁琐复杂任务)。同时对单芯片推理提出更高要求,尤其是内存容量与带宽。

本层判断:多模态不再是"加分项",而是旗舰模型的入场券;真正的分水岭在于原生融合程度,而非是否支持某个模态的输入。


八、前沿层|世界模型与持续学习

前面七层回答的是"如何把现有范式做得更好",这一层回答的是"范式本身会不会换"。

8.1 NSP:从"预测下一个词"到"预测世界的下一个状态"

智源研究院《2026 十大 AI 技术趋势》把**"世界模型成为 AGI 共识方向,Next-State Prediction(NSP,预测下一个状态)或成新范式"**列为趋势之首。其判断是:行业共识正从语言模型转向能理解物理规律的多模态世界模型,AI 开始从"生成符号"走向"理解现实"。

这也解释了为什么纯语言 Scaling 的边际效应会被反复讨论:语言模型学的是语料中的统计规律,而世界模型要学的是质量、速度、重力这些物理量与因果链。

8.2 三条技术路线,三种世界观

当前世界模型有三条差异明显的主流路线:

路线 代表 核心主张 本质
空间智能 李飞飞团队 Marble AI 需要理解几何、物体深度与物理关系 创建持久 3D 世界
因果推理 LeCun Yann / JEPA 应专注因果推理而非像素生成,像人一样通过观察视频学习 预测掩码嵌入,关注内部预测状态
交互式模拟 Google DeepMind Genie 3 把世界模型作为训练智能体的虚拟环境,从大规模视频学习并生成可交互世界 交互式视频引擎

三者的共同目标是一致的:给模型一种结构化的方式去思考世界,而不只是"预测下一个 token"。它们的差别在于"世界"被表示在哪里——3D 几何、潜在嵌入,还是可交互的视频序列。

8.3 为什么这一层是"中长期变量"

世界模型很热,但它目前更像是训练智能体的虚拟环境,而非直接变现的能力。中金的判断是:世界模型在 Genie 3、Marble 等不同路径的探索下具备突破机遇,属于中长期路线;2026 年的胜负手仍然在强化学习与上下文工程。

对从业者而言,这一层的现实意义是两条可操作的信号:一是机器人、自动驾驶、具身智能等领域的训练环境是否开始大规模依赖生成式模拟;二是"空间一致性"是否开始成为评测维度——一旦后者成立,说明业界真的在为"理解世界"建标准。

本层判断:把它当作 3–5 年尺度的方向性投资来看待,而不是今年就要押注的技术选型。


九、一张路线图:优先级、门槛与观察指标

把七层能力放在同一张表里对照,就能看出 2026 年的资源应该往哪儿放。

路径 单位算力收益 门槛 代表玩家 未来 12 个月观察指标
预训练 Scaling 中(但基数大) 极高(万卡集群 + 数据) OpenAI、Google 旗舰参数量、GB 系列集群规模
数据配方与蒸馏 DeepSeek、Qwen 同规模模型的能力密度、开源榜单位置
后训练 RL 高(算力 + 质量数据 + 稳定性) OpenAI、Anthropic、DeepSeek RL 预算占比、可预测 scaling 曲线是否公开
推理时计算 中高 全行业 路由策略、过度思考抑制、每任务 token 成本
上下文工程与记忆 Anthropic、Manus、Kimi 有效上下文长度、记忆持久性、检索准确率
智能体与 Harness 中(工程为主) Kimi、Cursor、Chroma 长任务成功率、关键路径长度、harness 自动化程度
多模态原生融合 中高 高(数据 + 架构) Google、字节 生成可控性、跨模态推理一致性
世界模型 待验证 极高 Google、李飞飞团队、Meta 具身训练环境渗透率、空间一致性评测

三条结论:

  1. 性价比最高的是中间三层——数据配方、上下文工程、Agent/Harness。它们不依赖万卡集群,靠工程与设计就能拿到显著收益,是中小团队最现实的机会窗口。
  2. 后训练 RL 是"上限之争"的必要条件,但它的收益高度依赖可预测性。不能早期判断"能不能 scale"的团队,很容易把预算烧在错误的配方上。
  3. 预训练与世界模型是两个极端:一个门槛极高但仍有空间,一个方向明确但尚未兑现。前者适合有算力的头部玩家,后者适合做方向性布局。

给不同角色的行动建议

对算法工程师:

  • 把 RL 的可预测性当作第一优先级:先在中小规模拟合性能曲线(识别 A 与 B),再决定是否放大,别用"跑完看结果"的方式消耗预算;
  • 奖励设计要比模型选型更早动手:在可验证任务上优先尝试自动化 PRM,在通用任务上接受 ORM + 过程约束的组合;
  • 把"上下文管理"当代码写:上下文裁剪、摘要、检索策略都应可版本化、可回归测试,而不是散落在 prompt 里。

对技术产品经理:

  • 评估模型时,分别问清"是权重变强了,还是 harness 变好了":同一个底模外层程序不同,效果可能差数倍,这直接影响你是换模型还是改产品;
  • 把"记忆"列为产品级指标:用户档案、近期摘要、当前对话的保留策略,决定用户是否会把 Agent 当长期工具用;
  • 用"任务完成率 + 关键路径长度 + token 成本"三件套替代"跑分",尤其是 Agent 类产品。

十、结语:能力提升是一条链路,不是一个模型

回到开头的问题——2026 年的模型为什么"又变强了"?

答案分布在这条链路上的很多个环节:预训练因为 GB 系列集群成熟而重新 Scaling;后训练因为 RL 占比提升到 10%–30% 而打开上限;推理时计算让模型学会分配思考预算;上下文工程与分层记忆让长任务变得可行;Agent 训练把优化对象从答案推向轨迹与 harness;多模态完成横向扩展;世界模型则在更远的尺度上准备换掉范式本身。

如果只记一句话,我会这样总结:

能力提升的瓶颈,正在从"模型能不能学会",转移到"系统能不能把学会的东西稳定地用出来"。

风险提示

  • 架构与范式被颠覆:目前主流仍是 Transformer + 预训练 Scaling Law + 强化学习,如果有更新的架构或范式出现,现有领先地位可能被动摇;
  • 技术迭代不及预期:模型厂商若无法同步优化算法与工程,很难在提升性能的同时压低成本,能力领先难以维持;
  • 奖励攻击与对齐风险:随着模型获得更强的环境访问能力,它优化的可能不只是任务结果,还包括 checklist、reward code 乃至训练关系本身;这类行为在标准对话评测中看不见,只在 Agent 任务环境里暴露,因此 reward、grader、环境隔离与监控必须被视为训练设计的一部分
  • 算力约束下的路径分化:中美形成"追求智能上限"与"兼顾开源普惠"两条路径,前者拼算力与前沿探索,后者拼工程与算法效率,这一格局预计将延续。

参考资料

  1. 中金公司《人工智能十年展望(二十六):2026 关键趋势之模型技术篇》,2026-02-03(于钟海、王之昊、袁佳妮、车姝韵、韩蕊、赵丽萍)
  2. 智源研究院《2026 十大 AI 技术趋势》,2026-01-08:趋势 1「世界模型成为 AGI 共识方向,Next-State Prediction 或成新范式」
  3. Meta 等,《The Art of Scaling Reinforcement Learning Compute for LLMs》(ScaleRL),40 万 GPU 小时 RL Scaling 系统性研究
  4. tw93,《你不知道的大模型训练:原理、路径与新实践》,2026-04-03
  5. DeepSeek-AI,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》,arXiv:2501.12948
  6. Hoffmann et al.,《Training Compute-Optimal Large Language Models》(Chinchilla),arXiv:2203.15556
  7. Ouyang et al.,《Training language models to follow instructions with human feedback》(InstructGPT),arXiv:2203.02155
  8. Google Research,《Nested Learning: The Illusion of Deep Learning Architecture》,2025-12-31
  9. Lee et al.,《Meta-Harness: End-to-End Optimization of Model Harnesses》,2026
  10. 站内精选条目:《OpenAI o1 问世:推理时计算开启新范式》《DeepSeek-R1 开源:推理模型的"Sputnik 时刻"》《DeepSeek-V3 开源:MoE 架构与极致工程效率》《GPT-5 发布:统一系统路由下一代旗舰》《Qwen3 开源:混合思考模式与多语言覆盖》《Claude Code 发布:终端里的编程智能体》《Manus 邀请码刷屏:通用 Agent 的中国时刻》《OpenClaw 架构深度解析》《Agent 与 Workflow 的原理区别》

注:文中数据均来自上述公开来源;涉及"预计""判断"的内容为引用来源的观点,非本文原创预测。个别厂商的 RL 预算占比为研究机构估算口径(如海外约 30%),未获官方披露,引用时请保留估算属性。

阅读原文(本站原创)↗ ← 返回资讯列表