什么是世界模型:从「生成视频」到「可交互的模拟器」

看 Sora 生成的视频,你会有一种错觉:模型「理解」了世界。但只要试着在画面里走两步,错觉就破灭了——它生成的不是世界,是世界的录像。录像不能被交互,不能回答「如果我往左走会看到什么」,而真正需要这个能力的,是智能体训练、机器人和自动驾驶。补上这块拼图的研究方向,叫世界模型(World Model)。这篇文章讲清楚它是什么、谁在做、和视频生成模型到底差在哪。

世界模型要解决什么问题

「世界模型」的想法并不新:给定当前状态和要采取的动作,预测环境的下一个状态——这本质上是让模型在内部维护一个可模拟的环境动力学。传统强化学习靠这个思路做基于模型的规划;到了深度学习时代,问题变成:用什么表示来承载这种预测能力?

Yann LeCun 给出了目前最有影响力的系统主张。他的答案叫 JEPA(联合嵌入预测架构):不要在像素空间做逐帧预测,而要在抽象的表示空间里预测「发生了什么」,让模型自己学会丢弃不可预测的细节。LeCun 长期公开批评大语言模型是「死胡同」,认为仅靠文本自回归到不了能理解物理世界的智能。2025 年 11 月,他离开效力十余年的 Meta 创业,新公司 AMI Labs(高级机器智能)直接把「世界模型」写进使命;据 TechCrunch、WSJ 等多家媒体报道,2026 年 3 月公司完成约 10.3 亿美元种子轮,投前估值约 35 亿美元,被称为欧洲最大种子轮,贝索斯旗下基金参投。

无论是否认同「LLM 死胡同」的判断(这是 LeCun 的观点,而非共识),一个事实是:2026 年,「世界模型」已经从论文词汇变成了头部公司押注的产品方向。

三条代表性路线

DeepMind Genie 3:能玩的生成世界

Google DeepMind 在 2025 年 8 月 5 日发布的 Genie 3,是目前「可交互生成环境」最直观的演示。按官方博客的描述:输入一句文字提示,模型生成一个可以实时导航的世界,帧率 24fps、分辨率 720p;环境能在数分钟内保持基本一致——你走过的路回头还在,视觉记忆可回溯约一分钟前——而且一致性是涌现出来的,不依赖显式的 3D 表示(不同于 NeRF 或高斯溅射)。

更有意思的是「可提示的世界事件」(promptable world events):玩家可以用文本中途改变天气、凭空引入新物体或角色,扩大了智能体可学习的「如果……会怎样」场景空间。DeepMind 明确承认了局限:智能体自身可执行的动作空间仍受限、多智能体交互建模困难、真实地点无法以完美地理精度模拟、连续交互只支持几分钟而非数小时。目前它以 limited research preview 形式向少量学者与创作者开放。

NVIDIA Cosmos:给机器人和自动驾驶用的世界基础模型

如果说 Genie 3 面向「智能体去哪玩」,NVIDIA Cosmos 则面向「物理 AI 在哪训练」。按 NVIDIA 官方定义,Cosmos 是开放的物理 AI 世界基础模型平台,用于机器人和自动驾驶的合成数据生成与闭环仿真。2026 年发布的 Cosmos 3 被官方称为「omni-model」:一个模型打通文本、图像、视频、环境音与动作的生成与推理,推理优先于生成的设计带来官方所称的领先物理精度;架构采用 Mixture-of-Transformers,推理与生成模块各用一套 transformer。模型以 Linux 基金会的 OpenMDW1.1 许可证开放,配套 Curator(数据处理)、Evaluator(评分)、tokenizer 工具链,后训练脚本在 GitHub 开放。对机器人团队,它可以后训练到特定本体、环境与传感器布局,「运行物理上精确的闭环仿真」;对自动驾驶,它生成高保真传感器数据用于训练与验证。

World Labs:把「空间智能」做成产品

李飞飞的创业公司 World Labs 走第三条路:从「空间智能」出发,生成持久化、可交互的 3D 环境。2025 年 11 月 12 日发布的 Marble 是其首款商用世界模型,支持文本、图片、视频、空间草图四类输入;2026 年 4 月的 Marble 1.1 可以仅凭几张多视角照片或单张普通照片,数分钟重建高保真可交互 3D 场景。2026 年 9 月,AMD 宣布以约 82 亿美元收购 World Labs,李飞飞出任 AMD 执行副总裁兼首席科学家——这是「世界模型」方向迄今最大的一笔并购。

一张表看懂区别

维度 视频生成模型(Sora 2、可灵等) 世界模型(Genie 3、Cosmos 等)
输出 一段固定的录像 可交互、可导航的环境
交互性 无(观众只能播放/暂停) 实时接收动作输入并响应
一致性目标 单条视频内好看即可 探索离开再回来,世界还在
典型用途 内容创作、广告、短剧 智能体训练、机器人仿真、驾驶验证
成败标准 视觉质量、人类偏好 物理一致性、可预测性、闭环精度

两者的技术底座高度重叠——大量世界模型直接用视频生成架构做「下一帧预测器」,Genie 3 的一致性也是从视频模型演化出来的涌现能力。差别在目标函数:视频模型优化「这段画面像不像真的」,世界模型优化「这个世界在交互下是否稳定自洽」。前者卷到 4K HDR,后者卷到 24fps 实时与分钟级记忆,路线就此分岔。

展望

2026 年世界模型的竞赛格局可以概括为:DeepMind 用 Genie 系列探「通用交互环境」的上限,NVIDIA 用 Cosmos 做「物理 AI 基础设施」,LeCun 的 AMI Labs 和被 AMD 收入麾下的 World Labs 分别押注表示学习与空间智能。三条路线殊途同归的地方在于一个判断:下一代智能体需要的不只是语言,而是一个可以演练的世界。

对本站读者,值得跟踪的信号有三个:世界模型与视频模型何时在架构上真正合流;智能体训练环境何时从「研究预览」变成「生产工具」;以及物理一致性评测(而非视觉质量榜)何时成为新的 leaderboard。

相关阅读

参考资料

  1. Genie 3: A new frontier for world models — Google DeepMind
  2. NVIDIA Cosmos — The Open Physical AI Foundation Model
  3. AMI Labs Raises $1BN Seed Round to Build World Model — Futurum Group
  4. 主打空间智能!「AI教母」李飞飞发布首款商用世界模型 — 华尔街见闻
  5. 刚刚,Yann LeCun 官宣离职创业,瞄准高级机器智能 AMI — 新浪财经
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?