VLA(视觉-语言-动作)模型进化史:机器人如何「看懂再动手」

为什么要 VLA

传统的机器人操作是一条「感知—规划—控制」的分模块流水线:视觉模块估计物体位姿,规划器生成轨迹,控制器跟踪执行。这套管线在结构化环境里很好用,但换个没见过的杯子、改一句指令,往往就得重新建模、重新编程。

大模型给出了另一条路的启发:语言模型把互联网尺度的文本知识压缩进了权重,视觉语言模型(VLM)又把图像接了进来。一个自然的想法是——能不能让机器人也共用这个底座,把「看」和「理解」交给 VLM,再让它直接输出动作?这就是 VLA(Vision-Language-Action,视觉-语言-动作)模型:输入图像与自然语言指令,端到端输出机器人动作。

演进脉络:三年三级跳

模型 时间 团队 参数规模 动作生成方式
RT-2 2023-07 Google DeepMind 12B / 55B 动作离散化为文本 token,自回归输出
RT-X / Open X-Embodiment 2023-10 21 家机构联合 — 跨本体数据共训的 RT-1-X / RT-2-X
OpenVLA 2024-06 斯坦福、伯克利等 7B 同 RT-2 路线,开源
π0 2024-10 Physical Intelligence 约 3.3B 流匹配(flow matching)生成连续动作块
Helix 2025-02 Figure AI System 2 为 7B VLM 双系统,System 1 输出高频连续控制
GR00T N1 2025-03 NVIDIA 2B 双系统:VLM 推理 + 扩散 Transformer 动作头
π0.5 2025-04 Physical Intelligence — 在 π0 基础上强化开放世界泛化

第一步:把动作当成语言。 2023 年 7 月,Google DeepMind 发布 RT-2:在一个网络规模预训练的 VLM(PaLI-X 与 PaLM-E 两个变体)上,把机器人动作表达成文本 token,与视觉问答等互联网任务一起微调,让模型「用说话的方式输出动作」。据 DeepMind 的博客口径,RT-2 在训练中未见过的新任务、新物体场景上,成功率比前代 RT-1 大约翻倍;用多个机器人本体的数据共同训练,还能让性能再提升约三倍。论文报告了超过 6000 次真机评估,模型甚至表现出「找块石头当锤子」这类初步的语义推理。

第二步:把底座做小、把数据池做大。 2023 年 10 月,Open X-Embodiment 合作项目把 21 家机构、22 种机器人的 100 万条以上真机轨迹汇成统一格式,训出的 RT-1-X 在部分技能上比各自本体单独训练的模型平均成功率高出约 50%(论文口径),验证了「机器人界的 ImageNet」可行性。2024 年 6 月开源的 OpenVLA 则证明了小模型也能打:7B 参数(Llama 2 底座,SigLIP 与 DINOv2 双视觉编码器),只用 97 万条真机演示训练,在 29 项真机评估上的平均绝对成功率反而比 55B 的 RT-2-X 高出 16.5 个百分点,参数却少了 7 倍;还能用 LoRA 在消费级 GPU 上微调、量化后部署。机器人领域的「开源 Llama 时刻」由此开始。

第三步:换掉动作头。 自回归 token 输出适合语言,但对高频灵巧控制并不友好。Physical Intelligence 的 π0(2024 年 10 月)干脆换了个动作头:以约 3B 的 PaliGemma 做视觉语言底座,加一个约 3 亿参数的动作专家,用流匹配——扩散模型的近亲——直接生成连续的动作块,一次预测未来 50 步,最高以 50Hz 频率控制机器人。π0 用自有的 1 万小时以上真机数据(覆盖 7 种机器人构型、68 项任务)加约一成开源数据预训练,能完成叠衣服、收拾餐桌、装纸箱等持续 5 到 20 分钟的长程任务。2025 年 4 月的 π0.5 进一步把「开放世界泛化」当卖点:官方演示中,机器人在训练时从未见过的家庭环境里完成了清洁、收纳等任务。

双系统:快慢脑分层

VLA 的另一条演进线是架构上的「双系统」:用大模型负责慢思考,用小模型负责快反应。

  • Figure 的 Helix(2025 年 2 月发布):System 2 是 7B 的 VLM,以约 7 到 9Hz 的频率理解语言与环境;System 1 是小型 visuomotor 策略,最高以 200Hz 输出连续控制,覆盖人形机器人上肢约 35 个自由度,包括手腕、躯干、头部和单根手指(官方宣称口径)。
  • NVIDIA 的 GR00T N1(2025 年 3 月 GTC 发布):2B 参数的开放模型,System 2 用 Eagle-2 VLM 做推理,System 1 用扩散 Transformer(DiT)生成动作块;训练数据按「网络与人类视频—合成数据—真机数据」金字塔组织,其中只用约 88 小时遥操作数据微调视频生成模型,就造出了 827 小时的合成轨迹。GR00T N1 在 Fourier GR-1 人形机器人上完成了语言条件双手操作,此后陆续迭代出 N1.5、N1.6 等版本(截至 2026-10-07,该系列仍在快速更新)。

路线分野与工程启示

回看这三年,有三点共识逐渐清晰。其一,底座统一用 VLM,互联网知识是泛化能力的来源,这一点开源闭源皆然。其二,动作头走向生成式:扩散、流匹配这类能表达「多峰」动作分布的模型,正在取代把动作当 token 逐个蹦的自回归路线——π0 论文明确指出,高频灵巧操作对自回归 VLA 是重大挑战。其三,快慢分层成为人形机器人上的主流架构。

对想上手做机器人的工程师,选型上大致是:要快速验证、数据少,可基于 OpenVLA 或 LeRobot 生态里的开源策略做 LoRA 微调;要做高频灵巧操作,动作头优先考虑流匹配或扩散路线;参数量不必贪大,7B 已被证明够用,2B 级模型配合好数据也能工作。真正的分水岭不在模型,而在数据——这也是下一篇要展开的话题。

相关阅读:扩散模型入门:从噪声里「雕刻」出图像(扩散/流匹配动作头的原理基础);刚刚,GPT-6 Astra 接上宇树 G1,把厨房收拾了!(VLA 与大模型结合的前沿动态)。

本文时效性结论截至 2026-10-07;文中性能数字均标注了来源口径(官方博客、论文或本文转述)。

参考资料

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(arXiv)
  2. Scaling up learning across many different robot types(Google DeepMind 博客)
  3. OpenVLA: An Open-Source Vision-Language-Action Model(arXiv)
  4. π0: A Vision-Language-Action Flow Model for General Robot Control(arXiv)
  5. π0: Our First Generalist Policy(Physical Intelligence 博客)
  6. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots(arXiv)
  7. Helix: A Vision-Language-Action Model for Generalist Humanoid Control(Figure AI)
  8. Open X-Embodiment: Robotic Learning Datasets and RT-X Models(arXiv)
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?