缺的不是模型,是数据
VLA 模型架构演进很快,但它吃的食物远远不够。大语言模型的预训练语料以万亿 token 计,而且互联网上有源源不断的免费文本;机器人操作没有任何等价物——不存在「网上随手可下载的一亿条抓取轨迹」。对 2023 年初至 2026 年中收录的 1228 篇 VLA 论文的综述分析(Label Studio 发布)显示,其中 150 到 200 篇以上在开篇就明确声明:性能被高质量轨迹数据卡住了。
数据瓶颈的本质是一笔账:语言数据的边际成本趋近于零,而真机演示数据每一条都要人花时间「喂」。一位操作员通过遥操作设备带着机器人走一遍任务,才能产出一条轨迹——不能并发、不能回放、不能下载。
三代数据集:规模的三次跃迁
| 数据集 | 发布时间 | 规模 | 采集方式 |
|---|---|---|---|
| Open X-Embodiment | 2023-10 | 22 种本体、100 万条以上轨迹、527 种技能 | 21 家机构既有数据汇总 |
| DROID | 2024 | 7.6 万条轨迹、约 350 小时、564 个场景 | 13 家机构、50 名操作员分布式采集 |
| AgiBot World | 2024-12 起 | Beta 版 100 万条轨迹、约 43.8TB | 100 台机器人、100 多个复刻场景 |
Open X-Embodiment(OXE) 是「把各家实验室的存量数据拼起来」的第一步。Google DeepMind 牵头、21 家机构参与,把 22 种机器人(从单臂到双臂再到四足)的数据统一格式开源;用它训练的 RT-1-X 在部分技能上比单一本体训练的模型平均成功率高约 50%(论文口径),证明了跨本体数据的正迁移。但它的问题是来源混杂、质量参差,且以各实验室的存量为主。
DROID 换了个思路:不是拼存量,而是按统一规格「新采」。斯坦福牵头在 13 家机构部署了标准化的 Franka 机械臂平台,50 名操作员分布式作业,产出 7.6 万条轨迹、564 个场景——每个场景的环境、光照、物品都不一样。它后来成为 OpenVLA、π0 等模型的预训练语料之一。DROID 的贡献在于示范了「标准化 + 众包」的采集组织学。
AgiBot World 则把采集变成了工业流程。智元机器人自建数据采集工厂,100 台同构型机器人(8 摄像头、6 自由度灵巧手)在 100 多个 1:1 复刻的真实场景里流水线式作业,2024 年 12 月开源 Alpha 版(9.2 万条),2025 年 3 月开源 Beta 版——1003672 条双手操作轨迹、约 43.8TB。媒体探访报道其采集基地总面积超过 4000 平方米、摆了 3000 多种真实物品。这是「遥操作数据工厂」的完整形态:把数据采集从实验室手工作坊变成有质检、有排班的产线。
成本账与三条出路
真机遥操作有多贵?一套标准的遥操作采集台(机械臂 + 相机 + 主从控制设备)造价通常在 2 万到 3 万美元量级(行业媒体估算口径),还没算场地和人力;一名熟练操作员一天产出的有效轨迹通常以百条计。清华大学团队发表在 ICLR 2025 的数据缩放律研究给出了一个更根本的结论:模型泛化能力对「环境与物体的多样性」呈幂律关系——同样的预算,多换场景、多换物体,比在同一个场景里多采几倍数据更划算。多样性比数量重要,这是数据采集的定价原则。
目前公认的三条补充路线:
- 人类视频。互联网上有海量的人手操作视频,便宜且多样,但人与机器人的形态差异(embodiment gap)需要中间转换。NVIDIA GR00T N1 的做法是折中的:只用约 88 小时遥操作数据微调视频生成模型,就能批量生成 827 小时的「神经轨迹」——把贵的数据放大 10 倍。
- 仿真合成。物理引擎里机器人的动作不要钱,域随机化能补多样性,代价是 Sim2Real 差距(本专题另有文章展开)。
- 部署期数据。让机器人在真实交付场景里边干活边积累数据。1X 的家用机器人 NEO 由远程操作员辅助完成家务,从数据视角看这也是一种「分布在世界各地的采集终端」——尽管其隐私问题争议很大。
展望
数据瓶颈的解法正在从「单点采集」走向「飞轮」:开源数据集打底(OXE、DROID、AgiBot World 都是 CC 类许可证开放),工厂式真机采集提质量,人类视频与合成数据补规模,部署反馈再回流。跨本体的数据格式标准化(如 LeRobot 格式)让这些来源可以混用。需要注意,混池并不总是好事——2026 年有研究(经 Label Studio 转述)指出异构数据集直接混合可能引发负迁移,怎么筛选比怎么堆量更重要。同一综述还转述了两个有意思的量化结论:一是数据筛选比想象中更有效——有研究用 5% 精挑的「核心集」就恢复了全量数据 85% 到 90% 的性能;二是多样性确实是第一泛化因子——只做光照、背景、干扰物多样化的采集,泛化效果最好,而完全同分布的数据在换环境后迁移能力接近于零。
对工程团队的启示:在启动一个机器人学习项目前,先做数据预算——算清楚「每个新场景要多少条轨迹、每个新物体要多少条轨迹」,再决定自建采集、外包工厂还是仿真合成。这个决策对最终效果的影响,通常大于模型选型本身。
相关阅读:Inside NVIDIA's IsaacTeleop:从手部追踪到机器人动作的图重定向引擎(遥操作采集的工程实现);对话一目科技:用视触觉传感器为机器人补上缺失的「手感」(数据模态的补充)。
本文时效性结论截至 2026-10-07;转述性数字均注明来源口径。
参考资料
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models(arXiv)
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset(arXiv)
- DROID 数据集项目仓库(GitHub)
- AgiBot World 项目仓库(GitHub / OpenDriveLab)
- Data Scaling Laws in Imitation Learning for Robotic Manipulation(arXiv,ICLR 2025)
- What 1228 Vision-Language-Action Papers Say About the Robot Data Problem(Label Studio)
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots(arXiv)
读者留言
COMMENTS 暂无还没有留言,来说第一句?