🤖 视觉-语言-动作模型(VLA)与世界模型详解

从"动作 token"到"想象未来":深入拆解 RT-1 → RT-2 → OpenVLA → π0 → Helix/GR00T N1/GO-1/UnifoLM 的完整演进脉络,搞懂 VLA 与世界模型的分工、数据来源、评测方法与落地路线
VLA 世界模型 端到端 具身智能 π0 Helix
🎯 本页学习目标
1. 能说出传统「感知→规划→控制」分层范式与端到端 VLA 范式的本质区别,以及人形机器人为什么需要 VLA
2. 能逐个讲清 RT-1、RT-2、OpenVLA、π0 的输入输出、架构要点、数据规模、亮点与局限
3. 能对比 2025 年四大前沿方案:Figure Helix、NVIDIA GR00T N1、智元 GO-1(ViLLA)、宇树 UnifoLM
4. 能解释世界模型的定义、三种预测粒度,并列举 Genie、Cosmos、UniSim、Neural Motion Simulator 等代表工作
5. 能说清 VLA 与世界模型在分层架构中的分工,以及 Open X-Embodiment、DROID 等数据集的规模与用途
建议用时:约 60 分钟(比 04-05 的入门版深入一层,建议先读 04-05)

1 从传统范式到 VLA:一次"范式转移"

要理解 VLA,先要理解它取代了什么。传统机器人软件栈是模块化流水线:感知 → 状态估计(SLAM/滤波)→ 任务规划 → 运动规划 → 底层控制(PD/MPC/FOC 伺服)。每个模块独立设计、独立调优,通过显式接口传递信息。这套体系在工业机械臂、自动驾驶上运转了 40 年,可靠、可解释、可验证。但它有四个结构性痛点,在人形机器人身上被放大到极限:

但它有四个结构性痛点,在人形机器人身上被放大到极限:

VLA:把动作变成模型的"另一种语言"

VLA(Vision-Language-Action,视觉-语言-动作)模型的做法是:输入图像 + 语言指令,端到端输出机器人动作。核心思想一句话——既然 Transformer 能预测"下一个 token",为什么不能预测"下一步动作"?于是动作被 token 化(离散 bin)、被块化(action chunk)、被流匹配化(连续轨迹),像生成语言一样"生成"出来。VLA 与 VLM 的区别只在输出端:VLM 输出文字,VLA 输出动作。

维度传统分层范式端到端 VLA 范式
设计哲学 模块化,每层可解释、可单独验证 数据驱动,整体优化"图像+语言 → 动作"映射
模块接口 显式几何/语义接口,信息逐层损失 隐式表征,语义直接驱动动作
数据需求 每模块各要数据,标注成本高 需要海量"演示 + 指令"配对数据,但可复用互联网知识
泛化能力 依赖手工规则,长尾场景脆弱 借助预训练世界知识,对未见物体/场景有一定泛化
可解释性 强(每层都有明确输出) 弱(黑盒,动作来源难追溯)
安全与实时性 强(每层可加闸) 弱(大模型推理慢,必须分层兜底)
⚠️ 关键认知:端到端 VLA 没有取代低层控制。2025 年所有主流方案都是分层架构:VLA 在高处"选动作"(1~50Hz),RL/扩散策略在中层"生成轨迹"(50~200Hz),FOC 三环在底层"出扭矩"(1kHz)。VLA 革命的本质是把"语义决策层"换成了可学习的端到端模型,而不是把整个控制栈塞进一个网络。

为什么人形机器人尤其需要 VLA?

2 VLA 代表模型逐个详解

下面按时间线逐个拆解。每个模型从机构/年份、输入输出、网络架构、数据规模、亮点、局限六个维度展开,并配总览表收尾。可用下方按钮快速定位某一代际:

奠基期:动作 token 与语义涌现(Google)

RT-1 · Robotics Transformer(Google,2022)开山之作
机构/年份:Google Robotics,2022 年 12 月(arXiv:2212.06817)
输入 → 输出:机器人相机图像(顶部 + 腕部)+ 自然语言指令 → 7 维末端动作(位置/姿态/夹爪),每维离散为 8 个 bin 的"动作 token"序列
网络架构:EfficientNet 视觉编码 + FiLM 语言条件注入 + 8 层双向注意力 Transformer;动作以 token 形式自回归生成
训练数据规模:13 台机器人自采约 13 万条演示、700+ 任务(含"拿水杯""放香蕉"等桌面操作)
亮点:首次把"动作"当 token 交给 Transformer 生成,验证"机器人也吃大数据"的可扩展范式,奠定后续 VLA 的骨架
局限:动作仅 8 bin/维,分辨率粗糙;只在自家数据上训练,语义泛化弱
RT-2 · Vision-Language-Action(Google,2023)语义涌现
机构/年份:Google DeepMind,2023 年 7 月(arXiv:2307.15818)
输入 → 输出:机器人图像 + 指令(与大规模网络图文语料混合训练)→ 动作直接写成 VLM 词汇表里的文本 token(如 "1 128 91 242 …" 的数字串)
网络架构:把动作当成"额外语种"融入 VLM:基于 PaLI-X 55B / PaLM-E 12B 主干,机器人与网络数据联合微调(co-fine-tuning)
训练数据规模:RT-1 的机器人数据 + 网络级图文数据(WebLI 等)联合训练,把"世界知识"灌进动作预测
亮点:获得"语义涌现":未见物体泛化成功率约为 RT-1 的 5 倍;证明互联网图文数据是机器人学习的天量金矿
局限:动作精度受文本 token 分辨率限制;大模型推理慢(数百毫秒级);未开源完整权重,复现门槛高

开源基座:社区可复现的 7B 时代(2024)

OpenVLA(斯坦福 / UC Berkeley / Google / MIT,CoRL 2024)开源基座
机构/年份:Stanford + UC Berkeley + Google DeepMind + MIT,2024 年 6 月(arXiv:2406.09246,CoRL 2024)
输入 → 输出:单目/多目图像 + 语言指令 → 7 维离散动作,每维 256 个 bin
网络架构:Llama-2 7B 作为语言/动作主干 + SigLIP/DINOv2 双视觉编码器;两阶段训练(先对齐 VL 基座,再微调动作头)
训练数据规模:Open X-Embodiment 跨具身数据集(22 种机器人、527 技能、100 万+ 轨迹)中约 97 万条演示微调
亮点:完全开源(7B 权重 + 训练代码);真实机器人评测绝对成功率比 RT-2 提升约 16.5%(相对提升约 34%);成为社区 VLA 事实基座,大量后续工作(微调/蒸馏/端侧)都建立在它之上
局限:逐帧输出单步动作,缺乏高频控制与长时程记忆;推理需要 GPU,不适合机载端侧
π0 / pi0(Physical Intelligence,2024)连续动作
机构/年份:Physical Intelligence(美国,多位顶尖学者创立),2024 年 10 月(arXiv:2410.24164)
输入 → 输出:多相机图像 + 语言指令 + 本体状态 → 基于流匹配(flow matching)的连续动作块,50Hz 输出
网络架构:PaliGemma 3B VLM 主干 + "Action Expert"(流匹配 Transformer)双组件;两阶段训练(先预训练 VLM,再用机器人数据微调动作专家)
训练数据规模:7 种机器人(含 2 台人形)上采集的 1 万+ 小时真机数据
亮点:用流匹配输出连续动作,突破离散 token 的分辨率天花板;动作块支持双臂协同;代码与权重开源(openpi / LeRobot),2025 年随 π0.5 一起开放
局限:数据要求极高(1 万+ 小时真机);长时程任务仍需外层规划;对未见本体泛化有限

2025 前沿:人形全身 + 世界模型 + 端侧部署

Helix(Figure AI,2025)人形端侧
机构/年份:Figure AI,2025 年 2 月发布(Helix 2.0 于 2025 年 9 月)
输入 → 输出:机载 4 个 RGB 相机图像 + 语言指令 → 分层动作:System 2(约 7~9Hz 语义推理)+ System 1(200Hz 级速率控制);Helix 2.0 将速率控制提升到 500Hz
网络架构:双系统架构:System 2 是基于预训练 VLM 的语义规划器,输出高层意图;System 1 是高频视觉运动策略,把意图转成关节命令;两系统通过共享潜动作空间通信
训练数据规模:自采遥操作演示 + 互联网图文数据(未公开具体规模)
亮点:纯端侧推理(运行在机器人机载 GPU 上);两台人形机器人协作完成"从未见过"的物品整理;Helix 2.0 解锁洗碗机装碗、叠衣等长时程家务
局限:模型细节未开源;长时程任务仍以实验室演示为主
NVIDIA Isaac GR00T N1(2025)开源人形基座
机构/年份:NVIDIA,2025 年 3 月发布(arXiv:2503.14734)
输入 → 输出:视觉 + 语言 + 本体状态 → 双系统输出:System 2(VLM,约 10Hz 高层规划)+ System 1(扩散策略,约 120Hz 高频动作)
网络架构:System 2 基于开放权重的 VLM 微调,负责语言理解与任务分解;System 1 是扩散模型策略,生成高频关节动作;两个系统共享视觉编码器
训练数据规模:人类演示视频 + 跨机器人异构数据(DROID 等公开数据集 + 自采)
亮点:全球首个开源人形机器人基础模型;与 Isaac 仿真生态打通,构成"仿真→训练→部署"闭环
局限:双系统协同仍需针对本体调优;System 1 的扩散策略对高频扰动敏感
GO-1 · Genie Operator-1(智元机器人,2025)世界模型 VLA
机构/年份:智元机器人(稚晖君团队),2025 年 3 月发布,9 月开源
输入 → 输出:多目视觉 + 语言指令(世界模型对未来帧的预测作为辅助)→ 潜动作(latent action)序列,由动作专家(Action Expert)解码为具体动作
网络架构:ViLLA 架构 = VLM(理解)+ 世界模型(预测未来)+ 动作专家(执行);关键创新是 LAPA 潜动作预训练:先从海量无标注视频里学"潜在动作",再小样本微调到真实机器人
训练数据规模:AgiBot World 百万级真机轨迹(100+ 机器人)+ 海量无标注互联网视频
亮点:"看视频学动作"范式:用近乎零标注的视频预训练潜动作空间;少样本迁移到新任务/新本体;权重开源
局限:潜动作空间可解释性弱,难直接调试;动作专家仍需按本体适配;世界模型预测误差会传导到动作层
UnifoLM 系列(宇树科技,2025)物理常识
机构/年份:宇树科技(Unitree),2025 年 5 月发布 UnifoLM-VLA-0,9 月开源 WMA 世界模型与 G1-Dex1 数据集
输入 → 输出:UnifoLM-VLA-0:多模态视觉 + 语言 + 本体状态 → 高层操作动作;UnifoLM-WMA-0:状态 + 动作 → 未来状态推演(最多约 20 轮多步交互)
网络架构:"大脑 + 小脑"统一大模型家族:LLM-0(语言)、VLA-0(视觉-语言-动作)、WMA-0(世界模型);VLA 置信度低时切换 WMA 做长视距推演再决策
训练数据规模:真机操作数据 + 物理规律预训练;配套开源 G1-Dex1 灵巧手数据集
亮点:提出"给机器人注入物理常识";WMA 世界模型支持多步交互推演,辅助 VLA 在不确定场景下决策;数据集与模型全部开源
局限:世界模型多步推演误差随轮数累积;VLA-0 与 WMA-0 的级联策略仍在快速迭代中
📌 2025 年 VLA 四大趋势: 1) 人形全身化——从"单臂抓取"走向"全身协作"(Helix 全身协调、GR00T、UnifoLM);
2) 世界模型融合——VLA 不再是"图像→动作"黑箱,而是"理解 + 想象 + 执行"(GO-1、UnifoLM-WMA);
3) 端侧部署——推理跑在机器人机载 GPU 上,同时解决延迟与隐私(Helix);
4) 开源生态——openpi、GR00T N1、GO-1、UnifoLM 全部开源,社区复现与二次开发门槛大幅降低。

总览对比表

模型机构 / 年份动作输出方式数据规模一句话定位
RT-1Google / 20227-DoF 离散 token(8 bin/维)13 万条演示把动作变成 token 的开山之作
RT-2Google DeepMind / 2023动作写成 VLM 文本 token机器人数据 + 网络图文让世界知识涌入动作的语义涌现
OpenVLAStanford 等 / CoRL 20247-DoF 离散(256 bin/维)OXE 97 万条演示完全开源的社区事实基座
π0Physical Intelligence / 2024流匹配连续动作块(50Hz)1 万+ 小时真机连续动作 + 双臂的通用策略
HelixFigure AI / 2025System2(7~9Hz)+System1(200Hz)遥操作 + 互联网数据人形全身 + 纯端侧推理
GR00T N1NVIDIA / 2025VLM 规划(10Hz)+扩散动作(120Hz)异构机器人数据 + 人类视频首个开源人形基础模型
GO-1智元 / 2025潜动作(latent action)序列AgiBot World 百万级 + 互联网视频看视频学动作的 ViLLA 架构
UnifoLM宇树 / 2025VLA 高层动作 + WMA 世界模型推演真机数据 + 物理常识预训练大脑小脑统一、注入物理常识

3 世界模型专题:让机器人"预演未来"

定义:世界模型学的是"环境如何演化"

世界模型(World Model)是学习环境动态规律的模型:输入当前状态 + 动作,输出未来的状态。按输出粒度分三类:

它与文生视频(如 Sora)的本质区别是可控性:世界模型必须能接受"动作/干预"作为输入并据此 roll-out,而不是自由生成一段与输入动作无关的视频。一句话:视频生成是外壳,可交互 roll-out 才是世界模型的灵魂。

为什么世界模型对机器人重要?

代表工作逐个看

工作机构 / 时间输入 → 输出核心价值
Genie 系列(Genie / Genie 2 / Genie 3) Google DeepMind 2024 / 2024 / 2025 图像/文本 → 可交互世界;Genie 2 生成可交互 3D 世界;Genie 3 实现"文本/图像 → 实时 2D 交互世界" 证明"世界可以被生成";Genie 从 20 万小时无标注视频学起,是潜动作思想(与 GO-1 同源)的先驱
NVIDIA Cosmos NVIDIA 2025(CES 发布) 文本/视频 → 物理世界视频预测;平台含 Cosmos Predict / Transfer / Reason / Tokenizer 世界基础模型平台,用 2000 万小时视频预训练,为机器人生成合成训练数据并喂给 GR00T 等策略模型,是"数据引擎"的工业级实现
UniSim Waymo 2024 真实驾驶日志 → 可交互的神经闭环传感器仿真 在自动驾驶上验证"神经仿真替代物理仿真":从真实数据构建可交互场景,支持闭环训练与测试,是机器人世界模型的前车之鉴
GO-1 世界模型组件 智元机器人 2025 当前帧 + 动作 → 未来帧预测 用互联网视频预训练"常识物理",驱动少样本动作学习;是 ViLLA 架构里"想象"的那一半
Neural Motion Simulator Google(CVPR 2025) 状态 + 动作 → 下一步状态(隐空间) 在 4 种不同腿式机器人数据上训练世界模型,用"想象 roll-outs"跑强化学习并成功迁移真机——世界模型 + RL 可以替代物理仿真器训练运动策略
GWM(高斯世界模型) BIGAI 北京通用人工智能研究院(ICCV 2025) 高斯场景表示 → 操作未来状态 把世界模型做到"机器人操作"粒度,支持稠密 3D 表征下的操作预测

"数据引擎"与合成数据:世界模型的工业化出口

世界模型最大的商业价值不在"预测未来"本身,而在于改写数据采集的成本结构:传统飞轮是"真机遥操作 → 训练",慢且贵;世界模型出现后变成:

1真实采样
少量真机/人类演示作为种子
2世界模型生成
Cosmos/Genie 从种子生成海量"如果这样动,世界会怎样"的合成视频
3策略训练
合成数据喂给 VLA/扩散策略(GR00T 即走此路)
4真机验证
策略部署回真机,新数据再回流世界模型,闭环滚动
💡 理解"数据引擎":世界模型 + 合成数据 = 一台"数据印钞机"。NVIDIA 把 Cosmos 定位成"Physical AI 的操作系统底座",宇树/智元把世界模型与自家真机数据绑定,本质都在抢占这条数据生产链——谁的数据引擎转得快,谁的模型就学得快。但合成数据只能覆盖"模型见过的物理规律",分布外场景仍需真机兜底。

4 VLA 与世界模型:分工与协作

一句话分工

🎯 VLA 管"现在做什么",世界模型管"预演未来"。VLA 回答"给定当前观察,下一步动作是什么"(决策器);世界模型回答"如果我这样做,世界会变成什么样"(预测器)。两者互补:没有世界模型,VLA 只能贪心逐拍决策;没有 VLA,世界模型只能想象却不能行动。

三种典型协作模式

模式一:世界模型当"想象训练场"(数据侧协作)
世界模型生成合成 roll-outs,扩充 VLA 的训练数据(GR00T + Cosmos、Neural Motion Simulator + RL)。这是目前最成熟、落地最广的模式。
模式二:世界模型当"计划验证器"(决策侧协作)
VLA 先提出候选动作序列,世界模型在想象中 roll-out 这些序列,比较结局后选最优(类似 AlphaGo 的蒙特卡洛树搜索,只不过"棋盘"是真实世界)。GO-1 的未来帧预测、UnifoLM-WMA 的多步推演都属于这一思路。
模式三:级联兜底(风险侧协作)
UnifoLM 的做法:当 VLA 置信度低(输出分布平坦,说明场景偏离训练分布)或任务要求长视距规划时,切换 WMA 世界模型做多步推演,给出更谨慎的决策——世界模型成了 VLA 的"安全气垫"。

放进分层架构:上层选目标、下层做执行

层级频率职责典型技术
语义决策(上层) 1~10Hz 理解指令、分解子任务、选技能 VLA、LLM/VLM(第 2 节)
想象推演(横跨层) 按需 预演未来、验证计划、合成数据 世界模型、MBRL(第 3 节)
技能策略(中层) 50~200Hz 生成关节轨迹、保持平衡 RL、扩散策略、MPC(04-04)
关节伺服(底层) 1kHz+ 电流→速度→位置三环闭环 FOC 三环(Hdrive)

这张表和 04-05 第 6 节、04-04 的分层完全一致——VLA 只负责"选对的事",世界模型负责"想清楚后果",RL/MPC 负责"把事做稳",FOC 负责"把力出准"。声称"单模型端到端接管一切"的方案,工程上都要回到这张表落地。

5 数据与训练:VLA 的"燃料"从哪来

遥操作采集:数据的第一来源

VLA 训练的根基是"图像 + 指令 + 动作"三元组,动作标签几乎只能来自人演示。主流方式:

⚠️ 现实约束:遥操作是"人肉数据工厂"——一条高质量演示约 30 秒到几分钟,熟练操作员一天也就采几十条。这也是为什么 2025 年各家疯狂开源数据集(宇树 G1-Dex1、智元 AgiBot World)并押注世界模型合成数据:因为真机数据根本不够用

大规模具身数据集

数据集规模特点 / 用途
Open X-Embodiment(2023,arXiv:2310.08864) 22 种机器人、527 技能、100 万+ 轨迹,60+ 数据集、34 家机构联合 跨具身(跨本体)学习的"ImageNet";OpenVLA、RT-X 都在其上训练,验证了异构数据统一训练可行
DROID(2024,RSS,arXiv:2403.12945) 76,000 条演示、350 小时,564 个场景、86 个任务 野外(in-the-wild)大规模操作数据,13 家机构、8 城市联合采集,强调场景多样性
AgiBot World(智元,2024 底开源) 百万级真机轨迹,100+ 机器人 全球最大的人形机器人操作数据集之一,支撑 GO-1 训练
G1-Dex1(宇树,2025) G1 灵巧手 + 双臂操作数据 灵巧手细分赛道开源数据集,配套 UnifoLM 系列
BridgeData V2 / ALOHA 数千~数万条演示 经典社区数据集,适合入门微调与算法复现

训练范式:从行为克隆到潜动作

① 行为克隆 / 模仿学习(最基础)
直接用"观察 → 动作"监督训练:动作可以是离散 token(RT-1/OpenVLA)、连续块(π0 的流匹配)、扩散生成(GR00T System 1)。简单有效,但受限于演示数据覆盖度。
② 微调 VL 基座(最主流)
RT-2 与 OpenVLA 证明:在通用 VLM(Llama、PaLM-E、PaliGemma)上叠加动作头并微调,可把互联网图文知识"借"给机器人。成本低、见效快,是社区默认起点。
③ 潜动作预训练 LAPA(2024 起的新范式)
先从无标注视频学"潜在动作"压缩表示,再小样本微调到真机——GO-1 的 ViLLA 即此路线。优点:能用近乎无限的视频数据;缺点:潜动作空间不可解释。
④ 两阶段 + RL 后训练(进阶)
π0 先预训练 VLM 再微调动作专家;更进阶方案在行为克隆后用强化学习在仿真/世界模型里"自我对弈"打磨策略(Neural Motion Simulator 就是给 RL 当"想象环境")。

6 评测与局限:别被演示视频骗了

评测基准:人形机器人的"考试"

四大现实瓶颈

🚧 瓶颈一:幻觉与"演技"。VLA 可能"看到"不存在的物体、编造不存在的动作理由(与 LLM 幻觉同源);更隐蔽的是演示过拟合——模型学会了"看起来在做"而不是"真的做到",长时程任务尤其明显。

🚧 瓶颈二:分布外泛化有限。换光照、换场景、换物体颜色,成功率断崖式下跌是常态;RT-2 的"5 倍泛化"也仅对未见物体成立,离"家用机器人随便布置"还很远。

🚧 瓶颈三:实时性。大模型推理 100ms~1s,而控制周期是 1kHz 量级;端侧算力(Helix 方案)正在缓解,但大模型上机载 GPU 仍是稀缺资源。

🚧 瓶颈四:评测不一致与安全缺位。各家自报成功率口径不一,横向不可比;VLA 输出缺少形式化安全保证,必须依赖分层兜底(扭矩限幅、急停、世界模型预检)。

7 入门路线:从"跑通 demo"到"仿真接策略"

不追求从零训一个大模型——那是顶级实验室的预算游戏。对学习者最务实的路径是先用开源权重跑通,再在仿真里接策略:

1准备环境
装好 Python + CUDA,克隆 openpi(Physical Intelligence)或 LeRobot(Hugging Face)仓库
2跑通推理 demo
加载 π0/π0.5 或 OpenVLA 开源权重,先用官方图片离线推理,再换自己的摄像头实时推理,观察输出动作流
3读懂数据格式
下载 Open X-Embodiment 或 DROID 的采样,搞清 observation 与 action 的张量结构——这是所有 VLA 的共同语言
4小规模微调
用 LeRobot 在公开数据集或自采的几十条演示上做 LoRA 微调,体验"数据质量 > 模型规模"
5仿真里接策略
回到 04-04 的 MuJoCo/Isaac:把微调后的策略装进仿真环境闭环评估,顺便试世界模型合成数据增强
6真机部署
按 04-07 的 sim2real 流程,走"VLA 选动作 + RL/MPC 执行 + FOC 伺服"的分层架构上线
💡 学习资源提示:openpi 官方仓库自带 π0/π0.5 推理与微调示例;LeRobot 把 π0.5 等模型做成"开箱即用"的 Python API;Open X-Embodiment 有官方数据浏览器。三个资源足够支撑第 1~4 步。

8 常见误区

🚫 误区一:"VLA 直接控制电机"
VLA 输出低频(1~50Hz)高层动作或意图,不是 1kHz 扭矩指令。直接让大模型接管电机,实时性、安全性都无法保证。正确做法永远是分层:大模型选动作,伺服层闭环执行,扭矩限幅与急停常驻。
🚫 误区二:"世界模型 = 视频生成器"
文生视频是"自由生成",世界模型必须"可交互、可接受动作输入、可 roll-out"。用生成视频的指标(画质/连贯性)评判世界模型是错位的——关键是预测在动作干预下是否因果正确
🚫 误区三:"数据越多越好"
机器人数据质量 > 数量:时间戳不同步、标定错误、本体不一致的脏数据对策略的伤害远大于文本模型。跨本体数据(OXE)有用,但必须做本体对齐;盲目堆数据只会让模型"学坏"。
🚫 误区四:"一个模型包打天下"
2025 年所有主流方案(Helix、GR00T、GO-1、UnifoLM)都是分层 + 多模型协作,没有"单模型端到端全权接管"的成功案例。VLA、世界模型、RL、MPC 各管一段,组合拳才是工程现实。

9 本节小结与思考题

📌 本节小结:VLA 是"图像 + 语言 → 动作"的端到端模型,演进脉络:RT-1 开创"动作 token"→ RT-2 借力网络图文获得语义涌现 → OpenVLA 开源化成为社区基座 → π0 用流匹配输出连续动作块 → 2025 年 Helix(端侧人形全身)、GR00T N1(开源人形基座)、GO-1(ViLLA + 潜动作)、UnifoLM(世界模型级联)各立山头。世界模型学"环境如何演化",分像素/潜空间/奖励三种粒度,代表工作有 Genie、Cosmos、UniSim、GO-1 组件与 Neural Motion Simulator,并催生了"世界模型 + 合成数据"的数据引擎。分工:VLA 管"现在做什么",世界模型管"预演未来",在分层架构中分别位于语义决策层与想象推演层,下层仍是 RL/MPC 与 FOC 伺服。数据来自遥操作与大规模开源数据集(OXE、DROID、AgiBot World、G1-Dex1),训练范式从行为克隆进化到潜动作预训练。
🤔 思考题: 1. 如果让你给一台 Hdrive 关节模组组装的机器人选"大脑",你会先上 OpenVLA 还是先搭一个世界模型?两者的投入产出分别在哪里?
2. RT-2 的"语义涌现"来自网络图文数据,但家庭场景的"物理常识"(杯子会碎、水会洒)图文里并没有完整记录——你认为世界模型能补上这块吗?为什么?
3. HumanoidBench 显示当前算法在全身任务上成功率很低,你觉得瓶颈在数据、模型还是评测本身?

10 本节自测

1. 关于传统「感知→规划→控制」分层范式与端到端 VLA 的区别,下列说法正确的是?
💡 解析:A 错,2025 年主流方案都是分层架构,VLA 只接管语义决策层;B 说反了,分层范式用显式接口,端到端 VLA 用隐式表征;D 错,分层范式的每个模块同样需要数据。C 正确。
2. π0(Physical Intelligence)在动作输出上的核心创新是?
💡 解析:A 是 RT-1 的做法;C 是扩散策略流派(GR00T System 1);D 荒谬,π0 依赖多相机图像。π0 论文(arXiv:2410.24164)用流匹配输出连续动作块,故 B 正确。
3. 下列关于"世界模型"的说法,错误的是?
💡 解析:世界模型与文生视频的本质区别是可交互性与可控性——必须接受动作输入并据此 roll-out,而非自由生成与动作无关的视频,故 A 错误;B、C、D 均正确。
4. 2025 年发布的方案中,主打"纯端侧推理 + 人形全身控制"双系统架构的是?
💡 解析:Helix 运行在机器人机载 GPU 上(纯端侧),System 2 以 7~9Hz 做语义规划、System 1 以 200Hz(2.0 为 500Hz)做速率控制,是全球首个端侧人形全身 VLA。OpenVLA/π0 需 GPU 服务器推理,UnifoLM-WMA-0 是宇树的世界模型,故 D 正确。
5. 关于 VLA 的训练数据与大规模具身数据集,下列说法正确的是?
💡 解析:B 错,DROID(第 5 节)有 76,000 条演示、350 小时;C 错,AgiBot World 是智元开源、支撑 GO-1 训练,宇树开源的是 G1-Dex1;D 错,第 5 节「现实约束」明确说熟练操作员一天也就采几十条。A 正确。
6. 针对「数据越多越好」这一常见误区,本页的正确观点是?
💡 解析:第 8 节误区三明确指出质量 > 数量,脏数据会「让模型学坏」;C 错,OXE 有用但必须做本体对齐;A、D 把数量当成唯一决定因素,均违背原文。B 正确。
7. 关于智元 GO-1 的 ViLLA 架构与 LAPA 潜动作预训练,下列说法正确的是?
💡 解析:A 错,GO-1 的 ViLLA 内含世界模型组件用于预测未来帧,且输出的是潜动作序列而非扭矩;C 错,LAPA 的关键正是「近乎零标注」的视频预训练;D 错,GO-1 属智元,UnifoLM 属宇树。B 正确(第 2 节 GO-1 与第 5 节训练范式③)。
📌 本节要点速查:①VLA = 「图像 + 语言 → 动作」的端到端模型,演进:RT-1(动作 token)→ RT-2(借网络图文获语义涌现,未见物体泛化约为 RT-1 的 5 倍)→ OpenVLA(开源 7B、256 bin)→ π0(流匹配连续动作块 50Hz)→ 2025 前沿 Helix / GR00T N1 / GO-1 / UnifoLM;②世界模型学「状态 + 动作 → 未来状态」,分像素 / 潜空间 / 奖励三种粒度,代表工作有 Genie、Cosmos、UniSim、Neural Motion Simulator;③分工:VLA 管「现在做什么」(1~50Hz),世界模型管「预演未来」,下层 RL / MPC(50~200Hz)与 FOC 伺服(1kHz+)兜底执行,没有「单模型端到端接管一切」的成功案例;④数据来自遥操作 + OXE / DROID / AgiBot World / G1-Dex1 等开源数据集,训练范式从行为克隆进化到 LAPA 潜动作预训练,质量永远大于数量。

11 参考来源

以下链接均经公开渠道核实(VLA / 世界模型领域进展极快,资料整理更新至 2025 年,请以官方发布为准)。