🤖 具身智能数据集与评测专题:机器人「数据从哪来、怎么评」

上一页讲了「开源整机与仓库怎么挑」,这一页回答更底层的问题:训练一个会干活的机器人策略,数据从哪来、各数据集怎么选、训练出来后用什么基准、用什么指标来评?
本页把 Open X-Embodiment、DROID、AgiBot World、宇树 G1-Dex1、BridgeData V2 等操作数据集逐个拆到「机构 / 规模 / 采集方式 / 传感器 / 任务 / 获取 / 局限」七项,
再对比遥操作、动捕、仿真、合成数据、互联网视频五种数据来源,并讲清 SIMPLER 等评测基准与成功率类指标。读完你能回答:「我该下载哪个数据集、怎么加载、怎么评它好不好」。
Open X-Embodiment DROID AgiBot World SIMPLER 评测 数据采集 π0 / openpi
🎯 本页学习目标
1. 能解释「数据饥渴」与具身智能 Scaling Law 的关系,并说清 VLA 训练里行为克隆(BC)潜动作预训练(latent action pretraining)两条数据路线的差异
2. 能按「机构 / 规模 / 采集方式 / 传感器 / 任务类型 / 获取方式 / 局限」七项,逐个讲清 OXE、DROID、AgiBot World、宇树 G1-Dex1、BridgeData V2、RoboMimic、RLBench 的核心事实与选型边界(在 05-03 数据集总览 基础上深入细节,不重复堆列表)
3. 能区分 AMASS / HumanML3D / CMU MoCap 三个「人体运动」数据源与 DM Control/SMPL 等「运动仿真」工具的用途与规模
4. 能说明 SIMPLER 等仿真统一评测的动机与局限,列举任务成功率、平均完成度、首次动作准确率、操作时长等常用指标,并知道 RLBench / Meta-World / Franka Kitchen / Isaac 各评测环境的定位
5. 能对比五种数据采集方式的成本与 sim2real 代价,说出数据清洗、动作标注、时间对齐、跨具身动作空间归一化的处理要点
6. 能正确理解数据版权(CC-BY-NC-SA 的「非商用」边界、数据与代码许可分开看),并用 openpi / LeRobot 加载 OXE 子集微调 π0 走通一条最小上手路径
建议用时:约 60 分钟(第 2 节逐个数据集对比是重点,可配合浏览器打开各官方页边读边查)

1 为什么数据是具身智能的命脉:数据饥渴与 Scaling Law

大语言模型(LLM)靠「互联网上现成的海量文本」吃到了 Scaling Law 的红利;但机器人没有这样现成的数据源——真实机器人的「观测→动作」配对数据必须靠人一台台遥操作采出来,又贵又慢。这就是具身智能的数据饥渴(data hunger):模型的规模可以无限堆,但喂给它的真机数据跟不上,性能就卡在数据上。近两年头部玩家(AgiBot World、宇树、Physical Intelligence 等)的竞争,本质上已经从「谁模型大」转向「谁手里有更大、更高质量的真机操作数据」。

1.1 数据与 Scaling Law:机器人也在「吃数据」

💡 一句话结论:具身智能的 Scaling Law 是「模型规模 × 数据规模 × 数据多样性」三者耦合,而数据是当前最紧的瓶颈。所以「选对、选够、选干净数据」比「调大模型」更优先。

1.2 VLA 对数据的两条路线:行为克隆 vs 潜动作预训练

维度行为克隆(Behavior Cloning, BC)潜动作预训练(Latent Action Pretraining)
核心思想把示范当成监督样本,直接学「观测 → 动作」的回归/分类映射先把连续动作压缩成潜动作(latent action),在更大规模数据上预训练,再对齐到真机动作
数据需求海量「观测-动作」配对真机遥操作数据,格式需统一可额外利用互联网视频等无动作标注数据,缓解数据饥渴
代表方法RT-1 / ACT / 扩散策略(Diffusion Policy)π0(流匹配 flow matching 在潜动作空间建模)、智元 GO-1(ViLLA 架构)
优点简单直接、小数据也能起步、可解释性强能吃到互联网级数据红利,泛化与长程任务更强
代价过拟合示范、分布外易崩、数据成本高训练复杂、需 VQ 潜动作码本与「预训练→微调」两阶段工程
⚠️ 别把它们对立:现在的主流做法是「潜动作预训练 + 真机微调」组合拳——先用视频/海量数据学「世界怎么运作、动作怎么表达」,再用少量真机示范对齐到具体机器人。你上手时可以先从纯 BC 理解全流程,再进阶到 π0/GO-1 的潜动作路线。

2 操作数据集逐个拆解:机构 / 规模 / 采集 / 传感器 / 任务 / 获取 / 局限

操作(manipulation)数据集是当前 VLA 训练的「主粮」。下面按「真实大规模 → 细分真实 → 仿真基准」的顺序逐个拆解,每个都落到七个字段,方便你对着官方页复核。规模与许可均以各官方 README/论文为准,不确定处已标注「约」。

① Open X-Embodiment(OXE)100 万+ 轨迹22 种形态数据许可逐库不同
机构:Google DeepMind 牵头,联合约 21 家高校与企业(Stanford、Berkeley、CMU、ETH 等)· 2023 年 10 月发布,论文 ICRA 2024
规模:100 万+ 轨迹片段、22 种机器人形态、60+ 个子数据集、527 种技能(统一为 RLDS 格式)。
采集方式:并非新采,而是汇聚各机构已有的遥操作 / 自主策略数据集,统一观测-动作字段后合并。
传感器:高度异构——以多相机 RGB(-D) + 关节状态 + 末端位姿/夹爪为主,各子库细节不同。
任务类型:抓取、放置、桌面操作、开门抽屉、灵巧操作等 527 种技能,覆盖「跨本体通用策略」训练。
获取方式:官方页 robotics-transformer-x.github.io →(经 Google Cloud Storage 下载,提供统一工具)。
局限:①形态异构导致「跨本体泛化」仍需训混合模型(如 RT-X);②各子库质量、相机视角、动作频率参差;③整体无统一单一许可证,商用须逐子库核对来源许可。
② DROID约 7.6 万轨迹Franka 双臂+移动底座开放研究用(以官方为准)
机构:Stanford / Google / UT Austin / UC Berkeley 等联合 · RSS 2024
规模:约 7.6 万条真实遥操作轨迹、564 个场景、86 个任务、约 350 小时(官方论文数据)。
采集方式:人类遥操作 Franka Panda 机械臂,整套装置可搬进真实家庭/办公室,故名「in-the-wild(野外)」。
传感器:2~3 个 RGB 摄像头(第三视角 + 腕部视角)、关节角度、夹爪开合。
任务类型:拧瓶盖、插 USB、叠毛巾、开关抽屉、整理物品等真实日常操作。
获取方式:官方页 droid-dataset.github.io →
局限:①语言指令标注相对较弱;②本体固定为 Franka,换本体需做动作空间适配;③场景以家庭/办公为主,工业类任务少。
③ AgiBot World100 万+ 轨迹多相机+触觉Beta: CC-BY-NC-SA 4.0
机构:智元(Agibot)联合 OpenDriveLab 等 · 2024 年 12 月开源
规模:100 万+ 轨迹、100+ 台机器人、100+ 场景、217+ 任务(官方口径)。
采集方式:真机遥操作,覆盖夹爪/灵巧手、单臂/双臂/移动等多种形态。
传感器:多相机 RGB(-D) + 指尖触觉 + 本体感受(关节/末端),多模态同步标注。
任务类型:家务、桌面操作、工具使用、收纳等偏长程、日常的任务。
获取方式:仓库 github.com/OpenDriveLab/AgiBot-World → · Hugging Face 的 AgiBotWorld-Beta(需同意条款)。
局限:Beta 版为 CC-BY-NC-SA 4.0(非商用),商用须单独授权;②数据量大、下载与预处理成本高;③后续合成平台 AgiBot World Colosseo / Genie Sim 的细节以官方发布为准。
④ 宇树 G1-Dex1 数据集(UnifoLM)规模以官方 HF 为准G1 灵巧手+相机以官方 HF 页为准
机构:宇树(Unitree)· 随 UnifoLM 项目发布
规模:官方在 Hugging Face 以集合形式发布,轨迹数量官方未在新闻稿统一公布,以数据集页为准。
采集方式:G1 人形机器人双臂灵巧手遥操作,配套 unitree_lerobot(unitree_il_lerobot)训练框架。
传感器:灵巧手关节 + 相机(G1 本体传感器)。
任务类型:叠毛巾、倒水、精细抓取等灵巧操作(如「fold towel」)。
获取方式:Hugging Face 组织页 UnifoLM_G1_Dex1_Dataset → · 训练框架 unitree_lerobot →
局限:①以 G1 本体为主,跨本体泛化需自行适配;②规模与协议公开度不如 OXE/AgiBot World 高,商用前须逐条核对。
⑤ BridgeData V2约 6 万轨迹WidowX 250 低成本臂CC-BY(约,以官方为准)
机构:UC Berkeley(RAIL)+ Toyota Research Institute · CoRL 2023
规模:约 6 万条轨迹(60,096)、24 个环境、13 种技能、73 个物体。
采集方式:遥操作 + 半自主脚本 + 演示,采用低成本 WidowX 250 机械臂。
传感器:第三方 RGB 相机(全身 + 腕部)、关节、夹爪。
任务类型:抓取、放置、推、扫、叠放等桌面操作。
获取方式:官方页 rail-berkeley.github.io/bridgedata →
局限:①单臂、桌面为主,场景相对受限;②本体为低成本舵机/小型臂,与灵巧手/移动操作有差距。
⑥ RoboMimic(仿真基准)5 任务 / 3 机器人仿真 RGB+关节代码开源(以仓库为准)
机构:Stanford / UT Austin 等 · NeurIPS 2022
规模:5 个任务(Lift / Can / Square / Transport / Tool Hang)、3 种机器人(Franka Panda / Sawyer / iiwa)、多种控制器,数千条人类遥操作 + 机器生成示教。
采集方式:基于 robosuite/MuJoCo 的仿真采集(遥操作接口 + 脚本策略)。
传感器:仿真 RGB 相机 + 关节/末端状态。
任务类型:抓取、装箱、搬运、穿线等高难度模仿学习基准任务。
获取方式:官方页 robomimic.github.io →(数据集+代码)。
局限:纯仿真,无真实物理噪声;适合做「方法对比」,不能替代真机泛化评测。
⑦ RLBench(仿真基准)100 个任务CoppeliaSim + Franka代码开源(以仓库为准)
机构:Imperial College London(Stephen James)· 2020(RA-L)
规模:100 个任务,基于 CoppeliaSim(原 V-REP),Franka Panda 机械臂,支持语言指令与多任务/少样本设置。
采集方式:仿真内 waypoint + 运动规划自动生成示教,可批量产生带语言标注的数据。
传感器:仿真相机(多视角)+ 关节状态。
任务类型:开抽屉、堆叠、插销、按按钮等 100 种桌面操作,是 RL/模仿学习多任务评测的常用基准。
获取方式:仓库 github.com/stepjam/RLBench →
局限:仿真;部分任务依赖运动规划求解,学习信号与真实感知存在差距。
💡 操作数据集选型速记:想做「跨本体通用 VLA」→ 先 OXE;想要「真实家庭/办公场景」→ DROID;想做「长程家务+灵巧」且能接受非商用 → AgiBot World;做「低成本桌面操作」→ BridgeData V2;纯「算法对比、无真机预算」→ RoboMimic / RLBench 起步。
数据集 轨迹规模(线性刻度) 模态与形态 Open X-Embodiment 100 万+ 22 形态 · 60+ 子集 · 527 技能 RGB(-D)+关节状态 AgiBot World 100 万+ 100+ 台真机 · 217+ 任务 RGB-D+触觉+本体感受 DROID 约 7.6 万 564 场景 · 86 任务 · 约 350 h RGB×2~3+关节+夹爪 BridgeData V2 约 6.0 万 24 环境 · 73 物体 · WidowX RGB+关节+夹爪 RoboMimic 数千条示教 5 任务 · 3 机器人 仿真 RGB+关节 RLBench 以任务数计:100 任务 CoppeliaSim+Franka 仿真相机+关节 真机遥操作 汇聚已有数据集 仿真基准 条形按轨迹数线性刻度;宇树 G1-Dex1 规模官方未统一公布,未入图;仿真基准不以轨迹规模计。
图 1:六大操作数据集规模与模态对比——条形为轨迹规模(线性刻度),颜色区分采集方式;OXE 靠「汇聚」做到百万级,AgiBot World 为真机新采同量级,DROID / BridgeData 是中小规模真机遥操作,仿真基准不以轨迹数计

3 运动 / 仿真数据集:人体运动与连续控制基准

除了「操作」,人形机器人的「动起来」还需要另一类数据——人体运动捕捉(motion capture)连续控制仿真基准。前者给人形提供运动先验与动作生成素材,后者用于评测强化学习算法本身。

3.1 人体运动捕捉:AMASS / HumanML3D / CMU MoCap

数据集机构 / 年份规模(约)用途获取
AMASSMPI·ICCV 2019合并 15+ 动捕库、300+ 受试者、1.1 万+ 动作序列、40+ 小时统一为 SMPL/SMPL-X 人体模型,运动生成、重定向、运动先验的「底座」amass.is.tue.mpg.de →(注册申请)
HumanML3D北大/港中文·CVPR 202214,616 段动作、44,970 条文本描述文本-动作配对,Text-to-Motion 生成训练与评测GitHub →(申请下载)
CMU MoCapCMU 图形实验室·长期维护约 2,600 段光学动捕试验(多受试者)最老牌的公开人体动捕库,行走/跑跳/舞蹈等运动数据源mocap.cs.cmu.edu →
⚠️ 用动捕数据前先问格式:AMASS/HumanML3D 给的是SMPL 人体参数(体型+姿态参数),而你的机器人是URDF 关节角——中间隔着一步「运动重定向(retargeting)」。先评估「SMPL → 自家关节」的映射成本,再决定是否投入。

3.2 连续控制仿真:DM Control 与 SMPL 相关

4 评测基准拆解:训练出来后怎么「评」

「模型训出来了」不等于「真的会干活」。具身智能评测的难点在于:真实世界评测又贵又慢、且各家各用一套机器人一套任务,结果不可比。于是社区发展出两条路:一是在仿真里尽量「统一 + 复现」真实评测,二是约定一套可移植的成功率类指标。

4.1 SIMPLER:在仿真里统一评测 VLA 策略

SIMPLER(Simulated Environments for Real-world Policy Evaluation,论文《Evaluating Real-World Robot Manipulation Policies in Simulation》,2024)由 Stanford 等提出,核心动机是:VLA 模型(如 RT-1 / RT-1-X / Octo / OpenVLA)在真实机器人上评测成本极高、难以复现。SIMPLER 的做法是——用真实机器人采集场景时同步重建到仿真,让策略在「和真机视觉高度一致的仿真环境」里跑,从而用成功率近似真实性能。它提供 Google Robot 与 WidowX+Bridge 两个主流本体 setup。

代码:github.com/simpler-env/SimplerEnv → · 论文 arXiv:2405.05941

4.2 RoboBench 类:统一「打榜」评测平台

在 SIMPLER 之后,社区出现了一批「把多个 VLA/机器人策略放到统一云端环境里跑同一批任务」的评测平台(可统称 RoboBench 类,以各平台官方口径为准),目标是像 LLM 的 Chatbot Arena 一样做横向「打榜」。这类平台的共同点:固定任务集 + 固定指标 + 自动跑批,试图解决「每家用自己任务、不可比」的老问题。

⚠️ 真实世界评测为什么难:硬件不可复现——换一台机器人、换一个相机角度,成功率就可能差 20 个点;②任务不可比——「捡起杯子」在不同桌面、不同杯子上难度天差地别;③数据泄露——训练数据若与评测场景重合,分数虚高;④统计口径——试几次算成功率、是否允许重试,都会改变结论。读任何评测报告,先问清这四点。

4.3 常用指标:从「成功率」到「首次动作准不准」

指标含义适用场景注意
任务成功率(success rate)完成任务的试验占比(可含 Top-k:允许 k 次尝试)几乎所有操作任务口径差异大:是否允许重试、单次还是多次
平均完成度(average completion / progress)按子步骤给分(如 0/0.25/0.5/1),取平均长程任务(家务、多步组装)能区分「差一点成功」与「完全没动」
首次动作准确率(first-action / action-chunk accuracy)预测动作块与示范动作的一致程度BC / 扩散策略的离线评测离线指标,与真实成功率不完全等价
操作时长 / 完成时间(time-to-completion)从开始到完成的耗时(或是否超时)效率敏感的抓取/装配常与成功率一起看,快而不稳也不行
成功率 @K / 平均轨迹长度多次尝试内成功率 / 平均用了多少步RL 与长程任务反映稳定性与样本效率

4.4 仿真器评测环境:RLBench / Meta-World / Franka Kitchen / Isaac

环境本体 / 引擎任务规模(约)定位
RLBenchFranka Panda / CoppeliaSim100 任务多任务、语言条件、few-shot 的 RL/模仿学习评测
Meta-WorldSawyer / MuJoCo50 任务多任务与元学习(meta-RL)标准基准
Franka KitchenFranka / MuJoCo(D4RL 内置)7 个厨房子任务目标条件、离线 RL/模仿学习的厨房多任务基准
Isaac(Sim / Lab / Gym)多本体 / 自建可无限扩展GPU 并行仿真 + RL 训练,自定义评测的主平台

5 数据采集方式对比:五条「造数据」的路

「数据从哪来」的答案不止「人肉遥操作」。五种方式在成本、质量、规模、sim2real 代价上各有取舍,实际项目常是组合使用。

采集方式代表优点缺点适合
遥操作(人肉采集)DROID、AgiBot World、宇树 G1-Dex1质量最高、物理真实贵、慢、难规模化核心真机数据、微调对齐
动捕映射(retargeting)AMASS、DeepMimic 类复用人体运动、自然度高需做「人→机」映射、易有接触/动力学 gap人形运动、灵巧手姿态
仿真生成RLBench、RoboMimic、Isaac便宜、可无限规模化、可标注有 sim2real gap、缺真实噪声RL 训练、方法对比、冷启动
世界模型合成Genie Sim、AgiBot World Colosseo低成本大规模、可编辑场景合成数据可能放大偏差、真实性存疑数据增广、长尾场景覆盖
互联网视频学习(潜动作)π0、GO-1 的预训练阶段数据量近乎无限、缓解饥渴无动作标注,需潜动作对齐、易学到偏见VLA 大规模预训练
💡 实务建议:主流团队基本是「遥操作采真机核心数据 + 仿真/合成数据增广 + 互联网视频预训练」三管齐下。个人学习阶段,先用仿真(RLBench/RoboMimic)和公开真机子集(OXE 小库)把管线跑通,再考虑自采。

6 数据质量与处理:数据不是「采完就能用」

公开数据集看着「开箱即用」,但真正训练前通常要过四道处理关。这也是「数据工程」在具身智能里越来越值钱的原因。

⚠️ 动作空间统一是「跨本体」的地基:如果 A 机器人的「抓」是关节角、B 是笛卡尔末端位姿、C 是灵巧手 12 自由度,直接混训几乎必崩。先用「末端位姿 delta + 夹爪开合」这类本体无关的表示做统一,再考虑更细的关节级对齐。

7 数据版权与合规:数据 ≠ 代码,许可分开看

数据集的「版权」比代码更容易被忽略,而踩坑代价更高。核心原则:数据许可和代码许可要分开看,且「开源数据集」不等于「免费商用」。

⚠️ 给「想商用」的你一句话:下载任何数据集前,先看它「数据」的 LICENSE(不是仓库顶层代码 LICENSE);带 NC 的一律不能直接商用;不确定就问官方要书面授权,别赌。

8 学习路线:用 openpi / LeRobot 加载 OXE 子集微调 π0

知道「有哪些数据、怎么评」之后,一条最小可跑通的上手路径如下(目标:在自己电脑上完成「加载子集 → 微调 → 评测」闭环)。

1选一个小 OXE 子集
先别下百万级全集。用 LeRobot 内置的小数据集(如 pushtaloha 相关子集)跑通,理解 RLDS/HF 数据格式。
2搭环境
安装 Hugging Face lerobot 与 Physical Intelligence openpi;无 NVIDIA GPU 就先用小模型/CPU 预览,正式微调用云端 GPU(≥24GB 更稳)。
3加载 OXE 子集微调 π0
用 openpi 的 LoRA 微调接口,在选定子集上对 π0 做小规模微调;先跑通损失下降,再谈效果。
4评测
用 SIMPLER(SimplerEnv)或 LeRobot 自带的 rollout 脚本,输出任务成功率 / 平均完成度,和 baseline(微调前)对比。
✅ 里程碑建议:第 3 步结束,你应能「说清 OXE 子集的观测/动作字段长什么样、自己微调后成功率变化了多少」;第 4 步结束,你能「用统一指标对比两个策略」——这比单纯「跑通 demo」有价值得多。相关环境与显卡配置可回看 05-03 的下载与部署提示

+ 常见误区:五条「想当然」

⚠️ 误区一:「数据规模大 = 数据质量高」。
百万条低质量轨迹不如一万条高质量轨迹。遥操作真机数据的成功率、场景多样性、标注一致性,比总条数更能决定 VLA 下游表现;混入大量「失败未清洗」「任务分布单一」的数据反而拉低效果。看数据集先看采集协议与质检流程,再看规模。
⚠️ 误区二:「跨本体数据直接混训没问题」。
不同机器人的关节空间、自由度、末端控制频率差异巨大,直接把动作序列拼在一起混训,模型学不到统一的动作语义。正确做法是走统一的动作表示(如末端位姿/速度、动作 chunk)并做跨具身归一化对齐(见第 6 节),或至少按本体分库、共享视觉-语言主干。
⚠️ 误区三:「都是成功率 80%,分数可以直接比」。
成功率的口径太重要了:允许重试几次、成功率按「整任务」还是「子步骤」计、相机视角与摆放随机化程度、评测了几个 seed——口径不同源,80% 与 80% 不是一回事。横向对比前先核对统计口径,否则结论无意义。
⚠️ 误区四:「仓库顶层 LICENSE 就是数据的使用协议」。
代码与数据经常分开授权:仓库顶层可能是 MIT/Apache,但数据集本体另走 CC-BY-NC 之类的协议(如 AgiBot World Beta 数据为 CC-BY-NC-SA 4.0)。商用前要查的是数据文件随附的许可声明,不是 README 顶层的那个 LICENSE(详见第 7 节)。
⚠️ 误区五:「仿真评测高分 = 真机能跑」。
SIMPLER 这类仿真评测与真机成功率只是「相关」,不是「等价」:视觉纹理、物理噪声、执行器延迟都可能让仿真 90% 的策略真机只有 40%。仿真分数适合做快速迭代与筛选,最终结论必须回到真机 rollout,并报告评测硬件与流程。

+ 小结与思考

📌 本节小结:具身智能卡在「数据饥渴」——模型能吃 Scaling Law,但真机数据又贵又慢。VLA 有两条数据路线:行为克隆(直接模仿,吃海量真机示范)与潜动作预训练(π0/GO-1 先在大规模视频上预训练再对齐,缓解饥渴)。操作数据集按需选:跨本体通用→OXE(100 万+、22 形态、21 家机构),真实家庭场景→DROID(约 7.6 万轨迹),长程家务+灵巧但非商用→AgiBot World(CC-BY-NC-SA),低成本桌面→BridgeData V2,算法对比→RoboMimic/RLBench。运动数据看 AMASS/HumanML3D/CMU MoCap(注意 SMPL→URDF 的重定向)。评测用 SIMPLER 等仿真统一评测逼近真机,指标看成功率/完成度/首次动作准确率/操作时长。五种采集方式各有取舍,数据还要过清洗/标注/对齐/跨具身归一化四关,商用前务必核对数据许可证。
🤔 思考题: 1. 你想做一个「捡起杯子放桌上」的策略,预算有限、只有 CPU。你会选 OXE 全集、BridgeData V2 还是 RoboMimic?为什么?评估一下各自的 sim2real 代价。
2. 公司要做「叠衣服」的商业化机器人,你看到 AgiBot World 有大量相关数据——许可证层面你会遇到什么问题?有哪些合规路径(如换数据集、自采、单独授权)?
3. 两个团队都报「任务成功率 80%」,但一个允许重试 3 次、一个只允许 1 次,还用了不同相机视角。为什么这个 80% 不能直接比?你会怎么设计一个可比的评测?

9 本节自测

1. 关于 Open X-Embodiment(OXE),下列说法正确的是?
💡 解析:OXE 是「汇聚」型数据集——把约 21 家机构已有的真实操作数据统一成 RLDS 格式(22 种形态、60+ 子库、100 万+ 轨迹、527 种技能),训出 RT-X。它不是新采单一形态数据,也无单一许可证,商用须逐子库核对。故选 C。
2. 关于 DROID 数据集的采集方式与规模,下列说法正确的是?
💡 解析:DROID 是「in-the-wild」真实操作数据集:人类遥操作 Franka 机械臂在真实家庭/办公室采集,官方论文约 7.6 万条轨迹、564 个场景、86 个任务。它不是仿真、也不是宇树采集。故选 B。
3. 关于智元 AgiBot World 数据集,下列说法正确的是?
💡 解析:AgiBot World 是 2024 年 12 月开源的百万级真机操作轨迹(100+ 机器人、100+ 场景、217+ 任务),覆盖夹爪/灵巧手、单臂/双臂,是智元 GO-1(Genie Operator 1)的训练基础;Beta 版为 CC-BY-NC-SA 4.0,禁止商业用途。B/C/D 均与事实不符。故选 A。
4. 关于 SIMPLER 评测基准,下列说法正确的是?
💡 解析:SIMPLER 把真实场景重建到仿真,让 RT-1/RT-1-X/Octo/OpenVLA 等 VLA 在统一环境里跑,论文证明其成功率与真机高度相关,但不能完全替代真机。它面向 VLA,不是纯离线指标。故选 D。
5. 关于「行为克隆(BC)」与「潜动作预训练(latent action pretraining)」,下列说法正确的是?
💡 解析:BC 是直接模仿示范动作,吃「观测-动作」配对真机数据;潜动作预训练(π0 的 flow matching、GO-1 的 ViLLA)先把动作映射到潜空间,从而能利用互联网视频等无动作标注数据预训练,但最终仍需真机数据对齐/微调。故选 B。
6. 关于数据集「商用边界」,下列说法正确的是?
💡 解析:数据集的「数据」许可常与仓库顶层「代码」许可不同(如 AgiBot World 代码开源、数据为 CC-BY-NC-SA)。CC-BY-NC 的 NC = 非商业,禁止商用;MIT/Apache-2.0 才是商用友好。故选 C。
7. 关于 AMASS / HumanML3D / CMU MoCap 三者,下列说法正确的是?
💡 解析:AMASS(MPI,ICCV 2019)合并 15+ 动捕库并统一为 SMPL/SMPL-X;HumanML3D(北大/港中文,CVPR 2022)给 14,616 段动作配 44,970 条文本;CMU MoCap 是老牌光学动捕库。三者都是人体运动数据,不是机器人操作数据。故选 A。
8. 关于五种数据采集方式,下列说法正确的是?
💡 解析:第 5 节表格——遥操作质量最高、物理真实,但贵、慢、难规模化;仿真便宜可规模化但存在 sim2real gap、缺真实噪声;互联网视频无动作标注,需潜动作对齐(不能直接 BC);动捕映射需做「人→机」retargeting。故选 A。
9. 关于数据质量与处理中的「跨具身归一化」,下列说法正确的是?
💡 解析:第 6 节——OXE 能训出 RT-X 的关键,是把 22 种形态归一化到一套动作字段:末端位姿用相对增量(delta)、关节角统一量纲、夹爪统一到 [0,1]。A 直接混训几乎必崩;C 错,归一化的核心正是动作空间;D 描述的是「时间对齐」缺失的后果,不是归一化。故选 B。
10. 关于评测中的「任务成功率」,下列哪种理解是正确的?
💡 解析:第 4.2/4.3 节——真实世界评测难在「统计口径」不可比(是否允许重试、试几次、相机视角、硬件都影响结果),所以 80% 不能直接横比,须先对齐口径;成功率恰恰是操作任务最常用指标;平均完成度是按子步骤打分,与成功率是两个不同指标。故选 B。
📌 本节要点速查:①数据饥渴下,VLA 两条路线——行为克隆(BC,吃海量真机示范)与潜动作预训练(π0/GO-1,可借互联网视频预训练再真机对齐);②操作数据集按需选:跨本体通用→OXE(100 万+、22 形态),真实家庭→DROID(约 7.6 万轨迹),长程家务+灵巧但非商用→AgiBot World(CC-BY-NC-SA),低成本桌面→BridgeData V2,纯算法对比→RoboMimic/RLBench;③运动数据 AMASS/HumanML3D/CMU MoCap 都是人体运动源,用前注意 SMPL→URDF 的「运动重定向」;④评测用 SIMPLER 等仿真统一评测逼近真机,指标看成功率/完成度/首次动作准确率/操作时长,比较前先对齐「重试次数、相机、硬件」等口径;⑤数据要过清洗/标注/时间对齐/跨具身归一化四关(末端位姿用 delta、夹爪统一到 [0,1]);⑥商用前务必核对数据许可证——NC = 非商业,不可直接商用。

10 参考来源

以下链接均经 web_search 核实为官方/稳定地址;各数据集规模、许可证以官方 README 与论文为准,文中不确定处已标注「约」。资料整理更新至 2026-08