✋ 灵巧手专题:从"能抓"到"会玩"

夹爪与灵巧手差在哪?22 个自由度怎么驱动?触觉为什么必不可少?
本页用一张对比表 + 一组代表产品 + 一条从仿真到真手的路线,带你一次看清灵巧手的硬件、传感、控制与数据。
灵巧手 自由度 腱驱动 触觉传感 遥操作 数据采集
🎯 本页学习目标
1. 能说清"夹爪 vs 灵巧手"的适用场景,并解释自由度(单指 DOF / 整手 DOF)、欠驱动与全驱动的区别
2. 能对比腱驱动 / 直驱 / 连杆 / 混合四种驱动方案,各举一个代表产品,并从力、速度、重量、成本、可靠性五个维度说出取舍
3. 能说出触觉传感的三种形态(指尖触觉阵列、视触觉 / 电子皮肤、六维力传感器),并解释"为什么抓取需要触觉"
4. 能背出 7 个以上代表产品(Shadow / 特斯拉 / 宇树 / 智元 / 1X / 众擎 / 傅利叶)的自由度、驱动与触觉配置
5. 能画出"行为克隆 / 强化学习 / 主从遥操作 / 数据采集"的技术链路,并知道 DexGraspNet、GRAB、Open-TeleVision 各自解决什么问题
6. 能为自己规划一条"仿真抓取 → sim2real → 真手遥操作"的入门路线
建议用时:约 90 分钟(建议与 04-04 仿真与强化学习 页搭配阅读)

1 夹爪 vs 灵巧手:为什么人形机器人要灵巧手

人形机器人的末端执行器目前分两大阵营:夹爪(gripper)灵巧手(dexterous hand)。夹爪是"工业化答案":两个或三个指头、1~2 个自由度,负责在结构化产线上做 pick & place;灵巧手是"具身智能答案":五根手指、10~22 个自由度,目标是像人手一样在非结构化环境里抓杯子、拧瓶盖、拿工具。理解两者的差别,是理解"为什么大家都在卷灵巧手"的第一步。

1.1 夹爪:结构简单、皮实、便宜,但只会"捏"

1.2 灵巧手:类人构型,为"操作"而生

维度二指 / 三指夹爪五指灵巧手
自由度1~2 DOF6~22 DOF(单指 2~4 DOF)
抓取类型平行夹持 / 简单包络捏、握、勾、侧捏、在手操作
适用场景结构化产线、抓取形状规整的工件家庭、物流、服务等非结构化场景与工具操作
控制难度低(1 个命令)高(需要关节控制 + 触觉反馈 + 学习策略)
成本区间数百 ~ 数千元数千(消费级)~ 数十万元(研究级)
代表产品Robotiq / OnRobot / 大寰Shadow Hand / 特斯拉 Optimus / 宇树 Dex3-1 / 智元

1.3 自由度概念:单手指 DOF 与整手 DOF

自由度(DOF, Degree of Freedom)指机构能独立运动的轴数。对人手来说要分两层看:

1.4 欠驱动与全驱动:用几个电机的问题

方案原理优点缺点代表
欠驱动
(underactuated)
电机数 < 关节数,未驱动的关节靠弹簧 / 被动机构自适应贴合物体结构轻、成本低、鲁棒,包络抓取时"自动适应"物体形状(被动自适应)单指无法独立控制、难以做精细姿态多数消费级三指 / 五指手,如宇树 Dex3-1 的部分构型、低成本义肢手
全驱动
(fully actuated)
每个关节(或每个可控自由度)配一个驱动器单指独立可控、力控精度高、可执行精确姿态电机多 → 重量 / 体积 / 成本上升Shadow Hand(电动版)、智元全驱版灵巧手、Wonik Allegro
💡 判断口诀:"欠驱动省钱省重、适合包络抓取;全驱动贵而准、适合精细操作"。真实产品多为折中:近端关节全驱动、远端关节欠驱动耦合(DIP 跟 PIP 走),用最少的电机换最大的实用性。

2 驱动方式:腱驱动 / 直驱 / 连杆 / 混合

灵巧手的难点不在"放几个电机",而在电机怎么把力传到指尖。手指越靠近指尖越细,塞不下大电机,于是诞生了四种主流传动方案。下表是核心对比,五个关键维度(力 / 速度 / 重量 / 成本 / 可靠性)决定了每个方案适合的战场。

方案原理代表产品优点缺点
腱驱动
(tendon)
电机放在小臂 / 掌根,通过钢丝或高分子腱绳把拉力传到远端关节,可加弹性件实现柔顺 特斯拉 Optimus(小臂腱驱动)、1X NEO、Shadow Hand(气动肌肉 / 腱绳)、因时 RH56(腱+连杆) 手部本体最轻、远端关节可以做得很小、自由度布局灵活、外观类人;腱绳走"张力"天然有一定柔顺 摩擦与弹性损耗大、腱绳会松弛 / 磨损需定期张紧、控制带宽较低、装配维护复杂、成本中高
直驱
(direct drive)
电机(或小减速比"准直驱")直接装在每个关节上,掌内 / 指内分布 Wonik Allegro(16 DOF 研究手)、智元全驱版(12 驱动内置掌内)、兆威机电等供应链直驱方案 控制带宽高、力控精度好、可反向驱动(人掰得动)、动力学建模简单、可靠耐用 远端关节又重又粗、指尖力受电机尺寸限制、微型电机成本高、整体偏重
连杆
(linkage)
用四连杆 / 平行连杆机构把近端驱动器的运动传到远端关节 日本研究系连杆手(Kawada / 东京大学等)、部分工业灵巧手与仿人义肢 输出力大、重复精度高、无腱绳松弛问题、刚度好、寿命长 运动学设计复杂、关节布局受限、手型偏粗壮、手指长度灵活性差
混合
(hybrid)
不同关节用不同方案组合,如"腱绳 + 连杆"或"直驱 + 腱绳" 因时 RH56(腱+连杆)、腾讯 Robotics X 灵巧手(直线驱动器 + 腱绳)、部分国产新品 取长补短:关键关节用连杆保力、远端用腱绳保轻 结构最复杂、设计周期长、成本最高

2.1 五个维度的横向比较

维度腱驱动直驱连杆
指尖力中(受腱绳强度与摩擦限制)中低(微型电机力密度有限)高(杠杆放大,刚度大)
速度 / 带宽低(腱绳弹性与摩擦拖累响应)高(电机直连,响应快)中(机构惯量中等)
手部重量最轻(电机前置到小臂 / 掌根)最重(电机全在手上)
成本中高(精密腱轮 / 导管 / 张紧机构)高(需要大量微型高性能电机)中(精密连杆加工)
可靠性低(腱绳磨损、松弛是最大痛点)高(无传动损耗,皮实)高(无柔性件)
⚠️ 没有"绝对最优"方案:做研究力控、要带宽 → 直驱(Allegro、智元全驱);做消费级轻量化、要类人手感 → 腱驱动(特斯拉、1X、Shadow);做高负载工业抓取 → 连杆。选型先问三个问题:任务要多大指尖力?手要装在哪(小臂还是手腕)?预算和售后谁负责?

3 触觉与传感:没有触觉的抓取是"盲抓"

视觉告诉你"杯子在哪",触觉告诉你"手有没有捏住、会不会滑"。灵巧手的自由度越高,越需要接触级反馈——否则 22 个关节只是"会动的机械臂",不是"会摸的手"。触觉传感按覆盖范围分三个层次:

3.1 指尖触觉阵列:抓取的第一道触觉

3.2 视触觉传感器:用相机"看"接触面

3.3 电子皮肤:整只手都"有感觉"

3.4 六维力 / 力矩传感器:手腕上的"秤"

💡 为什么抓取必须要有触觉:
· 滑动检测(slip detection):光滑杯壁上的杯子,视觉看不出要滑,触觉在微滑动发生的几毫秒内就能察觉并加大握力;
· 力控制:捏鸡蛋、端豆腐需要"刚好捏住又不捏碎",只能靠指尖力反馈闭环;
· 接触状态估计:在遮挡、光照变化下,触觉是唯一可靠的"是否接触、接触哪里"的信息源;
· 在手操作:转笔、翻硬币这类动作,手指每毫秒都在重新分配接触点,纯开环位置控制必然失败。

4 代表产品盘点:从研究标杆到量产方向

下面按"研究标杆 → 产业旗舰 → 国产主力"的顺序盘点主流灵巧手。核心参数(自由度 / 驱动 / 触觉 / 开源)已用 web_search 核实,厂商资料可能持续更新,以官网为准。

产品厂商 / 国家自由度驱动方式触觉 / 传感开源 / 生态
Shadow HandShadow Robot / 英国24 DOF(含腕,手部本体约 20 关节)经典版气动肌肉(40 根),电动版(E2)约 20 电机指尖触觉(经典版内置上百个传感器)研究界"黄金标准",有 ROS 驱动与模型,DeepMind 等实验室标配
特斯拉 Optimus 手Tesla / 美国22 DOF(2024 年底版本;Gen2 早期为 11 DOF)腱驱动,致动器在小臂,手指细长指尖压力传感 / 电子皮肤(利永环球等供应链)不对外开源,但专利与演示视频公开,目标成本千美元级
宇树 Dex3-1宇树 Unitree / 中国12 DOF 力控(三指 / 多指构型,官方主打力控)直驱 + 力控,适配 H1 / G1 / H2指尖触觉可选,亦有带 RGB 相机的 Dex3-1DP 版消费级电商可购,官方 SDK / ROS2,价格远低于研究级
智元灵巧手家族智元 AgiBot / 中国12 DOF 全驱动版(2024,12 个驱动全内置掌内)全驱动 / 欠驱动多版本指尖触觉,可选视触觉 + 摄像头配合 AgiBot World 百万真机数据集开源,整机远征 / 灵犀搭载
1X NEO 手1X / 挪威约 20 DOF(媒体引用)腱驱动,致动器全部前置到小臂,手部极轻主打仿人手感与低重量NEO 整机 2025 年开放预购(约 2 万美元级),手部不单独开源
众擎 EngineAI 手众擎 / 中国12 DOF 级五指手腱绳 / 丝驱动为主指尖力觉随 SE01 / PM01 整机自研配套,强调整机手自研联动
傅利叶 GR-2 / GR-3 手傅利叶 Fourier / 中国手部 12 DOF(GR-2,整机 53 DOF)五指全驱动指尖触觉 / 力觉面向康复 + 通用操作,Humanoids 2024 展示

4.1 三个值得细看的产品细节

✋ Shadow Hand(研究界标准件):1980 年代研发至今,是全球被论文引用最多的灵巧手。DeepMind 用它完成"单手转魔方"(强化学习 + 域随机化,2019),证明了"仿真里训出来的策略可以控制真实灵巧手"——这也是"仿真 → sim2real"路线的标志性实验。缺点:贵(数十万元级)、维护难。
✋ 特斯拉 Optimus 手(量产风向标):2024 年 11 月演示"接住网球"的新手即 22 DOF 版本,2025 年 Gen3 宣称"全球最强人手"。它的设计逻辑是"小臂放电机、手指只留传动与传感"——腱驱动 + 指尖压力,再靠规模化压成本。业内普遍认为:Optimus 手把"灵巧手的量产路线"定调成了"腱驱动 + 电子皮肤 + 千美元级成本"。
✋ 宇树 Dex3-1 与智元家族(国产双雄):Dex3-1 是"力控 + 消费级定价"的代表,电商直接能买、SDK 齐全,适合个人开发者把玩;智元走"硬件 + 数据 + 开源"路线——灵巧手 12 驱动内置掌内,同时开源 AgiBot World 百万真机数据集,让"买手的人"和"训手的人"共用一套数据资产。
⚠️ 参数说明:上表为 2024~2025 年公开资料口径,厂商迭代很快(特斯拉 22 DOF、智元 12 驱动掌内等均为较新版本);动手前务必去官网 / 官方 GitHub 核对最新规格,并关注 术语词典 中的对应词条。

5 控制与遥操作:让灵巧手"学会"操作

手有了自由度与触觉,还差"怎么动"。灵巧手控制目前三条主线并行:行为克隆(BC)强化学习(RL)主从遥操作——而三条线都依赖同一个基础设施:数据

5.1 三条技术路线速览

路线做法优点缺点代表作
行为克隆遥操作采集人手演示 → 学"状态 → 动作"映射(ACT / Diffusion Policy)直观、数据门槛相对低、能学复杂长程任务受演示质量影响大、泛化性有限、需要大量多样数据ALOHA / Mobile ALOHA(斯坦福)、智元真机采集
强化学习在仿真里让策略自己"试错",用奖励函数训出灵巧动作,再 sim2real可探索人做不到的动作、抗扰动强、可批量并行奖励设计难、sim2real 差距大、真机试错成本高OpenAI Dactyl 转魔方、Isaac Lab 灵巧手环境
主从遥操作人手戴数据手套 / 操作主手,实时映射到灵巧手实时、可靠、是数据采集的"源头"需要操作员、带宽受限、无法脱离人Shadow Glove、诺亦腾 / Rokoko 动捕手套、Open-TeleVision

5.2 行为克隆:ALOHA 与扩散策略

行为克隆的核心是先采集、后学习:操作员用遥操作设备演示"拧瓶盖",机器人记录每帧的相机图像与关节指令,然后用 ACT(动作分块 Transformer)或扩散策略(Diffusion Policy)训练一个"看到什么就输出什么动作"的策略。灵巧手的动作空间比夹爪大一个量级,所以采集量也要大一个量级——这也是各大厂疯狂堆遥操作工位的原因。

5.3 强化学习:在仿真里"转魔方"

2019 年 OpenAI 用 Shadow Hand 在 MuJoCo 里用 RL 训出单手转魔方并迁移到真机,是灵巧手 RL 的里程碑。今天更常规的做法是:MuJoCo / Isaac Lab 建灵巧手环境 → 域随机化 + 奖励塑形训练 → 部署真机校准。灵巧手 RL 的典型任务:掌中旋转物体(物体在手里不掉)、指尖平衡杆、多指抓取抗扰动。注意:触觉在仿真里的建模(GelSight 类传感器有专门仿真插件)是 sim2real 成败的关键。

5.4 主从遥操作与数据手套

5.5 关键数据集与工具:数据从哪来

名称类型规模 / 内容用途
DexGraspNet(北大 EPIC)仿真抓取数据集约 132 万次抓取姿态 × 5000+ 物体(Shadow 手仿真)生成"手怎么放"的抓取姿态,喂给抓取规划 / 学习
DexGraspNet 2.0仿真抓取数据集扩展到杂乱桌面场景真实场景级灵巧抓取生成
GRAB(MPI,2020)人手-物体交互动捕10 人 × 51 物体 × 1334 段,基于 SMPL-X 手模型学习"人手怎么抓东西",训练手物交互生成与仿人手
Open-TeleVision(CoRL 2024)遥操作工具开源系统 + 演示数据VR 沉浸式遥操作,远程采集真机数据
AgiBot World(智元,2024-12 开源)真机操作数据集百万条级真机操作数据,覆盖 5 大场景百余种物体训练灵巧操作 / VLA 的"真机底座",号称规模比 Open X-Embodiment 高一个数量级
DEX-EE(Google DeepMind)灵巧末端 + 遥操作低成本灵巧末端,ALOHA 式采集帮 DeepMind 规模化采集灵巧操作数据
💡 一句话串起来:GRAB 告诉你"人手怎么抓"(仿人先验)→ DexGraspNet 告诉你"手怎么放"(抓取姿态)→ Open-TeleVision / AgiBot World 提供"真机动作数据"(行为克隆 / VLA 训练)→ RL 在仿真里补足"人类演示覆盖不到的刁钻动作"。

6 与整机结合:灵巧手 × VLA、数据闭环与量产

灵巧手不是孤立零件,它的价值取决于整机与算法栈。最近一年最大的变量是VLA(视觉-语言-动作模型)崛起——让"听懂指令"和"操作物体"第一次可以端到端训练。

6.1 灵巧手与 VLA:动作空间的"最后一公里"

6.2 数据闭环:从采集到回流的数据飞轮

1采集
遥操作工位 / 动捕手套 / 仿真生成,产生"图像 + 关节 + 触觉"轨迹
2训练
行为克隆 / RL / VLA 微调,产出可执行策略
3部署
装进整机真跑,收集失败案例与长尾场景
4回流
失败样本回到数据集,再采集 / 再训练,循环提速

智元开源 AgiBot World 的意义正在于此:把"采集 → 训练 → 部署 → 回流"的飞轮开源出来,让买灵巧手的人直接获得高质量起点,而非从零攒数据。

6.3 成本与量产趋势:从"实验室奢侈品"到"千元级部件"

⚠️ 冷静看"自由度军备竞赛":22 DOF 的手如果没有 22 DOF 的触觉、算力与数据支撑,实际表现可能不如"12 DOF + 好触觉 + 好策略"。判断一台整机的操作能力,要看自由度 × 触觉 × 数据 × 策略的乘积,而不是单一指标。

7 入门路线:先仿真里抓,再真手上练

灵巧手学习成本高,但有一条被验证过的低成本路线:先在免费仿真里把"抓取 / 在手操作"跑通,再决定要不要买真手。仿真帮你把概念、算法、数据流程全部打通,真手只做最后的"手感校准"。

1概念与选型
本页 + 术语词典,搞清楚自由度 / 驱动 / 触觉;预算 0 元也能起步
2仿真环境
MuJoCo 自带 ShadowHand 类灵巧手环境;Isaac Lab 有 DexterousHands 示例(见 04-04)
3抓取生成
跑通 DexGraspNet,给任意物体生成"手该放哪"的抓取姿态,学会读抓取质量指标
4策略训练
RL 训"掌中转物 / 抓取"或行为克隆训"演示跟随",把训练曲线跑顺
5sim2real
域随机化 + 真机标定,验证仿真策略能否移植(参考 04-07 sim2real 拆解)
6真手遥操作
买 / 借一台真手(宇树 Dex3-1、因时 RH56 或开源打印),用 Open-TeleVision 或数据手套采集自己的数据集
💡 三档预算方案:
· 0 元档:MuJoCo / Isaac Lab 免费仿真 + DexGraspNet / GRAB 公开数据,把"抓取生成 → 策略训练 → sim2real"整条链路跑通;
· 千元档:因时 RH56 类腱驱动手(或开源 3D 打印灵巧手)+ 数据手套,做真机遥操作与数据采集;
· 万元档:宇树 Dex3-1(消费级力控,配 H1 / G1)+ 官方 SDK,做"整机 + 灵巧手 + 数据闭环"的完整项目。

8 常见误区:五条"想当然"

⚠️ 误区一:"灵巧手就是多加几个电机"
电机的数量和位置只是起点。真正决定手好不好用的是:传动方案(腱绳会不会松)、触觉覆盖(有没有滑觉)、控制策略(能不能力控)、数据(有没有得学)。"加电机"是 20% 的工程,剩下 80% 在传动、传感与算法。
⚠️ 误区二:"自由度越高越好"
22 DOF 的手要 22 DOF 的触觉、算力与数据才养得活。DOF 军备竞赛脱离场景就是堆参数——先想清楚任务(捏鸡蛋?拧瓶盖?还是搬箱子?),再定自由度。
⚠️ 误区三:"仿真里会了就能上真机"
灵巧手的 sim2real 差距是机器人领域最大的:腱绳弹性、摩擦、触觉差异、电机延迟都难建模。必须做域随机化 + 真机校准,并做好"仿真 90 分、真机 60 分"的心理准备。
⚠️ 误区四:"有视觉就不需要触觉"
视觉会遮挡、会过曝、会延迟;而滑动和接触是毫秒级物理事件。人手抓东西 90% 靠触觉闭环,机器人同理——触觉不是"可选配件",是灵巧操作的必需品。
⚠️ 误区五:"开源了就能随便商用"
AgiBot World、GRAB、DexGraspNet 各有 License 与用途限制(科研 vs 商用)。动手前先读数据集的授权条款,商用项目尤其要确认(详见 05-03 页的 License 提醒)。

9 深度讲解:腱驱指尖力估算 + 欠驱动自由度配置(含算例)

🧮 两个最常用的工程估算
指尖力 ≈ (r/r)·i·η·cos(β)·F电机×传动比 i 的简化链:真正决定指尖力的三件套是「电机转矩 × 总减速/偏转比 ÷ 指节力臂」,腱绳不省功只换方向;
驱动器数 < 活动关节数 = 欠驱动:差分/耦合把 N 个关节塞给 M<N 个电机,靠弹簧/机械限位分配转角。

算例 A:一根手指的指尖捏力。设小臂内置无框电机额定 0.4 N·m,经 8:1 行星减速后由半径 r₁=6 mm 驱动轮引出腱绳(效率估 0.85),腱绳穿过 3 个转角各约 20° 的导引孔(每个折损估 2%),最后缠在半径 r₂=10 mm 的远端滑轮上拉动力臂 L=32 mm 的指节:

步骤公式代入结果
① 轮缘张力F = T·i·η/r₁0.4×8×0.85/0.006≈ 453 N(电机侧贡献)
② 路径折损×(1−2%)³ ≈ ×0.94453×0.94≈ 426 N
③ 指尖切向力F = F·r₂/L·cosβ426×10/32×0.94(cos20°)125 N 峰值上限
④ 工程打折安全系数 0.35~0.5125×0.4持续可用 ≈ 50 N(对标 Shadow 指尖 ~30-70 N 量级)

要点:②的路径折损与③的角度余弦都随抓握姿态变化——这就是为什么同一只手捏塑料杯轻松、捏钥匙串吃力;腱驱样本上标的「指尖力」必须注明姿态条件。

算例 B:欠驱动配置。人手单指 4 DOF(MCP 两轴+PIP+DIP)。方案:拇指外展单独 1 电机,四指屈伸共用1 台电机+4 根独立腱绳被同一滚轮同步供给?错——那仍是每指 1 自由度。常见量产做法是:每指 1 电机(屈伸)+ PIP/DIP 机械联动 + MCP 弹簧复位,即整手 6 电机对 ~11 个活动关节,欠驱动系数 = 关节/驱动 ≈ 1.8~2.5;宇树 G1 手(本站拆解页有实物)即是「6 电机、腱绳、自适应包络」的代表。全驱动 Shadow 则以 20 电机对 ~24 关节逼近 1:1,换来独立控制的精度与代价(重量/维护)。G1 实物拆解对照 →

⚠️ 三个认知陷阱:①腱绳「放大的是布置自由度,不是力」——一切折损(摩擦/蠕变/松绳)只会让指尖力低于电机账面值,选型时要按上面的表格逐级打完折扣再留裕量;②欠驱动数别只看电机台数,还要看每根腱绳的耦合关系(单腱回弹式 vs 双腱对抗式决定能否主动伸直);③标称「22 DOF」的工业口径常把被联动关节也算进去,对比参数时先问清「活动关节数 / 独立驱动数」两个数字分别是多少。抓取规划如何利用欠驱动 →

10 小结与思考

📌 本节小结:灵巧手与夹爪的本质区别是自由度与操作能力——夹爪 1~2 DOF 只做 pick & place,灵巧手 6~22 DOF 为在手操作而生;自由度分单指与整手两层,欠驱动省钱省重、全驱动贵而准。驱动方式四大流派:腱驱动最轻但爱松、直驱最快最皮实但重、连杆力大但笨、混合最贵最全;选型看力 / 速度 / 重量 / 成本 / 可靠性五维。触觉三件套(指尖阵列、视触觉 / 电子皮肤、六维力)解决滑动检测与力控制,是"会摸"的前提。代表产品里,Shadow 是研究标杆、特斯拉 22 DOF 手定调量产路线、宇树 / 智元 / 众擎 / 傅利叶代表国产主力。控制靠行为克隆 + 强化学习 + 遥操作三线并进,数据靠 DexGraspNet / GRAB / Open-TeleVision / AgiBot World 支撑;与 VLA 结合时采用"大模型出意图、灵巧手出力控"的分层架构。入门路线:仿真抓取 → 策略训练 → sim2real → 真手遥操作,0 元就能起步。
🤔 思考题: 1. 给你的项目选一款手:任务是"端菜(怕滑、怕碎)",你选腱驱动还是直驱?指尖触觉要不要?为什么?
2. 22 DOF 的灵巧手在"自由度、触觉、数据、策略"四个变量里,你觉得哪个最可能是当前瓶颈?请结合 1X / 智元 / 特斯拉的公开信息论证。
3. 如果给你 3 个月和 5000 元预算,你会怎么设计一条"从 0 到能抓鸡蛋"的灵巧手学习路线?写出每一步用什么工具、验证什么指标。

11 本节自测

1. 关于"自由度"的概念,下列说法正确的是?
💡 解析:人手整手常引约 27 DOF,单指(如食指)约 4 DOF(MCP 屈伸 + 侧摆 + PIP + DIP),多数灵巧手 DIP 与 PIP 联动后单指 2~3 DOF、整手 6~22 DOF。自由度越高,状态空间与数据需求越大,所以 D 说反了。
2. 特斯拉 Optimus、1X NEO 的手都选择"电机放小臂、腱绳传到手指",最主要的动机是?
💡 解析:腱驱动把电机前置到小臂 / 掌根,换来"手轻、指细、类人"的核心优势,这是整机重量预算与外观诉求下的关键取舍。代价是腱绳摩擦损耗、易松弛需维护,且指尖力受腱绳强度限制——A、C 与事实相反;D 中腱驱动成本通常不低(精密腱轮 / 张紧机构)。
3. 灵巧手抓取为什么离不开触觉?以下哪项是最核心的原因?
💡 解析:抓水杯怕滑、捏鸡蛋怕碎,都依赖"接触状态"的毫秒级反馈——滑动检测在物体将滑未滑时加大握力,力控制保证"刚好捏住"。视觉存在遮挡、光照、延迟问题,无法替代接触级反馈;触觉与视觉是互补关系,并非替代。
4. 想学习"人手如何抓握物体"并生成类人抓取动作,最适合先用的数据集 / 工具是?
💡 解析:GRAB(MPI,2020)是 10 人 × 51 物体 × 1334 段的人手-物体交互动捕数据集,基于 SMPL-X,是学习"人手怎么抓"的首选先验。DexGraspNet 提供的是灵巧手抓取姿态(132 万次)而非整机运动;Open-TeleVision 是 VR 沉浸式遥操作工具;AgiBot World 是百万条真机操作数据,均与 C / D 描述不符。
5. 关于「欠驱动」与「全驱动」灵巧手,下列说法正确的是?
💡 解析:欠驱动的电机数少于关节数,未驱动的关节靠弹簧 / 被动机构自适应贴合物体,优点是轻、便宜、鲁棒,缺点是单指无法独立控制;全驱动则每个可控自由度配一个驱动器,单指独立可控、力控精度高,代价是电机多导致重量 / 体积 / 成本上升。A、B 把两者说反了,D 与「欠驱动省钱省重」相反(见 1.4 节)。
6. 关于腱驱动、直驱、连杆三种驱动方案,下列说法错误的是?
💡 解析:本页明确提醒「没有绝对最优方案」:研究力控要带宽 → 直驱,消费级轻量类人 → 腱驱动,高负载工业 → 连杆;选型先问任务要多大指尖力、手装在哪、预算售后谁负责(见 2.1 节及第 2 节末尾警示框)。A、B、C 均与 2.1 节五维对比表一致,只有 D 是常见误区。
7. 判断一台整机灵巧操作能力更科学的方式是?
💡 解析:22 DOF 的手如果没有 22 DOF 的触觉、算力与数据支撑,实际表现可能不如「12 DOF + 好触觉 + 好策略」;判断操作能力要看自由度 × 触觉 × 数据 × 策略的乘积,而非单一指标(见 6.3 节警示框与第 8 节误区二)。A 是典型的「自由度军备竞赛」误区。
8. 按本页第 9 节算例 A 的链路,下列哪一项不属于让指尖力低于电机账面值的因素?
💡 解析:链条是 F = T电机·i·η/r₁ ×路径折损× r₂/L ×cosβ——电机额定转矩是输入项(C),其余都是把它打折扣的环节。工程师要做的正是把 B/D 的几何与 A 的磨损逐级算清再留安全系数;样本上的「指尖力」必须注明姿态,否则没有可比性。回看第 9 节四步表格。
9. 某灵巧手宣传「23 个关节自由度」,实际独立驱动电机只有 6 个。按驱动/关节口径,它属于?
💡 解析:定义看数字:M(驱动) < N(活动关节) 即欠驱动,23/6≈3.8 属于典型量产腱驱手的范围(2~4)。这类手的关键细节是每根腱绳的耦合方式(单腔回弹 vs 双腱对抗)决定「能不能主动伸直」。混合架构(C)的说法通常指同一只手上并存多种传动方式,不是这组数字的含义。
10. 双腱对抗式(屈腱+伸腱)相比单腔回弹式(拉紧弯曲+弹簧复位),最大的优势与代价是?
💡 解析:单腔回弹式的伸直靠弹簧,回弹速度与末端定位都受弹簧迟滞影响;双腱对抗把「伸直」变成主动控制,动态与可控性更好(A),但每节多一条腱绳通道与一个张紧调整点,布线和运维成本上升。指尖力的上限由电机侧张力决定(B),触觉反馈的有无不随驱动方式改变(C)。
11. 抓一块表面光滑的不锈钢杯壁(竖直面),最关键的短板链路是?
💡 解析:光滑竖面的物理难点是「靠摩擦扛重力」,安全裕度 = μ·F法向/G。抓取控制需要尽早检测到切向滑移(哪怕几毫秒)才能立即增压防掉——这正是指尖阵列/视触觉传感器存在的意义(D)。KV/背隙/数据集都可能影响整体性能,但都不是这条任务链上「一票否决」的短板。
12. 把「拇指外展+四指各 1 屈伸+PIP/DIP 联动」配置成 6 电机灵巧手,若想让它还能做「食指单指点触屏」的精细动作,最合理的升级是?
💡 解析:「单指点触屏」要求该指屈伸与其他指运动学解耦,而当前方案里共享驱动/联动的手指无法单独执行——本质是自由度不足的问题(B 通过增加驱动数换独立自由度)。更大的电机(A)、更高的预紧(D)改变的是力度不是自由度;全部改连杆(C)代价大且未必保留类人外形。这个取舍正是「欠驱动省钱省重 vs 全驱动贵而准」的具体化。
13. 对比 Shadow 手(~20 电机,全驱动)与宇树 G1 手(6 电机,欠驱动腱驱),下列结论正确的是?
💡 解析:两条路线服务于两个目标函数:C 的说法与本页对比表一致——Shadow 是研究标杆(独立力控/高带宽),以重量与维护为代价;宇树等国产方案对标特斯拉路线,面向整机量产的轻量与成本。A 把新旧当成性能判据;B 恰好说反(20 电机协调是最难的);D 忽视了腱驱松弛维护的存在。
📌 本节要点速查:①夹爪 1~2 DOF 只做 pick & place,灵巧手 6~22 DOF 为在手操作而生;②欠驱动省钱省重适合包络抓取,全驱动贵而准适合精细操作;③驱动四流派——腱驱动最轻但爱松、直驱最快最皮实但最重、连杆力大但笨、混合最贵最全,选型看力 / 速度 / 重量 / 成本 / 可靠性五维;④触觉三件套(指尖阵列、视触觉 / 电子皮肤、六维力)解决滑动检测与力控制,没有触觉的抓取是「盲抓」;⑤控制三线并进(行为克隆 / 强化学习 / 遥操作),数据靠 DexGraspNet / GRAB / Open-TeleVision / AgiBot World 支撑;⑥与 VLA 结合用「大模型出意图、灵巧手出力控」的分层架构;⑦入门从免费仿真起步:抓取生成 → 策略训练 → sim2real → 真手遥操作。

12 参考来源

以下链接均经 web_search 核实为官方 / 稳定地址,产品参数以官网最新为准。