✋ 灵巧手专题:从"能抓"到"会玩"
夹爪与灵巧手差在哪?22 个自由度怎么驱动?触觉为什么必不可少? 本页用一张对比表 + 一组代表产品 + 一条从仿真到真手的路线,带你一次看清灵巧手的硬件、传感、控制与数据。
灵巧手
自由度
腱驱动
触觉传感
遥操作
数据采集
🎯 本页学习目标
1. 能说清"夹爪 vs 灵巧手"的适用场景,并解释自由度(单指 DOF / 整手 DOF)、欠驱动与全驱动的区别
2. 能对比腱驱动 / 直驱 / 连杆 / 混合四种驱动方案,各举一个代表产品,并从力、速度、重量、成本、可靠性五个维度说出取舍
3. 能说出触觉传感的三种形态(指尖触觉阵列、视触觉 / 电子皮肤、六维力传感器),并解释"为什么抓取需要触觉"
4. 能背出 7 个以上代表产品(Shadow / 特斯拉 / 宇树 / 智元 / 1X / 众擎 / 傅利叶)的自由度、驱动与触觉配置
5. 能画出"行为克隆 / 强化学习 / 主从遥操作 / 数据采集"的技术链路,并知道 DexGraspNet、GRAB、Open-TeleVision 各自解决什么问题
6. 能为自己规划一条"仿真抓取 → sim2real → 真手遥操作"的入门路线
建议用时: 约 90 分钟(建议与
04-04 仿真与强化学习 页搭配阅读)
1 夹爪 vs 灵巧手:为什么人形机器人要灵巧手
人形机器人的末端执行器目前分两大阵营:夹爪(gripper) 与灵巧手(dexterous hand) 。夹爪是"工业化答案":两个或三个指头、1~2 个自由度,负责在结构化产线上做 pick & place;灵巧手是"具身智能答案":五根手指、10~22 个自由度,目标是像人手一样在非结构化环境里抓杯子、拧瓶盖、拿工具。理解两者的差别,是理解"为什么大家都在卷灵巧手"的第一步。
1.1 夹爪:结构简单、皮实、便宜,但只会"捏"
自由度: 通常 1~2 个(开合),靠平行或摆动机构夹持。
优点: 结构简单、可靠性高、成本低(几百到几千元)、控制容易——一个开合命令就完成一次抓取。
局限: 只能做"平行夹持"或"包络抓取"两种基本动作,无法在手中换向、无法单指按压、无法适应异形物体,更做不了拧瓶盖、插线、转螺丝这类"精细操作"。
代表: Robotiq、OnRobot、大寰(DH Robotics)等工业夹爪,广泛用于汽车、3C 产线。
1.2 灵巧手:类人构型,为"操作"而生
自由度: 五指构型,整手 6~22 DOF;单指 2~4 DOF(见下),拇指通常最复杂。
优点: 能执行多种抓取模式(捏、握、勾、包络、侧捏),支持在手操作(in-hand manipulation) ——不换手就能把笔转个方向、把硬币翻面;能操作人手设计的工具。
代价: 自由度翻倍意味着控制、传感、数据全部翻倍,成本从数千元到数十万元不等,可靠性也远低于夹爪——这正是灵巧手被称为"具身智能木桶最短那块板"的原因。
维度 二指 / 三指夹爪 五指灵巧手
自由度 1~2 DOF 6~22 DOF(单指 2~4 DOF)
抓取类型 平行夹持 / 简单包络 捏、握、勾、侧捏、在手操作
适用场景 结构化产线、抓取形状规整的工件 家庭、物流、服务等非结构化场景与工具操作
控制难度 低(1 个命令) 高(需要关节控制 + 触觉反馈 + 学习策略)
成本区间 数百 ~ 数千元 数千(消费级)~ 数十万元(研究级)
代表产品 Robotiq / OnRobot / 大寰 Shadow Hand / 特斯拉 Optimus / 宇树 Dex3-1 / 智元
1.3 自由度概念:单手指 DOF 与整手 DOF
自由度(DOF, Degree of Freedom) 指机构能独立运动的轴数。对人手来说要分两层看:
单指 DOF: 以食指为例——掌指关节 MCP 能做屈伸 + 侧摆(2 DOF),近端指间关节 PIP 屈伸(1 DOF),远端指间关节 DIP 屈伸(1 DOF),合计约 4 DOF ;拇指因有鞍状关节更复杂,常计 4~5 DOF。多数灵巧手为控制简单,把 DIP 与 PIP 联动(欠驱动耦合),单指做到 2~3 DOF。
整手 DOF: 人手约 27 DOF (口径不一,常引 27);工业夹爪 1~2 DOF;主流灵巧手 6~22 DOF。DOF 越高,动作越接近人手,但状态空间指数膨胀——22 DOF 的手,策略输出维度、触觉覆盖、数据需求都远大于夹爪。
一句话记住: DOF 是"能力上限",但也直接决定"控制与数据的账单"。
1.4 欠驱动与全驱动:用几个电机的问题
方案 原理 优点 缺点 代表
欠驱动 (underactuated) 电机数 < 关节数,未驱动的关节靠弹簧 / 被动机构自适应贴合物体 结构轻、成本低、鲁棒,包络抓取时"自动适应"物体形状(被动自适应) 单指无法独立控制、难以做精细姿态 多数消费级三指 / 五指手,如宇树 Dex3-1 的部分构型、低成本义肢手
全驱动 (fully actuated) 每个关节(或每个可控自由度)配一个驱动器 单指独立可控、力控精度高、可执行精确姿态 电机多 → 重量 / 体积 / 成本上升 Shadow Hand(电动版)、智元全驱版灵巧手、Wonik Allegro
💡 判断口诀: "欠驱动省钱省重、适合包络抓取;全驱动贵而准、适合精细操作"。真实产品多为折中:近端关节全驱动、远端关节欠驱动耦合(DIP 跟 PIP 走),用最少的电机换最大的实用性。
2 驱动方式:腱驱动 / 直驱 / 连杆 / 混合
灵巧手的难点不在"放几个电机",而在电机怎么把力传到指尖 。手指越靠近指尖越细,塞不下大电机,于是诞生了四种主流传动方案。下表是核心对比,五个关键维度(力 / 速度 / 重量 / 成本 / 可靠性)决定了每个方案适合的战场。
方案 原理 代表产品 优点 缺点
腱驱动 (tendon)
电机放在小臂 / 掌根,通过钢丝或高分子腱绳把拉力传到远端关节,可加弹性件实现柔顺
特斯拉 Optimus(小臂腱驱动)、1X NEO、Shadow Hand(气动肌肉 / 腱绳)、因时 RH56(腱+连杆)
手部本体最轻、远端关节可以做得很小、自由度布局灵活、外观类人;腱绳走"张力"天然有一定柔顺
摩擦与弹性损耗大、腱绳会松弛 / 磨损需定期张紧、控制带宽较低、装配维护复杂、成本中高
直驱 (direct drive)
电机(或小减速比"准直驱")直接装在每个关节上,掌内 / 指内分布
Wonik Allegro(16 DOF 研究手)、智元全驱版(12 驱动内置掌内)、兆威机电等供应链直驱方案
控制带宽高、力控精度好、可反向驱动(人掰得动)、动力学建模简单、可靠耐用
远端关节又重又粗、指尖力受电机尺寸限制、微型电机成本高、整体偏重
连杆 (linkage)
用四连杆 / 平行连杆机构把近端驱动器的运动传到远端关节
日本研究系连杆手(Kawada / 东京大学等)、部分工业灵巧手与仿人义肢
输出力大、重复精度高、无腱绳松弛问题、刚度好、寿命长
运动学设计复杂、关节布局受限、手型偏粗壮、手指长度灵活性差
混合 (hybrid)
不同关节用不同方案组合,如"腱绳 + 连杆"或"直驱 + 腱绳"
因时 RH56(腱+连杆)、腾讯 Robotics X 灵巧手(直线驱动器 + 腱绳)、部分国产新品
取长补短:关键关节用连杆保力、远端用腱绳保轻
结构最复杂、设计周期长、成本最高
2.1 五个维度的横向比较
维度 腱驱动 直驱 连杆
指尖力 中(受腱绳强度与摩擦限制) 中低(微型电机力密度有限) 高(杠杆放大,刚度大)
速度 / 带宽 低(腱绳弹性与摩擦拖累响应) 高(电机直连,响应快) 中(机构惯量中等)
手部重量 最轻(电机前置到小臂 / 掌根) 最重(电机全在手上) 中
成本 中高(精密腱轮 / 导管 / 张紧机构) 高(需要大量微型高性能电机) 中(精密连杆加工)
可靠性 低(腱绳磨损、松弛是最大痛点) 高(无传动损耗,皮实) 高(无柔性件)
⚠️ 没有"绝对最优"方案: 做研究力控、要带宽 → 直驱(Allegro、智元全驱);做消费级轻量化、要类人手感 → 腱驱动(特斯拉、1X、Shadow);做高负载工业抓取 → 连杆。选型先问三个问题:任务要多大指尖力?手要装在哪(小臂还是手腕)?预算和售后谁负责?
3 触觉与传感:没有触觉的抓取是"盲抓"
视觉告诉你"杯子在哪",触觉告诉你"手有没有捏住、会不会滑"。灵巧手的自由度越高,越需要接触级反馈——否则 22 个关节只是"会动的机械臂",不是"会摸的手"。触觉传感按覆盖范围分三个层次:
3.1 指尖触觉阵列:抓取的第一道触觉
原理: 在指尖贴阵列式压阻 / 电容传感器,像皮肤一样把"压力分布"变成图像,分辨率从 4×4 到 16×16 甚至更高。
指标: 空间分辨率、灵敏度(能否感知几克力)、量程(能否承受几十牛)、采样率(滑动检测需要 >100Hz)。
代表: 帕西尼 PaXini 触觉传感器、XELA、智元 / 宇树自研指尖触觉;研究圈常用 BioTac(带流体指尖)做接触力与纹理感知。
3.2 视触觉传感器:用相机"看"接触面
原理: 弹性凝胶被物体压出形变,内置相机拍照,从图像反推接触几何、力与滑动(GelSight / GelSlim 系)。
优点: 分辨率极高、能感知纹理与微滑动、硬件便宜;缺点是需要光源与图像处理、体积偏大。
应用: DeepMind 等团队用它做抓取滑动检测与精细操作;智元 2024 版灵巧手也提供"视触觉 + 摄像头"传感组合。
3.3 电子皮肤:整只手都"有感觉"
原理: 大面积柔性传感器薄膜覆盖手指与手掌,可弯折、可裁剪,测压力 / 温度 / 接近。
代表: 利永环球(业界报道其为特斯拉 Optimus 提供压力传感器与电子皮肤)、帕西尼、汉威科技等。
意义: 接触不只发生在指尖——抓水杯时整个手掌都在承力,大面积皮肤让力控与安全交互更自然。
3.4 六维力 / 力矩传感器:手腕上的"秤"
原理: 装在手腕(或掌根),一次测出 Fx/Fy/Fz 与 Mx/My/Mz 六个分量,是做阻抗控制、柔顺装配的标准件。
代表: ATI(国外标杆)、坤维、鑫精诚(国产常用)。
与指尖触觉的分工: 六维力管"整手受到的合力",触觉管"每个接触点的分布"——配合使用才能既知道"用了多大力",又知道"力压在哪根手指上"。
💡 为什么抓取必须要有触觉:
· 滑动检测(slip detection): 光滑杯壁上的杯子,视觉看不出要滑,触觉在微滑动发生的几毫秒内就能察觉并加大握力;
· 力控制: 捏鸡蛋、端豆腐需要"刚好捏住又不捏碎",只能靠指尖力反馈闭环;
· 接触状态估计: 在遮挡、光照变化下,触觉是唯一可靠的"是否接触、接触哪里"的信息源;
· 在手操作: 转笔、翻硬币这类动作,手指每毫秒都在重新分配接触点,纯开环位置控制必然失败。
4 代表产品盘点:从研究标杆到量产方向
下面按"研究标杆 → 产业旗舰 → 国产主力"的顺序盘点主流灵巧手。核心参数(自由度 / 驱动 / 触觉 / 开源)已用 web_search 核实,厂商资料可能持续更新,以官网为准。
产品 厂商 / 国家 自由度 驱动方式 触觉 / 传感 开源 / 生态
Shadow Hand Shadow Robot / 英国 24 DOF(含腕,手部本体约 20 关节) 经典版气动肌肉(40 根),电动版(E2)约 20 电机 指尖触觉(经典版内置上百个传感器) 研究界"黄金标准",有 ROS 驱动与模型,DeepMind 等实验室标配
特斯拉 Optimus 手 Tesla / 美国 22 DOF(2024 年底版本;Gen2 早期为 11 DOF) 腱驱动,致动器在小臂,手指细长 指尖压力传感 / 电子皮肤(利永环球等供应链) 不对外开源,但专利与演示视频公开,目标成本千美元级
宇树 Dex3-1 宇树 Unitree / 中国 12 DOF 力控(三指 / 多指构型,官方主打力控) 直驱 + 力控,适配 H1 / G1 / H2 指尖触觉可选,亦有带 RGB 相机的 Dex3-1DP 版 消费级电商可购,官方 SDK / ROS2,价格远低于研究级
智元灵巧手家族 智元 AgiBot / 中国 12 DOF 全驱动版(2024,12 个驱动全内置掌内) 全驱动 / 欠驱动多版本 指尖触觉,可选视触觉 + 摄像头 配合 AgiBot World 百万真机数据集开源,整机远征 / 灵犀搭载
1X NEO 手 1X / 挪威 约 20 DOF(媒体引用) 腱驱动,致动器全部前置到小臂,手部极轻 主打仿人手感与低重量 NEO 整机 2025 年开放预购(约 2 万美元级),手部不单独开源
众擎 EngineAI 手 众擎 / 中国 12 DOF 级五指手 腱绳 / 丝驱动为主 指尖力觉 随 SE01 / PM01 整机自研配套,强调整机手自研联动
傅利叶 GR-2 / GR-3 手 傅利叶 Fourier / 中国 手部 12 DOF(GR-2,整机 53 DOF) 五指全驱动 指尖触觉 / 力觉 面向康复 + 通用操作,Humanoids 2024 展示
4.1 三个值得细看的产品细节
✋ Shadow Hand(研究界标准件): 1980 年代研发至今,是全球被论文引用最多的灵巧手。DeepMind 用它完成"单手转魔方"(强化学习 + 域随机化,2019),证明了"仿真里训出来的策略可以控制真实灵巧手"——这也是"仿真 → sim2real"路线的标志性实验。缺点:贵(数十万元级)、维护难。
✋ 特斯拉 Optimus 手(量产风向标): 2024 年 11 月演示"接住网球"的新手即 22 DOF 版本,2025 年 Gen3 宣称"全球最强人手"。它的设计逻辑是"小臂放电机、手指只留传动与传感"——腱驱动 + 指尖压力,再靠规模化压成本。业内普遍认为:Optimus 手把"灵巧手的量产路线"定调成了"腱驱动 + 电子皮肤 + 千美元级成本"。
✋ 宇树 Dex3-1 与智元家族(国产双雄): Dex3-1 是"力控 + 消费级定价"的代表,电商直接能买、SDK 齐全,适合个人开发者把玩;智元走"硬件 + 数据 + 开源"路线——灵巧手 12 驱动内置掌内,同时开源 AgiBot World 百万真机数据集,让"买手的人"和"训手的人"共用一套数据资产。
⚠️ 参数说明: 上表为 2024~2025 年公开资料口径,厂商迭代很快(特斯拉 22 DOF、智元 12 驱动掌内等均为较新版本);动手前务必去官网 / 官方 GitHub 核对最新规格,并关注
术语词典 中的对应词条。
5 控制与遥操作:让灵巧手"学会"操作
手有了自由度与触觉,还差"怎么动"。灵巧手控制目前三条主线并行:行为克隆(BC) 、强化学习(RL) 、主从遥操作 ——而三条线都依赖同一个基础设施:数据 。
5.1 三条技术路线速览
路线 做法 优点 缺点 代表作
行为克隆 遥操作采集人手演示 → 学"状态 → 动作"映射(ACT / Diffusion Policy) 直观、数据门槛相对低、能学复杂长程任务 受演示质量影响大、泛化性有限、需要大量多样数据 ALOHA / Mobile ALOHA(斯坦福)、智元真机采集
强化学习 在仿真里让策略自己"试错",用奖励函数训出灵巧动作,再 sim2real 可探索人做不到的动作、抗扰动强、可批量并行 奖励设计难、sim2real 差距大、真机试错成本高 OpenAI Dactyl 转魔方、Isaac Lab 灵巧手环境
主从遥操作 人手戴数据手套 / 操作主手,实时映射到灵巧手 实时、可靠、是数据采集的"源头" 需要操作员、带宽受限、无法脱离人 Shadow Glove、诺亦腾 / Rokoko 动捕手套、Open-TeleVision
5.2 行为克隆:ALOHA 与扩散策略
行为克隆的核心是先采集、后学习 :操作员用遥操作设备演示"拧瓶盖",机器人记录每帧的相机图像与关节指令,然后用 ACT(动作分块 Transformer)或扩散策略(Diffusion Policy)训练一个"看到什么就输出什么动作"的策略。灵巧手的动作空间比夹爪大一个量级,所以采集量也要大一个量级——这也是各大厂疯狂堆遥操作工位的原因。
5.3 强化学习:在仿真里"转魔方"
2019 年 OpenAI 用 Shadow Hand 在 MuJoCo 里用 RL 训出单手转魔方并迁移到真机,是灵巧手 RL 的里程碑。今天更常规的做法是:MuJoCo / Isaac Lab 建灵巧手环境 → 域随机化 + 奖励塑形训练 → 部署真机校准 。灵巧手 RL 的典型任务:掌中旋转物体(物体在手里不掉)、指尖平衡杆、多指抓取抗扰动。注意:触觉在仿真里的建模(GelSight 类传感器有专门仿真插件)是 sim2real 成败的关键。
5.4 主从遥操作与数据手套
数据手套: 诺亦腾、Rokoko、Manus 等惯性 / 光学手套记录人手关节角,直接映射到灵巧手(需人手-手映射标定)。
主手(主从式): 操作员用手操作一个镜像主手(带力反馈更佳),机器人从手跟随——Shadow 的 Shadow Glove 就是为自家手配套的经典方案。
沉浸式遥操作: 加州大学圣迭戈 + MIT 的 Open-TeleVision (CoRL 2024,开源)用 VR 头显 + 立体视觉把"机器人的眼睛"实时回传给操作员,人在异地就能远程控制机器人的手,极大降低采集门槛。
5.5 关键数据集与工具:数据从哪来
名称 类型 规模 / 内容 用途
DexGraspNet (北大 EPIC)仿真抓取数据集 约 132 万次抓取姿态 × 5000+ 物体(Shadow 手仿真) 生成"手怎么放"的抓取姿态,喂给抓取规划 / 学习
DexGraspNet 2.0 仿真抓取数据集 扩展到杂乱桌面场景 真实场景级灵巧抓取生成
GRAB (MPI,2020)人手-物体交互动捕 10 人 × 51 物体 × 1334 段,基于 SMPL-X 手模型 学习"人手怎么抓东西",训练手物交互生成与仿人手
Open-TeleVision (CoRL 2024)遥操作工具 开源系统 + 演示数据 VR 沉浸式遥操作,远程采集真机数据
AgiBot World (智元,2024-12 开源)真机操作数据集 百万条级真机操作数据,覆盖 5 大场景百余种物体 训练灵巧操作 / VLA 的"真机底座",号称规模比 Open X-Embodiment 高一个数量级
DEX-EE (Google DeepMind)灵巧末端 + 遥操作 低成本灵巧末端,ALOHA 式采集 帮 DeepMind 规模化采集灵巧操作数据
💡 一句话串起来: GRAB 告诉你"人手怎么抓"(仿人先验)→ DexGraspNet 告诉你"手怎么放"(抓取姿态)→ Open-TeleVision / AgiBot World 提供"真机动作数据"(行为克隆 / VLA 训练)→ RL 在仿真里补足"人类演示覆盖不到的刁钻动作"。
6 与整机结合:灵巧手 × VLA、数据闭环与量产
灵巧手不是孤立零件,它的价值取决于整机与算法栈。最近一年最大的变量是VLA(视觉-语言-动作模型) 崛起——让"听懂指令"和"操作物体"第一次可以端到端训练。
6.1 灵巧手与 VLA:动作空间的"最后一公里"
链接: VLA 的完整介绍见 04-05 感知与具身智能:VLA 与世界模型 。
问题: 夹爪动作空间只有 1~2 维,VLA 输出毫无压力;灵巧手 12~22 DOF 的动作输出会让 VLA 训练难度与数据需求爆炸。
常见解法(分层架构): VLA 只输出高层意图(目标抓取点、动作类别),灵巧手由低层策略(RL 力控 / 阻抗控制)执行——"大模型负责想,灵巧手负责做"。
趋势: OpenAI / 智元 / 宇树等都在尝试"VLA 直接出灵巧手动作",代价是数据量——这正好把需求推给第 5 节的数据采集体系。
6.2 数据闭环:从采集到回流的数据飞轮
1 采集 遥操作工位 / 动捕手套 / 仿真生成,产生"图像 + 关节 + 触觉"轨迹
2 训练 行为克隆 / RL / VLA 微调,产出可执行策略
3 部署 装进整机真跑,收集失败案例与长尾场景
4 回流 失败样本回到数据集,再采集 / 再训练,循环提速
智元开源 AgiBot World 的意义正在于此:把"采集 → 训练 → 部署 → 回流"的飞轮开源出来,让买灵巧手的人直接获得高质量起点,而非从零攒数据。
6.3 成本与量产趋势:从"实验室奢侈品"到"千元级部件"
价格塌缩: Shadow Hand 数十万元级 → 国产消费级灵巧手数千元级;特斯拉目标单只成本千美元以内;宇树 Dex3-1 电商可直接购买。
供应链成型: 微型电机(兆威机电、鸣志)、微型谐波减速器(绿的谐波)、触觉传感(帕西尼、利永环球)、腱绳与导管等环节逐渐国产化,是成本下降的主因。
量产逻辑: 腱驱动(电机前置)+ 欠驱动远端 + 电子皮肤,是目前产业界公认的"兼顾性能、重量与成本"的路线,特斯拉 / 1X / 智元都在往这个方向收敛。
⚠️ 冷静看"自由度军备竞赛": 22 DOF 的手如果没有 22 DOF 的触觉、算力与数据支撑,实际表现可能不如"12 DOF + 好触觉 + 好策略"。判断一台整机的操作能力,要看自由度 × 触觉 × 数据 × 策略 的乘积,而不是单一指标。
7 入门路线:先仿真里抓,再真手上练
灵巧手学习成本高,但有一条被验证过的低成本路线:先在免费仿真里把"抓取 / 在手操作"跑通,再决定要不要买真手 。仿真帮你把概念、算法、数据流程全部打通,真手只做最后的"手感校准"。
1 概念与选型 本页 +
术语词典 ,搞清楚自由度 / 驱动 / 触觉;预算 0 元也能起步
2 仿真环境 MuJoCo 自带 ShadowHand 类灵巧手环境;Isaac Lab 有 DexterousHands 示例(见
04-04 )
3 抓取生成 跑通 DexGraspNet,给任意物体生成"手该放哪"的抓取姿态,学会读抓取质量指标
4 策略训练 RL 训"掌中转物 / 抓取"或行为克隆训"演示跟随",把训练曲线跑顺
6 真手遥操作 买 / 借一台真手(宇树 Dex3-1、因时 RH56 或开源打印),用 Open-TeleVision 或数据手套采集自己的数据集
💡 三档预算方案:
· 0 元档: MuJoCo / Isaac Lab 免费仿真 + DexGraspNet / GRAB 公开数据,把"抓取生成 → 策略训练 → sim2real"整条链路跑通;
· 千元档: 因时 RH56 类腱驱动手(或开源 3D 打印灵巧手)+ 数据手套,做真机遥操作与数据采集;
· 万元档: 宇树 Dex3-1(消费级力控,配 H1 / G1)+ 官方 SDK,做"整机 + 灵巧手 + 数据闭环"的完整项目。
8 常见误区:五条"想当然"
⚠️ 误区一:"灵巧手就是多加几个电机" 电机的数量和位置只是起点。真正决定手好不好用的是:传动方案(腱绳会不会松)、触觉覆盖(有没有滑觉)、控制策略(能不能力控)、数据(有没有得学)。"加电机"是 20% 的工程,剩下 80% 在传动、传感与算法。
⚠️ 误区二:"自由度越高越好" 22 DOF 的手要 22 DOF 的触觉、算力与数据才养得活。DOF 军备竞赛脱离场景就是堆参数——先想清楚任务(捏鸡蛋?拧瓶盖?还是搬箱子?),再定自由度。
⚠️ 误区三:"仿真里会了就能上真机" 灵巧手的 sim2real 差距是机器人领域最大的:腱绳弹性、摩擦、触觉差异、电机延迟都难建模。必须做域随机化 + 真机校准,并做好"仿真 90 分、真机 60 分"的心理准备。
⚠️ 误区四:"有视觉就不需要触觉" 视觉会遮挡、会过曝、会延迟;而滑动和接触是毫秒级物理事件。人手抓东西 90% 靠触觉闭环,机器人同理——触觉不是"可选配件",是灵巧操作的必需品。
⚠️ 误区五:"开源了就能随便商用" AgiBot World、GRAB、DexGraspNet 各有 License 与用途限制(科研 vs 商用)。动手前先读数据集的授权条款,商用项目尤其要确认(详见 05-03 页的 License 提醒)。
9 深度讲解:腱驱指尖力估算 + 欠驱动自由度配置(含算例)
🧮 两个最常用的工程估算
①
指尖力 ≈ (r轮 /r指 )·i减 ·η·cos(β)·F电机 ×传动比 i腱 的简化链:真正决定指尖力的三件套是「电机转矩 × 总减速/偏转比 ÷ 指节力臂」,腱绳不省功只换方向;
②
驱动器数 < 活动关节数 = 欠驱动 :差分/耦合把 N 个关节塞给 M<N 个电机,靠弹簧/机械限位分配转角。
算例 A:一根手指的指尖捏力。 设小臂内置无框电机额定 0.4 N·m,经 8:1 行星减速后由半径 r₁=6 mm 驱动轮引出腱绳(效率估 0.85),腱绳穿过 3 个转角各约 20° 的导引孔(每个折损估 2%),最后缠在半径 r₂=10 mm 的远端滑轮上拉动力臂 L=32 mm 的指节:
步骤 公式 代入 结果
① 轮缘张力 F绳 = T·i·η/r₁ 0.4×8×0.85/0.006 ≈ 453 N(电机侧贡献)
② 路径折损 ×(1−2%)³ ≈ ×0.94 453×0.94 ≈ 426 N
③ 指尖切向力 F尖 = F绳 ·r₂/L·cosβ 426×10/32×0.94(cos20°) ≈ 125 N 峰值上限
④ 工程打折 安全系数 0.35~0.5 125×0.4 持续可用 ≈ 50 N (对标 Shadow 指尖 ~30-70 N 量级)
要点:②的路径折损与③的角度余弦都随抓握姿态 变化——这就是为什么同一只手捏塑料杯轻松、捏钥匙串吃力;腱驱样本上标的「指尖力」必须注明姿态条件。
算例 B:欠驱动配置。 人手单指 4 DOF(MCP 两轴+PIP+DIP)。方案:拇指外展单独 1 电机,四指屈伸共用1 台电机+4 根独立腱绳被同一滚轮同步供给 ?错——那仍是每指 1 自由度。常见量产做法是:每指 1 电机(屈伸)+ PIP/DIP 机械联动 + MCP 弹簧复位 ,即整手 6 电机对 ~11 个活动关节,欠驱动系数 = 关节/驱动 ≈ 1.8~2.5 ;宇树 G1 手(本站拆解页有实物)即是「6 电机、腱绳、自适应包络」的代表。全驱动 Shadow 则以 20 电机对 ~24 关节逼近 1:1,换来独立控制的精度与代价(重量/维护)。G1 实物拆解对照 →
⚠️ 三个认知陷阱: ①腱绳「放大的是布置自由度,不是力」——一切折损(摩擦/蠕变/松绳)只会让指尖力低于电机账面值,选型时要按上面的表格逐级打完折扣再留裕量;②欠驱动数别只看电机台数,还要看
每根腱绳的耦合关系 (单腱回弹式 vs 双腱对抗式决定能否主动伸直);③标称「22 DOF」的工业口径常把被联动关节也算进去,对比参数时先问清「活动关节数 / 独立驱动数」两个数字分别是多少。
抓取规划如何利用欠驱动 →
10 小结与思考
📌 本节小结: 灵巧手与夹爪的本质区别是自由度与操作能力——夹爪 1~2 DOF 只做 pick & place,灵巧手 6~22 DOF 为在手操作而生;自由度分单指与整手两层,欠驱动省钱省重、全驱动贵而准。驱动方式四大流派:腱驱动最轻但爱松、直驱最快最皮实但重、连杆力大但笨、混合最贵最全;选型看力 / 速度 / 重量 / 成本 / 可靠性五维。触觉三件套(指尖阵列、视触觉 / 电子皮肤、六维力)解决滑动检测与力控制,是"会摸"的前提。代表产品里,Shadow 是研究标杆、特斯拉 22 DOF 手定调量产路线、宇树 / 智元 / 众擎 / 傅利叶代表国产主力。控制靠行为克隆 + 强化学习 + 遥操作三线并进,数据靠 DexGraspNet / GRAB / Open-TeleVision / AgiBot World 支撑;与 VLA 结合时采用"大模型出意图、灵巧手出力控"的分层架构。入门路线:仿真抓取 → 策略训练 → sim2real → 真手遥操作,0 元就能起步。
🤔 思考题:
1. 给你的项目选一款手:任务是"端菜(怕滑、怕碎)",你选腱驱动还是直驱?指尖触觉要不要?为什么?
2. 22 DOF 的灵巧手在"自由度、触觉、数据、策略"四个变量里,你觉得哪个最可能是当前瓶颈?请结合 1X / 智元 / 特斯拉的公开信息论证。
3. 如果给你 3 个月和 5000 元预算,你会怎么设计一条"从 0 到能抓鸡蛋"的灵巧手学习路线?写出每一步用什么工具、验证什么指标。
11 本节自测
1. 关于"自由度"的概念,下列说法正确的是?
A. 人手约有 2 个自由度,灵巧手约有 27 个自由度
B. 单指自由度只统计指尖关节,与整手自由度无关
C. 人手整手约 27 DOF;单指约 2~4 DOF;主流灵巧手整手 6~22 DOF
D. 自由度越高,控制与数据需求越低
💡 解析:人手整手常引约 27 DOF,单指(如食指)约 4 DOF(MCP 屈伸 + 侧摆 + PIP + DIP),多数灵巧手 DIP 与 PIP 联动后单指 2~3 DOF、整手 6~22 DOF。自由度越高,状态空间与数据需求越大,所以 D 说反了。
2. 特斯拉 Optimus、1X NEO 的手都选择"电机放小臂、腱绳传到手指",最主要的动机是?
A. 腱驱动的手指可以承受最大的指尖力
B. 手部本体更轻、远端关节可以更细,更接近人手外观与手感
C. 腱驱动完全不需要维护
D. 腱驱动成本一定低于直驱
💡 解析:腱驱动把电机前置到小臂 / 掌根,换来"手轻、指细、类人"的核心优势,这是整机重量预算与外观诉求下的关键取舍。代价是腱绳摩擦损耗、易松弛需维护,且指尖力受腱绳强度限制——A、C 与事实相反;D 中腱驱动成本通常不低(精密腱轮 / 张紧机构)。
3. 灵巧手抓取为什么离不开触觉?以下哪项是最核心的原因?
A. 触觉传感器可以代替视觉做物体识别
B. 触觉能提高电机转速
C. 只有触觉传感器能测关节角度
D. 滑动检测与力控制需要在毫秒级感知接触状态,视觉无法覆盖
💡 解析:抓水杯怕滑、捏鸡蛋怕碎,都依赖"接触状态"的毫秒级反馈——滑动检测在物体将滑未滑时加大握力,力控制保证"刚好捏住"。视觉存在遮挡、光照、延迟问题,无法替代接触级反馈;触觉与视觉是互补关系,并非替代。
4. 想学习"人手如何抓握物体"并生成类人抓取动作,最适合先用的数据集 / 工具是?
A. GRAB:带 SMPL-X 人手模型的人-物交互动捕数据,可直接学习人手抓取先验
B. Open-TeleVision:它只能生成仿真物体,不能用于人手抓取学习
C. DexGraspNet:它提供的是机器人整机运动数据,与手无关
D. AgiBot World:它只包含灵巧手的 CAD 图纸,不包含动作数据
💡 解析:GRAB(MPI,2020)是 10 人 × 51 物体 × 1334 段的人手-物体交互动捕数据集,基于 SMPL-X,是学习"人手怎么抓"的首选先验。DexGraspNet 提供的是灵巧手抓取姿态(132 万次)而非整机运动;Open-TeleVision 是 VR 沉浸式遥操作工具;AgiBot World 是百万条真机操作数据,均与 C / D 描述不符。
5. 关于「欠驱动」与「全驱动」灵巧手,下列说法正确的是?
A. 欠驱动是每个关节都配一个驱动器,力控精度最高
B. 全驱动电机数少于关节数,靠弹簧被动自适应贴合物体
C. 欠驱动电机数少于关节数,包络抓取时被动自适应、成本低,但单指难以独立控制
D. 欠驱动一定比全驱动更贵、更重
💡 解析:欠驱动的电机数少于关节数,未驱动的关节靠弹簧 / 被动机构自适应贴合物体,优点是轻、便宜、鲁棒,缺点是单指无法独立控制;全驱动则每个可控自由度配一个驱动器,单指独立可控、力控精度高,代价是电机多导致重量 / 体积 / 成本上升。A、B 把两者说反了,D 与「欠驱动省钱省重」相反(见 1.4 节)。
6. 关于腱驱动、直驱、连杆三种驱动方案,下列说法错误的是?
A. 直驱控制带宽高、可靠耐用,但电机全在手上,手部最重
B. 腱驱动手部最轻,但腱绳磨损、松弛是最大痛点
C. 连杆输出力大、寿命长,但关节布局受限、手型偏粗壮
D. 存在一种「绝对最优」的驱动方案,任何任务都能通用
💡 解析:本页明确提醒「没有绝对最优方案」:研究力控要带宽 → 直驱,消费级轻量类人 → 腱驱动,高负载工业 → 连杆;选型先问任务要多大指尖力、手装在哪、预算售后谁负责(见 2.1 节及第 2 节末尾警示框)。A、B、C 均与 2.1 节五维对比表一致,只有 D 是常见误区。
7. 判断一台整机灵巧操作能力更科学的方式是?
A. 只看自由度数值,自由度越高一定越强
B. 看「自由度 × 触觉 × 数据 × 策略」的乘积,而非单一指标
C. 只看是否开源数据集,与硬件配置无关
D. 只看成本,越便宜操作能力越强
💡 解析:22 DOF 的手如果没有 22 DOF 的触觉、算力与数据支撑,实际表现可能不如「12 DOF + 好触觉 + 好策略」;判断操作能力要看自由度 × 触觉 × 数据 × 策略的乘积,而非单一指标(见 6.3 节警示框与第 8 节误区二)。A 是典型的「自由度军备竞赛」误区。
8. 按本页第 9 节算例 A 的链路,下列哪一项不属于 让指尖力低于电机账面值的因素?
A. 腱绳经过多个导引孔的摩擦折损
B. 远端滑轮半径与指节力臂的比值(r₂/L)
C. 小臂电机的额定转矩本身
D. 抓握姿态带来的力线角度余弦
💡 解析:链条是 F尖 = T电机 ·i·η/r₁ ×路径折损× r₂/L ×cosβ——电机额定转矩是输入项 (C),其余都是把它打折扣的环节。工程师要做的正是把 B/D 的几何与 A 的磨损逐级算清再留安全系数;样本上的「指尖力」必须注明姿态,否则没有可比性。回看第 9 节四步表格。
9. 某灵巧手宣传「23 个关节自由度」,实际独立驱动电机只有 6 个。按驱动/关节口径,它属于?
A. 全驱动,因为关节数多于电机数
B. 欠驱动,欠驱动系数 ≈ 23/6 ≈ 3.8——未驱动关节靠弹簧、联动机构或被动件分配运动
C. 既非全也非欠,属于第三类混合架构
D. 无法判断,必须看价格
💡 解析:定义看数字:M(驱动) < N(活动关节) 即欠驱动,23/6≈3.8 属于典型量产腱驱手的范围(2~4)。这类手的关键细节是每根腱绳的耦合方式(单腔回弹 vs 双腱对抗)决定「能不能主动伸直」。混合架构(C)的说法通常指同一只手上并存多种传动方式,不是这组数字的含义。
10. 双腱对抗式(屈腱+伸腱)相比单腔回弹式(拉紧弯曲+弹簧复位),最大的优势与代价是?
A. 优势:指节可主动伸直、往复响应快;代价:通道数翻倍、张紧维护点翻倍
B. 优势:指尖力更大;代价:腱绳寿命变短
C. 优势:不再需要编码器;代价:重量更大
D. 两者没有任何区别
💡 解析:单腔回弹式的伸直靠弹簧,回弹速度与末端定位都受弹簧迟滞影响;双腱对抗把「伸直」变成主动控制,动态与可控性更好(A),但每节多一条腱绳通道与一个张紧调整点,布线和运维成本上升。指尖力的上限由电机侧张力决定(B),触觉反馈的有无不随驱动方式改变(C)。
11. 抓一块表面光滑的不锈钢杯壁(竖直面),最关键的短板链路是?
A. 电机的 KV 值偏低
B. 小臂减速器背隙偏大
C. 数据集里没有杯子类物体
D. 缺少低延迟切向力/滑动检测触觉——法向压力不足时无法在滑落前加大捏力
💡 解析:光滑竖面的物理难点是「靠摩擦扛重力」,安全裕度 = μ·F法向 /G。抓取控制需要尽早检测到切向滑移 (哪怕几毫秒)才能立即增压防掉——这正是指尖阵列/视触觉传感器存在的意义(D)。KV/背隙/数据集都可能影响整体性能,但都不是这条任务链上「一票否决」的短板。
12. 把「拇指外展+四指各 1 屈伸+PIP/DIP 联动」配置成 6 电机灵巧手,若想让它还能做「食指单指点触屏」的精细动作,最合理的升级是?
A. 换更大转矩的小臂电机即可实现
B. 给食指单独增加屈伸驱动(或改双腱对抗),把这根手指从联动中解耦出来——欠驱动系数下降换取独立控制
C. 全部手指都换成连杆结构
D. 只提高腱绳预紧力就能独立动食指
💡 解析:「单指点触屏」要求该指屈伸与其他指运动学解耦 ,而当前方案里共享驱动/联动的手指无法单独执行——本质是自由度不足的问题(B 通过增加驱动数换独立自由度)。更大的电机(A)、更高的预紧(D)改变的是力度不是自由度;全部改连杆(C)代价大且未必保留类人外形。这个取舍正是「欠驱动省钱省重 vs 全驱动贵而准」的具体化。
13. 对比 Shadow 手(~20 电机,全驱动)与宇树 G1 手(6 电机,欠驱动腱驱),下列结论正确的是?
A. G1 手一定比 Shadow 抓得稳,因为更新
B. Shadow 手更适合消费级人形机器人,因为控制更简单
C. 定位不同:Shadow 用电机密度换「每指独立力控」的研究上限;G1 类方案用联动与自适应包络换轻量、成本与量产可行性
D. 两者的维护成本几乎相同
💡 解析:两条路线服务于两个目标函数:C 的说法与本页对比表一致——Shadow 是研究标杆(独立力控/高带宽),以重量与维护为代价;宇树等国产方案对标特斯拉路线,面向整机量产的轻量与成本。A 把新旧当成性能判据;B 恰好说反(20 电机协调是最难的);D 忽视了腱驱松弛维护的存在。
📌 本节要点速查: ①夹爪 1~2 DOF 只做 pick & place,灵巧手 6~22 DOF 为在手操作而生;②欠驱动省钱省重适合包络抓取,全驱动贵而准适合精细操作;③驱动四流派——腱驱动最轻但爱松、直驱最快最皮实但最重、连杆力大但笨、混合最贵最全,选型看力 / 速度 / 重量 / 成本 / 可靠性五维;④触觉三件套(指尖阵列、视触觉 / 电子皮肤、六维力)解决滑动检测与力控制,没有触觉的抓取是「盲抓」;⑤控制三线并进(行为克隆 / 强化学习 / 遥操作),数据靠 DexGraspNet / GRAB / Open-TeleVision / AgiBot World 支撑;⑥与 VLA 结合用「大模型出意图、灵巧手出力控」的分层架构;⑦入门从免费仿真起步:抓取生成 → 策略训练 → sim2real → 真手遥操作。
12 参考来源
以下链接均经 web_search 核实为官方 / 稳定地址,产品参数以官网最新为准。