|
NVIDIA & 密歇根大学 ADEPT:预训练+后训练,让高自由度灵巧手实现零样本Sim-to-Real插孔
作者:系统管理员
发布日期:2026-09-29
浏览次数:
一、研究背景:为什么高自由度灵巧操作这么难?多指手臂-手系统结合了高维状态/动作空间与接触丰富的交互。即使借助大规模GPU并行仿真,从零训练RL策略也极其困难:
论文指出,失败并非因为预训练不够强,而是迁移过程中存在观测空间不匹配、价值估计错位、早期PPO更新导致策略漂移过大。因此,问题不是“要不要预训练”,而是“如何稳定地后训练”。 二、问题定义:预训练与后训练之间的鸿沟论文将灵巧操作建模为离散时间MDP,动作空间为23维(7臂+16手)。预训练任务(reposing)与下游任务(FMB插孔)共享动作空间,但观测空间、动力学和奖励不同。下游观测增加了容器位姿和物体-容器接触力。 核心挑战:
三、技术方案:三阶段预训练+后训练+蒸馏3.1 预训练:通用重摆物体任务在仿真中,每次episode随机生成16种基元形状(圆柱、长方体、球、圆锥)之一,策略需完成到达、抓取、抬起、手内重定向、运输、重摆到目标位姿的完整序列。
预训练教师在下游任务的“重摆”阶段零样本成功率:ADR 20时约72%(Kuka-Allegro),ADR 50插孔目标时降至0%。 3.2 后训练:结构化RL适配直接PPO微调会崩溃,ADEPT采用三步: 步骤1:BC actor蒸馏用下游观测空间,通过监督模仿将预训练actor蒸馏到新actor,训练40k迭代。BC rollout使用学生-教师混合策略,保持数据分布接近学生部署状态。 步骤2:Critic预热冻结actor,用下游奖励训练新critic,对齐价值估计。冻结期间actor的log-std固定为-2,保持探索狭窄。训练20个PPO迭代(约1M环境步)。 步骤3:保守PPO解冻actor,联合更新。Actor学习率从1e-3降至1e-5,PPO clip从0.2收紧至0.05,critic学习率保持5e-5。目标位姿直接设为最终插孔目标(ADR 50),ADR随机化继续推进。 消融结果:降低actor学习率是防止崩溃的必要条件;BC和critic预热提升成功率和稳定性;收紧clip影响不大。 3.3 全关节构型空间几何Fabric在策略与机器人之间放置几何fabric(二阶自治系统),强制硬件约束(关节限位、自碰撞、环境碰撞),提供平滑二阶动作先验。 关键创新:在全关节构型空间驱动fabric,而非之前工作限制在PCA抓取子空间。策略输出23维相对关节增量,映射到Cspace目标,暴露完整23自由度运动学灵巧性。同一fabric实例在仿真和真机运行,最小化控制器差距。 3.4 师生蒸馏:从状态教师到视觉/视触觉学生后训练得到状态教师后,蒸馏为可部署学生:
触觉感知:Flexiv-Sharpa使用五指尖视触觉传感器。仿真中按TacMap生成几何一致的穿透深度图,与真实传感器共享表示。二值接触图+深度图经每指CNN编码,通过SaTA风格FiLM条件于指尖位置进行空间锚定,再与RGB、本体感觉融合。 ADEPT 在两套本体上把整串动作当成一个连续行为做完,上排是 Kuka-Allegro 纯视觉碗碟上架,下排是 Flexiv-Sharpa 靠视触觉完成销钉插入 下游插孔任务的 L 形目标路径,灰色小球是 ADR 级别对应的航点,第 0 级只要求把销钉抬到板子上方,第 50 级才要求真的插进孔里 真机这一侧的全部家当,两台机器人各配两路 RealSense 相机,每次试验的初始摆放和光照都不一样 四、实验结果硬件:
任务:FMB星形插孔、方形/圆形插孔(最难几何)、盘子架放置。 零样本真机结果:
触觉的关键作用:视觉-only学生在Flexiv-Sharpa上仅3/10,主要失败模式不是抓取执行,而是抓取置信度——无法判断抓取是否成功,反复松开、掉落、重抓。加入指尖触觉后,抓取和抬起每次成功,可靠性贯穿重定向、对齐和插入。 速度:多指策略每轮5-10秒完成,FMB平行夹爪流水线需20-70秒,加速2-14倍。 自然抓取涌现:重摆预训练使策略收敛到自然抓取模式(手指包裹、多接触闭合);从零训练的策略则产生仅用食指和小指等异常抓取。后训练会消除任务不对齐的抓取(如从底部抓取),保留自然指包裹行为。 五、技术创新点归纳
六、总结ADEPT的核心贡献在于:将灵巧操作的学习范式从“每个任务从零训练”转变为“通用预训练+稳定后训练”。预训练提供可复用的运动先验,后训练在保留先验的同时适配接触丰富任务,蒸馏课程将状态教师转化为可部署的感知学生。在两种高自由度平台上,ADEPT实现了零样本Sim-to-Real长时程插孔,速度达人类水平,触觉感知显著提升可靠性。 论文的局限:感知仍是蒸馏瓶颈,遮挡下不对称物体朝向估计错误;快速臂运动时圆形指尖与圆边接触斑小导致抓取不稳定;预训练分布需进一步扩展到手内操作、工具使用、杂乱场景和双臂。 论文信息 标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning 作者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa 机构:NVIDIA、密歇根大学 项目页:adept-dexterity.github.io |


