NVIDIA & 密歇根大学 ADEPT:预训练+后训练,让高自由度灵巧手实现零样本Sim-to-Real插孔
作者:系统管理员 发布日期:2026-09-29 浏览次数:

导语:高自由度手臂-手系统的灵巧操作,长期受困于两个难题:从零强化学习难以发现有效行为,而预训练策略在迁移到新任务时又会迅速崩溃。NVIDIA与密歇根大学联合提出ADEPT框架,通过“通用重摆物体预训练 + 结构化后训练”的组合,在23自由度Kuka-Allegro和29自由度Flexiv-Sharpa上实现了从原始视觉(及视触觉)到长时程插孔任务的零样本Sim-to-Real迁移。执行速度达到人类水平,每轮5-10秒,比FMB平行夹爪流水线快2-14倍。。

图片

一、研究背景:为什么高自由度灵巧操作这么难?

多指手臂-手系统结合了高维状态/动作空间与接触丰富的交互。即使借助大规模GPU并行仿真,从零训练RL策略也极其困难:

  • 稀疏奖励:任务特定奖励稀疏,有用行为难以被发现。
  • 任务不可复用:每个新任务都要重新学习抓取、抬起、重定向等低级技能。
  • 朴素微调崩溃:预训练策略在迁移到下游任务时,标准PPO微调会在少数更新内破坏预训练行为,成功率直接归零。

论文指出,失败并非因为预训练不够强,而是迁移过程中存在观测空间不匹配、价值估计错位、早期PPO更新导致策略漂移过大。因此,问题不是“要不要预训练”,而是“如何稳定地后训练”。

二、问题定义:预训练与后训练之间的鸿沟

论文将灵巧操作建模为离散时间MDP,动作空间为23维(7臂+16手)。预训练任务(reposing)与下游任务(FMB插孔)共享动作空间,但观测空间、动力学和奖励不同。下游观测增加了容器位姿和物体-容器接触力。

核心挑战:

  1. 预训练策略能零样本完成下游任务的“重摆”阶段,但无法直接完成接触丰富的插入。
  2. 直接PPO微调会迅速摧毁预训练行为。
  3. 如何让策略在保留预训练技能的同时,学习新的接触丰富行为?

三、技术方案:三阶段预训练+后训练+蒸馏

3.1 预训练:通用重摆物体任务

在仿真中,每次episode随机生成16种基元形状(圆柱、长方体、球、圆锥)之一,策略需完成到达、抓取、抬起、手内重定向、运输、重摆到目标位姿的完整序列。

  • 使用PPO,非对称actor-critic。
  • 域随机化(ADR)在线课程:重力从0退火到-9.81 m/s2,物体尺度0.5-1.0×。
  • 采用Population-Based Training搜索PPO超参数。
  • 物体用点云表示,提升下游零样本泛化。

预训练教师在下游任务的“重摆”阶段零样本成功率:ADR 20时约72%(Kuka-Allegro),ADR 50插孔目标时降至0%。

3.2 后训练:结构化RL适配

直接PPO微调会崩溃,ADEPT采用三步:

步骤1:BC actor蒸馏用下游观测空间,通过监督模仿将预训练actor蒸馏到新actor,训练40k迭代。BC rollout使用学生-教师混合策略,保持数据分布接近学生部署状态。

步骤2:Critic预热冻结actor,用下游奖励训练新critic,对齐价值估计。冻结期间actor的log-std固定为-2,保持探索狭窄。训练20个PPO迭代(约1M环境步)。

步骤3:保守PPO解冻actor,联合更新。Actor学习率从1e-3降至1e-5,PPO clip从0.2收紧至0.05,critic学习率保持5e-5。目标位姿直接设为最终插孔目标(ADR 50),ADR随机化继续推进。

消融结果:降低actor学习率是防止崩溃的必要条件;BC和critic预热提升成功率和稳定性;收紧clip影响不大。

3.3 全关节构型空间几何Fabric

在策略与机器人之间放置几何fabric(二阶自治系统),强制硬件约束(关节限位、自碰撞、环境碰撞),提供平滑二阶动作先验。

关键创新:在全关节构型空间驱动fabric,而非之前工作限制在PCA抓取子空间。策略输出23维相对关节增量,映射到Cspace目标,暴露完整23自由度运动学灵巧性。同一fabric实例在仿真和真机运行,最小化控制器差距。

3.4 师生蒸馏:从状态教师到视觉/视触觉学生

后训练得到状态教师后,蒸馏为可部署学生:

  • 学生输入:本体感觉、fabric状态、两路RGB图像;Flexiv-Sharpa额外五路指尖触觉图。
  • 使用DAgger,教师提供每步动作目标。
  • 辅助损失:8关键点物体位姿预测,监督共享视觉特征。
  • 两阶段课程:
    • 阶段1:用预训练重定向教师,在感知密集型替代任务上蒸馏,学生只学感知(检测、位姿预测)。
    • 阶段2:从阶段1检查点初始化,在下游插孔任务上继续蒸馏。

触觉感知:Flexiv-Sharpa使用五指尖视触觉传感器。仿真中按TacMap生成几何一致的穿透深度图,与真实传感器共享表示。二值接触图+深度图经每指CNN编码,通过SaTA风格FiLM条件于指尖位置进行空间锚定,再与RGB、本体感觉融合。

图片

ADEPT 在两套本体上把整串动作当成一个连续行为做完,上排是 Kuka-Allegro 纯视觉碗碟上架,下排是 Flexiv-Sharpa 靠视触觉完成销钉插入

图片

下游插孔任务的 L 形目标路径,灰色小球是 ADR 级别对应的航点,第 0 级只要求把销钉抬到板子上方,第 50 级才要求真的插进孔里

图片

真机这一侧的全部家当,两台机器人各配两路 RealSense 相机,每次试验的初始摆放和光照都不一样

四、实验结果

硬件:

  • Kuka iiwa7 + Allegro四指手,23 DoF,两路RGB。
  • Flexiv Rizon + Sharpa五指手,29 DoF,两路RGB + 五指尖触觉。

任务:FMB星形插孔、方形/圆形插孔(最难几何)、盘子架放置。

零样本真机结果:

  • Kuka-Allegro视觉学生:星形5/10,方形/圆形3/10,盘子放置6/10。
  • Flexiv-Sharpa视触觉学生:方形/圆形8/10。

触觉的关键作用:视觉-only学生在Flexiv-Sharpa上仅3/10,主要失败模式不是抓取执行,而是抓取置信度——无法判断抓取是否成功,反复松开、掉落、重抓。加入指尖触觉后,抓取和抬起每次成功,可靠性贯穿重定向、对齐和插入。

速度:多指策略每轮5-10秒完成,FMB平行夹爪流水线需20-70秒,加速2-14倍。

自然抓取涌现:重摆预训练使策略收敛到自然抓取模式(手指包裹、多接触闭合);从零训练的策略则产生仅用食指和小指等异常抓取。后训练会消除任务不对齐的抓取(如从底部抓取),保留自然指包裹行为。

五、技术创新点归纳

  1. 通用重摆预训练任务:作为可复用初始化,摊销预训练成本,下游边际成本仅3B步。 
  2. 结构化后训练配方:BC蒸馏+critic预热+保守PPO,解决预训练策略迁移崩溃问题。 
  3. 全Cspace几何Fabric:暴露完整高自由度运动学,同时保证硬件安全,支持手内重定向和指步。 
  4. 两阶段蒸馏课程:分离感知学习与策略学习,解决联合训练时的目标冲突。 
  5. 视触觉Sim-to-Real:TacMap穿透深度图+SaTA FiLM空间锚定,实现触觉信号零样本迁移。 
  6. 无演示、无位姿估计器:直接从原始RGB/触觉完成长时程pick-reorient-insert。

六、总结

ADEPT的核心贡献在于:将灵巧操作的学习范式从“每个任务从零训练”转变为“通用预训练+稳定后训练”。预训练提供可复用的运动先验,后训练在保留先验的同时适配接触丰富任务,蒸馏课程将状态教师转化为可部署的感知学生。在两种高自由度平台上,ADEPT实现了零样本Sim-to-Real长时程插孔,速度达人类水平,触觉感知显著提升可靠性。

论文的局限:感知仍是蒸馏瓶颈,遮挡下不对称物体朝向估计错误;快速臂运动时圆形指尖与圆边接触斑小导致抓取不稳定;预训练分布需进一步扩展到手内操作、工具使用、杂乱场景和双臂。

论文信息

标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

作者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

机构:NVIDIA、密歇根大学

项目页:adept-dexterity.github.io

文章来源:CAAI认知系统与信息处理专委会