知识卡片:ADEPT——通过预训练与后训练加速灵巧操作
英文标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
英文关键词:Dexterous Manipulation; Reinforcement Learning; Pre-Training; Post-Training; Sim-to-Real; Visuo-Tactile Perception; Geometric Fabric
原始来源:https://arxiv.org/abs/2608.19182v1
一句话结论
ADEPT 提出一种大规模强化学习框架:先在通用物体重放置任务上预训练灵巧策略,再通过稳定的后训练配方适配下游任务,使多指机器人能从原始视觉-触觉感知直接学习长时程操作技能,并零样本从仿真迁移到真实机器人。
事件概述或研究问题
高自由度多指机器人的灵巧操作往往难以从零开始强化学习,且每个新任务都要重复学习相似技能。本文研究的是:如何通过预训练与后训练,让灵巧操作策略具备跨任务的迁移能力,并最终在真实机器人上部署。
ADEPT 的核心路线是:
- 在通用物体重放置任务上预训练灵巧策略。
- 将该预训练策略作为下游任务的行为先验。
- 通过稳定后训练,避免朴素微调破坏已有能力。
- 将后训练教师策略蒸馏为基于视觉-触觉感知的学生策略,实现零样本 sim-to-real。
方法/产品要点
- 预训练:在通用物体重放置任务上学习灵巧操作策略,使模型具备可复用的操作先验。
- 后训练:预训练策略可直接覆盖下游任务中的重放置阶段;但朴素 RL 微调会快速退化,因此提出稳定后训练配方。
- 稳定后训练配方:结合行为克隆蒸馏、critic 预热、保守的 on-policy 更新。
- 安全运动学中介:引入关节空间 Geometric Fabric,在 RL 策略与机器人之间进行中介,以安全利用完整运动学灵巧性。
- 教师-学生蒸馏:将后训练教师策略蒸馏为感知学生策略,学生策略直接使用原始视觉-触觉感知输入。
- 零样本 sim-to-real:学生策略在两个高自由度机器人实体上迁移到真实世界。
主要结果或产业意义
- 在 23 DoF 的 Kuka-Allegro 平台上验证,配有双 RGB 相机。
- 在 29 DoF 的 Flexiv-Sharpa 平台上验证,配有双 RGB 相机和五个基于视觉的触觉传感器。
- 蒸馏后的学生策略能够零样本从仿真迁移到真实机器人,并从挑战性初始状态解决长时程任务。
- 摘要称其灵巧操作速度达到人类水平。
- 产业意义在于:减少每个新下游任务从零学习相同技能的成本;通过“通用预训练 + 快速后训练”加速灵巧操作任务的部署。
为什么重要
灵巧操作是机器人领域的高难度问题,涉及高自由度控制、多模态感知和长时程决策。ADEPT 提供了一条类似“预训练-后训练”范式的 RL 路线,不是简单的端到端训练,而是强调如何保留预训练技能并稳定适配新任务。
与已有相关卡片相比,本条增量信息在于:
- 聚焦多指灵巧操作,而非零售补货或人形遥操作。
- 提出通过通用物体重放置任务进行跨任务技能预训练。
- 明确指出朴素 RL 微调会退化已有能力,并给出稳定后训练配方。
- 引入关节空间 Geometric Fabric 作为策略与机器人之间的安全中介层。
- 在两种不同高自由度硬件实体上验证零样本 sim-to-real 迁移。
局限与不确定性
- 当前仅有摘要信息,未提供具体任务清单、成功率、训练算力等定量指标,待核实。
- “大规模” RL 框架的具体规模、数据量和计算资源未说明,待核实。
- “通用物体重放置任务”的定义、物体类别、评价标准未展开,待核实。
- Geometric Fabric 的数学形式、实现细节和安全保证机制未展开,待核实。
- 两个真实机器人平台上的实验设置、感知编码器、真实硬件细节待核实。
- “人类水平速度”为摘要中的定性表述,具体对照标准待核实。
可用于图书/PPT/简报的角度
- 灵巧操作的预训练与后训练范式:如何从通用技能迁移到新任务。
- 解决 RL 微调退化问题:行为克隆蒸馏、critic 预热、保守更新。
- 高自由度机器人的安全运动学中介层设计:Geometric Fabric 的角色。
- 多模态感知与 sim-to-real:视觉 + 触觉传感器如何用于部署。
- 教师-学生蒸馏与零样本迁移:从仿真训练到真实机器人的落地路径。
原始材料
- 英文标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
- arXiv ID:2608.19182v1
- 作者:Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
- 发布/更新日期:2026-08-19
- 摘要页:https://arxiv.org/abs/2608.19182v1
- PDF:https://arxiv.org/pdf/2608.19182v1