AI消息速览

ADEPT——通过预训练与后训练加速灵巧操作

事件日期 2026-08-19 · 学术前沿 · 已接受

事件日期2026-08-19
信息日期2026-08-19
入库日期2026-08-20
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ADEPT——通过预训练与后训练加速灵巧操作

英文标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

英文关键词:Dexterous Manipulation; Reinforcement Learning; Pre-Training; Post-Training; Sim-to-Real; Visuo-Tactile Perception; Geometric Fabric

原始来源:https://arxiv.org/abs/2608.19182v1

一句话结论

ADEPT 提出一种大规模强化学习框架:先在通用物体重放置任务上预训练灵巧策略,再通过稳定的后训练配方适配下游任务,使多指机器人能从原始视觉-触觉感知直接学习长时程操作技能,并零样本从仿真迁移到真实机器人。

事件概述或研究问题

高自由度多指机器人的灵巧操作往往难以从零开始强化学习,且每个新任务都要重复学习相似技能。本文研究的是:如何通过预训练与后训练,让灵巧操作策略具备跨任务的迁移能力,并最终在真实机器人上部署。

ADEPT 的核心路线是:

  • 在通用物体重放置任务上预训练灵巧策略。
  • 将该预训练策略作为下游任务的行为先验。
  • 通过稳定后训练,避免朴素微调破坏已有能力。
  • 将后训练教师策略蒸馏为基于视觉-触觉感知的学生策略,实现零样本 sim-to-real。

方法/产品要点

  • 预训练:在通用物体重放置任务上学习灵巧操作策略,使模型具备可复用的操作先验。
  • 后训练:预训练策略可直接覆盖下游任务中的重放置阶段;但朴素 RL 微调会快速退化,因此提出稳定后训练配方。
  • 稳定后训练配方:结合行为克隆蒸馏、critic 预热、保守的 on-policy 更新。
  • 安全运动学中介:引入关节空间 Geometric Fabric,在 RL 策略与机器人之间进行中介,以安全利用完整运动学灵巧性。
  • 教师-学生蒸馏:将后训练教师策略蒸馏为感知学生策略,学生策略直接使用原始视觉-触觉感知输入。
  • 零样本 sim-to-real:学生策略在两个高自由度机器人实体上迁移到真实世界。

主要结果或产业意义

  • 在 23 DoF 的 Kuka-Allegro 平台上验证,配有双 RGB 相机。
  • 在 29 DoF 的 Flexiv-Sharpa 平台上验证,配有双 RGB 相机和五个基于视觉的触觉传感器。
  • 蒸馏后的学生策略能够零样本从仿真迁移到真实机器人,并从挑战性初始状态解决长时程任务。
  • 摘要称其灵巧操作速度达到人类水平。
  • 产业意义在于:减少每个新下游任务从零学习相同技能的成本;通过“通用预训练 + 快速后训练”加速灵巧操作任务的部署。

为什么重要

灵巧操作是机器人领域的高难度问题,涉及高自由度控制、多模态感知和长时程决策。ADEPT 提供了一条类似“预训练-后训练”范式的 RL 路线,不是简单的端到端训练,而是强调如何保留预训练技能并稳定适配新任务。

与已有相关卡片相比,本条增量信息在于:

  • 聚焦多指灵巧操作,而非零售补货或人形遥操作。
  • 提出通过通用物体重放置任务进行跨任务技能预训练。
  • 明确指出朴素 RL 微调会退化已有能力,并给出稳定后训练配方。
  • 引入关节空间 Geometric Fabric 作为策略与机器人之间的安全中介层。
  • 在两种不同高自由度硬件实体上验证零样本 sim-to-real 迁移。

局限与不确定性

  • 当前仅有摘要信息,未提供具体任务清单、成功率、训练算力等定量指标,待核实。
  • “大规模” RL 框架的具体规模、数据量和计算资源未说明,待核实。
  • “通用物体重放置任务”的定义、物体类别、评价标准未展开,待核实。
  • Geometric Fabric 的数学形式、实现细节和安全保证机制未展开,待核实。
  • 两个真实机器人平台上的实验设置、感知编码器、真实硬件细节待核实。
  • “人类水平速度”为摘要中的定性表述,具体对照标准待核实。

可用于图书/PPT/简报的角度

  • 灵巧操作的预训练与后训练范式:如何从通用技能迁移到新任务。
  • 解决 RL 微调退化问题:行为克隆蒸馏、critic 预热、保守更新。
  • 高自由度机器人的安全运动学中介层设计:Geometric Fabric 的角色。
  • 多模态感知与 sim-to-real:视觉 + 触觉传感器如何用于部署。
  • 教师-学生蒸馏与零样本迁移:从仿真训练到真实机器人的落地路径。

原始材料

  • 英文标题:ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
  • arXiv ID:2608.19182v1
  • 作者:Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
  • 发布/更新日期:2026-08-19
  • 摘要页:https://arxiv.org/abs/2608.19182v1
  • PDF:https://arxiv.org/pdf/2608.19182v1