AI消息速览

物理智能公司发布能从经验中学习的视觉-语言-动作模型 π*0.6

事件日期 2025-11-17 · 产业观察 · 已接受

事件日期2025-11-17
信息日期2025-11-17
入库日期2026-07-08
通道产业观察
状态已接受
来源physicalintelligence.company

知识卡片:物理智能公司发布能从经验中学习的视觉-语言-动作模型 π*0.6

英文标题: A VLA that Learns from Experience
英文关键词: robotic learning, reinforcement learning, vision-language-action, industry
原始来源: Physical Intelligence Blog Post


一句话结论

Physical Intelligence 开发了 Recap(基于优势条件策略的强化学习与纠正经验)方法,将模仿学习、专家纠正和强化学习结合,训练出 π*0.6 模型,使机器人能在真实世界中以高鲁棒性和高吞吐量完成制作浓缩咖啡、组装盒子和折叠衣物等复杂任务,在关键任务上吞吐量提升超过 2 倍、失败率降低 2 倍以上。


事件概述

2025 年 11 月 17 日,Physical Intelligence 发布博客,介绍了其最新 VLA(视觉-语言-动作)模型 π0.6 以及用 Recap 方法进行强化学习训练后得到的 π*0.6 模型。该模型基于 5B 参数量的视觉-语言模型骨干,并新增动作专家模块(action expert)。通过在真实机器人上执行数小时自主训练,π*0.6 在多项实际应用中达到接近人类操作员的可靠性水平。


方法/产品要点

Recap(RL with Experience & Corrections via Advantage-conditioned Policies)

Recap 是一个三阶段训练流程:

  1. 模仿学习(Demonstration):利用人提供的演示数据初始化策略模型(即 VLA)。这是当前多数机器人学习方法的起点,但仅靠模仿会导致累积错误。
  2. 专家纠正(Coaching):当机器人在自主执行中犯错时,专家远程操作员实时接管并给出纠正演示。这为策略实际遇到的错误情境提供了针对性监督信号。
  3. 强化学习(Practice via RL):通过自主经验继续改进。核心挑战是信用分配(credit assignment)——判断哪些动作导致了后续的成功或失败。Recap 训练一个价值函数(value function) 来预测当前状态到任务完成所需的步骤数(或成功概率);然后利用价值函数的变化量(即优势 advantage)作为条件输入到策略模型中,让模型学习执行高优势动作。执行时只需指定期望的高优势水平即可获得比训练数据更优的行为。

π0.6 模型架构

  • 基于 5B 参数量的视觉-语言模型骨干。
  • 额外添加动作专家(Action Expert),输出机器人动作。
  • 支持异构提示(heterogeneous prompts),包括文本指令、质量注释以及(在使用 Recap 时)期望的动作优势值。
  • 预训练数据包含多种任务:铺床、点蜡烛、清理猫砂、制作咖啡、组装盒子、清理厨房、换灯泡、整理餐桌等。

主要结果

任务 训练前(仅模仿) 训练后(Recap)
制作多种浓缩咖啡饮品 可靠性与吞吐量较低 从凌晨 5:30 到晚上 11:30 连续运行无中断
折叠 50 种不同衣物 在新环境中易出错 在新家连续数小时折叠未见过的衣物
为真实巧克力工厂组装并贴标签的 59 个盒子 无法稳定完成 不间断完成全部 59 个盒子的组装和贴标
  • 吞吐量(throughput)在部分困难任务上提升超过 2 倍
  • 失败率(failure rate)降低 2 倍或更多

为什么重要

机器人学习中一个根本问题是:仅靠模仿学习的 VLA 模型会产生微小错误,并因与物理环境交互而累积成灾难性失败,导致可靠性远低于人类期望。Recap 首次在真实世界大规模任务上展示了通过自主经验强化学习 + 专家纠正的结合可以系统性地解决这一累积误差问题,使通用型 VLA 达到接近于实际部署的鲁棒性水平。这为机器人从“演示学习”走向“自主练习”提供了可扩展的范例。


局限与不确定性

  • 待核实:博客未详细讨论 Recap 方法的局限性,例如对专家远程操作员的依赖程度、价值函数训练所需的样本数量、模型在更广泛任务上的泛化能力等。
  • 待核实:π*0.6 模型的具体训练计算成本、部署硬件要求以及是否存在安全/误操作风险未在原文中说明。
  • 待核实:原文提及的“失败率降低 2 倍”和“吞吐量提升超过 2 倍”的具体测量方式和统计显著性未提供详细数据。
  • 待核实:Recap 方法是否适用于非接触式或高精度操控任务(如微装配、手术)尚不清楚。

可用于图书/PPT/简报的角度

  1. 机器人学习的进化路径:从“看人演示”到“教练纠正”再到“自我练习”的类比,适合展示机器人模仿与强化学习的结合。
  2. 价值函数与信用分配的直观解释:可以用下棋的比喻(当前局面预测胜率)来讲解机器人如何知道“是哪一步导致了失败”。
  3. 对比 LLM 与机器人策略的差异:静态输出模型(如 LLM)和交互式控制策略(如 VLA)在误差累积上的根本区别,帮助非技术读者理解机器人 AI 的独特挑战。
  4. 产业落地意义:连续 18 小时制作咖啡、工厂包装盒自动化等实例说明 AI 机器人正从实验室走向真实场景。

原始材料

  • 博客标题: A VLA that Learns from Experience
  • 发布日期: 2025 年 11 月 17 日
  • 作者列表: Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Kevin Black, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Jared DiCarlo, Danny Driess, Michael Equi, Adnan Esmail, Yunhao Fang, Chelsea Finn, Catherine Glossop, Thomas Godden, Ivan Goryachev, Lachy Groom, Hunter Hancock, Karol Hausman, Gashon Hussein, Brian Ichter, Szymon Jakubczak, Rowan Jen, Tim Jones, Ben Katz, Liyiming Ke, Chandra Kuchi, Marinda Lamb, Devin LeBlanc, Sergey Levine, Adrian Li-Bell, Yao Lu, Vishnu Mano, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Allen Z. Ren, Charvi Sharma, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, Will Stoeckle, Alex Swerdlow, James Tanner, Marcel Torne, Quan Vuong, Anna Walling, Haohuan Wang, Blake Williams, Sukwon Yoo, Lili Yu, Ury Zhilinsky, Zhiyuan Zhou
  • 原始链接: https://www.physicalintelligence.company/blog/pistar06
  • 模型卡片: 随附的 π0.6 模型卡(model card)提供了更详细的架构说明。