AI消息速览

SUN:面向语言控制的“控制到学习再到真实”策略的持久化程序(待核实)

事件日期 2026-08-31 · 学术前沿 · 已接受

事件日期2026-08-31
信息日期2026-08-31
入库日期2026-09-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:SUN:面向语言控制的“控制到学习再到真实”策略的持久化程序(待核实)

一句话结论

(基于摘要,正文待核实)Kuafu 系统利用大视觉语言系统自动合成“语义统一(SUN)程序”,将任务语义同时编译为 MPC 代价、RL 奖励、转移守卫等,在 9 项操作任务上宏平均成功率达 82.03%,显著优于稀疏奖励(35.67%)与 Stage-BC(24.75%)基线;在无人工演示、无手工稠密奖励的条件下,实现了从控制到学习再到真实机器人的策略迁移。

事件概述或研究问题

(研究问题)在长时程操控任务中,基于模型的控制(MPC)与学习策略之间存在语义断裂:控制算法按明确目标执行,学习算法将行为摊销为反应式策略,但已有流程常丢失任务语义,导致奖励函数需要手工设计,学习到的行为也容易偏离控制验证过的结果。

(方法概述)论文提出 SUN 程序,把几何与接触关系定义为带类型的可执行程序,并编译为对齐的 MPC 代价、满足谓词、RL 奖励、转移守卫和诊断信息。系统 Kuafu 使用大视觉语言系统从语言和场景语义自动生成 SUN 程序,先通过 MPC 做可行性筛选,再在保留语义的同时训练阶段条件策略。

方法/产品要点

  • SUN 程序(Semantically UNified Programs):带类型可执行程序,几何/接触关系只定义一次,即可编译到多种下游组件。
  • 编译产物:对齐的 MPC 成本函数、满足谓词、强化学习奖励、状态转移守卫、诊断信息。
  • Kuafu 系统:输入语言指令与场景语义,借助大视觉语言系统自动合成 SUN 程序。
  • 筛选流程:用 MPC 对候选 SUN 程序做可行性筛选,再进入策略训练。
  • 训练目标:阶段条件策略,保留任务语义,实现从控制到学习的有效摊销。

主要结果或产业意义

  • 任务性能:在 9 项任务上宏平均成功率为 82.03%,稀疏奖励基线为 35.67%,Stage-BC 为 24.75%。
  • 数据效率:在 8192 路并行规模下,每小时人工遥操作产生的成功轨迹时间达到对比方案的 10.57 倍。
  • 真实机器人迁移:每任务 500 条轨迹下,DP3 策略在仿真中成功率为 46.0%(对比基线 22.4%),在物理 Franka 与 Kinova 机器人上为 34.7%。
  • 产业意义:不需要人工演示或手工稠密奖励,即可用仿真筛选过的任务语义来训练稳健策略,有望降低长时程操作任务对人工奖励工程和数据采集的依赖。

为什么重要

  • 本研究提出了“控制与学习共享同一份语义程序”的设计思路,可能缓解手工奖励设计中的语义偏离问题。
  • 相比已有相关卡片(扩散策略去噪效率、物理感知四旋翼强化学习),本条增量在于:用可编译程序显式连接 MPC 与 RL,并利用大视觉语言系统自动合成,打通了从语言/场景到真实策略的链路。
  • 在无演示条件下达到真实机器人可观成功率,说明“仿真筛选 + 语义保留”可以替代部分人工奖励工程和数据采集。

局限与不确定性

  • 本文原始正文未能抓取,以上内容全部基于摘要元数据生成,具体实验设计、基线设置、任务难度等均待核实。
  • “82.03%”“10.57 倍”“46.0%/34.7%”等数字均出自摘要,但成功率定义、轨迹筛选标准和物理实验次数未验证,待核实。
  • 大视觉语言系统自动合成 SUN 程序的准确率、失败模式、人工干预程度未在摘要中展开,待核实。
  • SUN 程序是否适用于非语言可描述的任务,以及 MPC 筛选和奖励编译的泛化能力,待核实。

可用于图书/PPT/简报的角度

  • 图解:展示“几何/接触关系”如何一次定义、多处编译(MPC/RL/守卫/诊断),强调“语义复用”。
  • 对比:SUN vs 稀疏奖励 vs Stage-BC 的成功率条形图,并配以“无需人工奖励函数”的说明。
  • 故事线:从“控制验证语义”到“学习吸收语义”再到“真实机器人部署”,说明大视觉语言系统可以充当“程序合成器”。

与既有脉络的关系

  • 既有卡片分别处理扩散策略的采样效率与四旋翼的物理感知强化学习;本条则关注“任务语义”在控制与学习之间的可迁移表达。
  • 若将本方法视为“上层任务规划/程序合成”与“底层策略学习”之间的接口,它可与已有扩散策略、强化学习控制器形成互补,而非重复。

原始材料

  • 英文标题:SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies
  • 英文关键词:SUN Programs; Language-Grounded Control; Model Predictive Control; Reinforcement Learning; Simulation-to-Real
  • 来源:arXiv:2608.31167v1
  • URL: https://arxiv.org/abs/2608.31167v1