AI消息速览

学习何时停止——面向连续控制的前缀最优动态扩散策略

事件日期 2026-08-05 · 学术前沿 · 已接受

事件日期2026-08-05
信息日期2026-08-05
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:学习何时停止——面向连续控制的前缀最优动态扩散策略

英文标题:Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

英文关键词:Diffusion Policies; Continuous Control; Dynamic Computation; Early Stopping; Prefix Value Function; POGP

一句话结论

本文提出前缀最优生成策略(POGP),通过在学习扩散策略的去噪链上定义前缀值函数,让模型在测试时学会“何时停止”去噪:在四个 MuJoCo 连续控制任务上,相比 12 个基线,POGP 约减少 2.7 倍所需的去噪迭代次数,同时保持接近完整任务性能;与最先进的动态扩散基线相比,最终任务性能还提升约 3.5%。

事件概述或研究问题

扩散策略(Diffusion Policies)是连续控制中表达能力很强的策略类别,但迭代去噪过程带来明显计算瓶颈。不同动作样本的难度不同,如何依据动作难度自适应调整去噪步数,同时不损害任务表现,是本文要解决的核心问题。

方法/产品要点

  • POGP(Prefix-Optimal Generative Policies):一种学习式自适应去噪框架。
  • 前缀值函数(Prefix Value Function):在去噪链的每一个中间步骤上学习一个值函数,通过类似贝尔曼递归(Bellman-style recursion)的方式在去噪过程中向后传播价值。
  • 该前缀值函数有两个用途:
    1. 作为辅助训练目标,促使中间去噪输出本身成为高质量动作;
    2. 作为测试时停止规则,当继续去噪不太可能产生有意义改进时提前终止。
  • 由此,去噪步数不再固定,而是针对每个动作样本动态决策。

主要结果或产业意义

  • 在四个 MuJoCo 环境、与 12 个基线比较中,POGP 将所需去噪迭代次数减少约 2.7 倍,同时保持接近完整的任务性能。
  • 与最先进的动态扩散基线相比,前缀训练使最终任务性能额外提升约 3.5%。
  • 结果说明:对中间去噪步进行监督不仅有助于自适应早停,还能作为辅助目标改善最终策略质量。
  • 产业意义:扩散策略的高推理成本是其在实时控制/机器人部署中的关键障碍,自适应去噪步数可显著降低延迟与计算开销,同时不牺牲性能,甚至可能提升性能。

为什么重要

扩散策略在连续控制中潜力巨大,但迭代去噪的实时性限制阻碍落地。本文的核心贡献是把“停止去噪”本身变成可学习的问题:用值函数来预测每一步是否还有价值。这种思路不仅能加速现有扩散策略,还表明“中间过程的监督”本身是一种有效的策略优化手段,与只关注最终输出的训练目标形成对比。

局限与不确定性

  • 本卡片仅依据 arXiv 摘要生成,未获取论文全文;具体环境名称、12 个基线的详细构成、停止规则阈值、计算量具体度量、训练设置等均待核实
  • 摘要未说明 POGP 在真实机器人或非仿真连续控制任务上的表现,仿真到现实的迁移效果待核实
  • 2.7 倍与 3.5% 的量化结果来自论文报告,独立复现情况待核实
  • 自适应早停可能带来额外决策开销,该开销是否已计入总体加速,待核实

与既有脉络的关系

已有相关卡片《基于最优控制与后验误差估计的神经网络深度自适应》关注神经网络深度维度的自适应计算;本卡片将“自适应计算”思想延伸至扩散策略的去噪时间维度,并引入了在去噪链上学习前缀值函数的新机制,可作为该方向的最新增量。

可用于图书/PPT/简报的角度

  • 主题:学会“什么时候该停”:动态计算在生成模型中的价值。
  • 可从“固定预算 vs 自适应计算”切入,用扩散策略的去噪过程作为案例。
  • 强调双重收益:计算减少 + 最终性能提升,说明对中间步骤的监督本身就是一种正则化/辅助训练策略。
  • 可配图演示去噪步数在不同轨迹/动作上的分布差异,说明“动作难度”如何影响最优去噪长度。

原始材料

  • 英文标题:Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
  • arXiv ID:2608.05084v1
  • 作者:Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis
  • 提交/更新日期:2026-08-05(arXiv 元数据)
  • 主要分类:cs.LG;相关分类:cs.LG, cs.RO
  • 摘要链接:https://arxiv.org/abs/2608.05084v1
  • PDF 链接:https://arxiv.org/pdf/2608.05084v1