AI消息速览

可解释强化学习:基于物理感知策略蒸馏

事件日期 2026-07-27 · 学术前沿 · 已接受

事件日期2026-07-27
信息日期2026-07-27
入库日期2026-07-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:可解释强化学习:基于物理感知策略蒸馏

一句话结论

本文提出一种基于物理感知特征与“噪声专家轨迹”数据生成的策略蒸馏框架,将连续控制深度强化学习(TD3)策略蒸馏为浅层决策树,在保持倾倒摆基准任务性能等价的同时,实现全局与局部可解释性,但代价是引入了高频Bang-Bang控制与稳定的双峰极限环。

研究问题

在机器人、汽车工程等安全关键领域,深度强化学习(DRL)的黑箱特性阻碍了监管合规与人机信任。如何使高性能连续控制DRL系统具备可解释性,同时维持任务性能?

方法/产品要点

  • 教师模型:Twin Delayed DDPG(TD3),作为不透明的连续控制专家策略。
  • 学生模型:基于浅层决策树的解释性替代模型。
  • 关键组件:自定义物理感知特征(自定义物理感知特征的具体定义待核实)与“Noisy Oracle Rollouts”噪声专家轨迹数据生成方法。
  • 蒸馏过程:从教师策略中收集数据集,训练决策树学生,使其达到与专家等价的性能。

主要结果或产业意义

  • 性能等价:蒸馏后的决策树在倾倒摆基准上达到与TD3教师相同的性能。
  • 控制理论分析揭示的根本权衡:从连续控制转向离散规则控制会引入高频Bang-Bang驱动(高频开关动作)以及稳定的双峰极限环。
  • 稳定性:仿真结果表明,系统在有界输入有界输出(BIBO)意义上保持稳定。
  • 可解释性:决策树提供了全局(整体规则)和局部(单步决策解释)的可解释性。

为什么重要

  • 填补了高精度连续控制DRL可解释性方法的空白,为安全关键系统的认证提供可能。
  • 揭示了可解释蒸馏过程中必然出现的高频开关控制与极限环现象,为后续研究提供了理论边界。
  • 与已有相关卡片(如通过直接策略蒸馏实现弱到强泛化)不同,本文聚焦于物理感知特征设计及控制理论层面分析蒸馏带来的动态行为变化。

局限与不确定性

  • 仅在一个简单的倾倒摆基准上验证,更复杂环境(如高维机器人、自动驾驶)的适用性待核实。
  • 决策树深度与可解释性/性能的权衡细节未详细说明。
  • 噪声专家轨迹生成的具体参数与泛化能力待核实。
  • 是否在真实物理系统上验证待核实。

可用于图书/PPT/简报的角度

  • 安全人工智能与可解释机器学习案例:如何将深度强化学习“开箱”为可理解规则。
  • 控制理论与机器学习的交叉:从连续到离散控制的代价(极限环、Bang-Bang控制)。
  • 策略蒸馏教程中的实例:物理感知特征设计如何提升蒸馏保真度。

原始材料

  • URL: https://arxiv.org/abs/2607.24672v1
  • Track: academic
  • Topics: foundation-model
  • Manual title: Explainable Reinforcement Learning via Physics-Aware Policy Distillation
  • 英文关键词: 待核实(摘要中未明确列出,但可归纳为:Explainable Reinforcement Learning, Policy Distillation, Physics-Aware, Decision Tree, TD3, Inverted Pendulum)