AI消息速览

Fitted Occupancy-Ratio Evaluation without Bellman Completeness

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Fitted Occupancy-Ratio Evaluation without Bellman Completeness

一句话结论

本文提出 FORE (Fitted Occupancy-Ratio Evaluation),一种不需要 Bellman 完备性假设的离线策略评估方法,仅要求折扣占用率本身的可实现性(realizability),并通过 KL 投影递归达到收敛。

事件概述或研究问题

离线强化学习中,占用率(occupancy ratio)用于修正行为策略与目标策略之间的分布偏移,是离策略评估的核心工具。现有的原始-对偶(primal-dual)和极小极大(minimax)方法通常通过在评论家类上强制占用平衡矩来估计这些比率。本文提出一种新的拟合定点方法(FORE),旨在避免传统拟合 Q 评估所需的 Bellman 完备性或投影算子稳定性假设。

方法/产品要点

  • 方法名称:Fitted Occupancy-Ratio Evaluation (FORE)
  • 核心思想:通过伴随贝尔曼递归(adjoint Bellman recursion)刻画折扣占用率,每次迭代在一步转移数据上求解单层密度比目标函数,将伴随贝尔曼图像投影到对数比类上,并采用 KL 散度作为投影度量。
  • 近似条件:仅要求折扣占用率本身的可实现性(discounted occupancy-ratio realizability),无需 Bellman 完备性或投影算子稳定性。
  • 理论性质
    • 在总体(population)KL 投影递归中,伴随贝尔曼算子是 KL 收缩算子,从而递归向真实比率收缩。
    • 有限样本下给出了后悔界(regret bounds),收敛到 KL 散度下的对数比近似误差和统计误差之和,后者由比率假设类的复杂度决定。
  • 应用方式:拟合出的比率可直接用于:
    • 通过奖励重新加权进行直接价值估计;
    • 占用率加权的拟合 Q 评估;
    • 结合拟合比率与拟合 Q 函数的双重稳健估计。

主要结果或产业意义

  • 识别了“折扣占用率可实现性”作为离线策略评估的充分条件,无需完备性假设。
  • 理论上证明该方法在 KL 散度下具有收缩性及有限样本收敛保证。
  • 为离线强化学习中的策略评估提供了一种更弱假设、更稳健的估计框架。

为什么重要

传统拟合 Q 评估要求价值函数可实现性外加 Bellman 完备性或投影算子稳定性,这些条件在实践中往往难以验证或满足。FORE 通过直接学习占用率,将核心条件简化为比率自身的可实现性,显著降低了理论门槛,同时保留了多种下游价值估计能力。

局限与不确定性

  • 待核实:论文中未明确讨论比率假设类的选择对实际性能的影响。
  • 待核实:未提及在何种规模或类型的离线数据集上实证效果优于已有方法(摘要无实验细节)。
  • 待核实:有限样本后悔界中统计误差项与比率假设类复杂度(如 Rademacher 复杂度或 VC 维)的具体关系需查阅原文推导。

可用于图书/PPT/简报的角度

  • 主题:离线强化学习中策略评估的新范式
  • 要点:从“完备性”到“可实现性”的转变;KL 收缩驱动的递归算法;弱假设下的理论保证。
  • 可视化:将 Bellman 完备性、投影算子稳定性与仅需比率可实现性作为对比图;展示伴随贝尔曼递归的迭代收缩示意图。

原始材料

  • 英文标题:Fitted Occupancy-Ratio Evaluation without Bellman Completeness
  • 英文关键词:occupancy ratio, offline reinforcement learning, off-policy evaluation, Bellman completeness, KL contraction
  • 来源:arXiv:2607.05375v1,作者 Lars van der Laan, Nathan Kallus,发布时间 2026-07-06,类别 stat.ML, cs.LG
  • URL:https://arxiv.org/abs/2607.05375v1