AI消息速览

分布时序差分学习中的在线推断

事件日期 2026-08-14 · 学术前沿 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:分布时序差分学习中的在线推断

英文标题:Online Inference in Distributional Temporal-Difference Learning

英文关键词:Distributional Temporal-Difference Learning; Online Statistical Inference; Bootstrap; Return Distribution; Polyak-Ruppert Averaging; CVaR; Expected Shortfall; Expectiles; Quantiles

一句话结论

本文在非参数分布时序差分学习框架下证明,基于单条马尔可夫轨迹估计回报分布时,Polyak-Ruppert 平均估计量的根号 T 误差弱收敛到 Cramér 空间中的中心高斯随机元;条件自助法也有同一极限。该结果支撑方差、CVaR、期望短缺、expectiles 等光滑泛函,以及由 CDF 方程刻画的分位数等非光滑泛函的在线推断。

事件概述或研究问题

研究问题:固定策略下,如何从单一马尔可夫轨迹在线推断回报分布的函数泛函,而不只做点估计?文章关注分布时序差分学习中的统计推断,特别是 Polyak-Ruppert 平均估计器和 bootstrap 的渐近性质。

方法/产品要点

  • 方法定位:非参数分布时序差分学习;本文是理论方法而非产品。
  • 估计对象:固定策略下的回报分布。
  • 使用单个马尔可夫轨迹在线更新。
  • 对 Polyak-Ruppert 平均估计器证明根号 T 中心极限定理。
  • 在给定观测轨迹的条件下,证明 bootstrap 与原估计的根号 T 差异收敛到同一高斯极限。
  • 对光滑统计泛函:方差、CVaR、期望短缺、expectiles 可直接进行 bootstrap 推断。
  • 对非光滑统计泛函:建立估计回报 CDF 在 T^{-1/2} 尺度邻域上的局部渐近理论及其 bootstrap 对应;可用于回报分位数等由 CDF 方程定义的量。

主要结果或产业意义

主要结果

  1. Polyak-Ruppert 平均估计量的根号 T 误差弱收敛到 Cramér 空间中的中心高斯随机元。
  2. 条件 bootstrap 版本与原估计的根号 T 差异弱收敛到同一高斯极限。
  3. 光滑统计泛函(方差、CVaR、期望短缺、expectiles)的推断有理论依据。
  4. 非光滑统计泛函(如回报分位数)可由局部渐近理论进行推断。

产业意义(原文摘要未展开实例,待核实):这类推断可为强化学习中的风险度量、金融风控、自动驾驶等高风险决策提供回报分布的不确定性量化;但具体应用和实验证据需要查看原文。

为什么重要

在分布强化学习中,常见做法是估计回报分布或风险度量,但很少给出估计量的统计推断。本文提供了在线 bootstrap 推断的渐近理论,使 CVaR、期望短缺、expectiles、分位数等风险敏感指标可以带置信区间使用。这是对“点估计”类方法的重要补充。

与既有脉络的关系

已有相关卡片分别涉及 RAG/因果推断、视频质量评估、扩散表示学习;本条与它们主题不同。增量信息:在分布 TD 学习的在线推断方向上,本文补上了 bootstrap 的渐近等价性理论,可作为强化学习统计推断领域的一个独立参考点。

局限与不确定性

  • 材料仅为 arXiv 摘要,未包含完整证明、实验和算法细节。
  • 以下内容待核实:函数逼近/深度网络情形下的表现、实际样本量下的 bootstrap 校准、计算成本、对非平稳或部分可观测环境的扩展。
  • 用户给出的 Topics 标注为 foundation-model,但 arXiv 元数据为 stat.ML/cs.LG,摘要未提及基础模型;若在 foundation-model 语境使用,需核实原文是否有相关扩展。

可用于图书/PPT/简报的角度

  • “强化学习不能只给点估计”:用分布 TD 学习 + bootstrap 给风险度量加置信区间。
  • “统计推断在 RL 中的价值”:从期望回报走向回报分布,再到分布泛函的不确定性。
  • “风险敏感强化学习”:CVaR、期望短缺、expectiles、分位数等风险度量的渐近推断。
  • 引用时需注明理论结果来自 arXiv 摘要,具体证明和实验见原文(待核实)。

原始材料

  • 英文标题:Online Inference in Distributional Temporal-Difference Learning
  • arXiv ID: 2608.14408v1
  • 作者:Yang Peng, Liangyu Zhang
  • 提交/更新:2026-08-14T15:51:50Z
  • 分类:stat.ML, cs.LG
  • URL: https://arxiv.org/abs/2608.14408v1
  • PDF URL: https://arxiv.org/pdf/2608.14408v1
  • 摘要原文:We study online statistical inference for functionals of the return distribution under a fixed policy. The return distribution is estimated by nonparametric distributional temporal-difference learning from a single Markov trajectory. For the Polyak--Ruppert averaged estimator, we prove that its root-T error converges weakly to a centered Gaussian random element in Cramér space. We also prove that, conditionally on the observed trajectory, the root-T difference between the bootstrap and original averages converges weakly to the same Gaussian limit. These results justify bootstrap inference for smooth statistical functionals, including variance, CVaR, expected shortfall, and expectiles. For nonsmooth statistical functionals, we develop a local asymptotic theory for the estimated return CDF over T^{-1/2}-neighborhoods of finitely many thresholds, together with its bootstrap analogue. This theory allows us to conduct inference for nonsmooth statistical functionals characterized by CDF equations, including return quantiles.