AI消息速览

连续时间强化学习用于受控Hawkes跳跃扩散

事件日期 2026-08-19 · 学术前沿 · 已接受

事件日期2026-08-19
信息日期2026-08-19
入库日期2026-08-20
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:连续时间强化学习用于受控Hawkes跳跃扩散

一句话结论

该研究针对Hawkes过程驱动的非马尔可夫随机控制问题,提出先用混合指数核将多变量Hawkes过程有限维马尔可夫化,再在近似模型上使用一种连续时间确定性策略梯度算法(Hawkes-CT DDPG)求解,并证明了马尔可夫化过程、强度及问题值对原非马尔可夫模型的收敛性。

研究问题

经典随机控制理论通常难以处理Hawkes强度记忆带来的路径依赖问题,除非使用特定马尔可夫核。该研究关注更一般的非马尔可夫设定:如何用机器学习方法求解多变量Hawkes跳跃扩散的随机控制问题。

方法/产品要点

  • 发展了一种有限维“马尔可夫化”过程与算法,用混合指数核逼近多变量Hawkes过程。
  • 证明了马尔可夫化近似下的Hawkes过程、其强度以及问题值函数,均收敛到原始非马尔可夫过程及原始问题值。
  • 在该马尔可夫化近似上定义了连续时间确定性策略梯度学习,称为 Hawkes-CT DDPG。
  • 提出一种无模型算法:只需观测事件时间、SDE解的路径以及选定的一组衰减滤波器,不需要知道Hawkes核系数。

主要结果或产业意义

  • 给出了非马尔可夫Hawkes驱动优化问题的一种可计算求解框架。
  • 在三种核类型下与离散时间强化学习技术进行了比较:简单指数核、Erlang核、幂律核。
  • 摘要未报告具体数值对比结果,因此这些比较的性能结论待核实。

为什么重要

该研究将连续时间强化学习扩展到Hawkes跳跃扩散控制的非马尔可夫场景,填补了经典随机控制理论与现代无模型强化学习之间的一个缺口,为事件驱动的金融、排队、社交网络等应用提供了潜在工具。

局限与不确定性

  • 摘要未给出实验数值、超参数设置或具体性能指标,需进一步核实。
  • 马尔可夫化依赖指数核混合逼近,对于更一般核函数的近似质量和收敛速度需核实。
  • 理论证明中的正则性条件、算法实现细节等未在摘要中完整呈现。

可用于图书/PPT/简报的角度

  • 介绍“非马尔可夫控制问题”为什么难,以及如何用马尔可夫化技巧绕过障碍。
  • 展示“连续时间强化学习”与“Hawkes过程”如何结合,可作为随机控制与机器学习交叉领域的案例。
  • 用“三种核函数对比”说明方法在不同记忆结构下的适用性。

English Title / Keywords

  • English Title: Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
  • Keywords: continuous-time reinforcement learning; Hawkes processes; jump-diffusion; non-Markovian control; DDPG

原始材料

  • 标题:Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
  • arXiv ID:2608.19151v1
  • 作者:Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan
  • 提交时间:2026-08-19
  • 分类:cs.LG, math.OC, stat.ML
  • 来源:https://arxiv.org/abs/2608.19151v1