知识卡片:连续时间强化学习用于受控Hawkes跳跃扩散
一句话结论
该研究针对Hawkes过程驱动的非马尔可夫随机控制问题,提出先用混合指数核将多变量Hawkes过程有限维马尔可夫化,再在近似模型上使用一种连续时间确定性策略梯度算法(Hawkes-CT DDPG)求解,并证明了马尔可夫化过程、强度及问题值对原非马尔可夫模型的收敛性。
研究问题
经典随机控制理论通常难以处理Hawkes强度记忆带来的路径依赖问题,除非使用特定马尔可夫核。该研究关注更一般的非马尔可夫设定:如何用机器学习方法求解多变量Hawkes跳跃扩散的随机控制问题。
方法/产品要点
- 发展了一种有限维“马尔可夫化”过程与算法,用混合指数核逼近多变量Hawkes过程。
- 证明了马尔可夫化近似下的Hawkes过程、其强度以及问题值函数,均收敛到原始非马尔可夫过程及原始问题值。
- 在该马尔可夫化近似上定义了连续时间确定性策略梯度学习,称为 Hawkes-CT DDPG。
- 提出一种无模型算法:只需观测事件时间、SDE解的路径以及选定的一组衰减滤波器,不需要知道Hawkes核系数。
主要结果或产业意义
- 给出了非马尔可夫Hawkes驱动优化问题的一种可计算求解框架。
- 在三种核类型下与离散时间强化学习技术进行了比较:简单指数核、Erlang核、幂律核。
- 摘要未报告具体数值对比结果,因此这些比较的性能结论待核实。
为什么重要
该研究将连续时间强化学习扩展到Hawkes跳跃扩散控制的非马尔可夫场景,填补了经典随机控制理论与现代无模型强化学习之间的一个缺口,为事件驱动的金融、排队、社交网络等应用提供了潜在工具。
局限与不确定性
- 摘要未给出实验数值、超参数设置或具体性能指标,需进一步核实。
- 马尔可夫化依赖指数核混合逼近,对于更一般核函数的近似质量和收敛速度需核实。
- 理论证明中的正则性条件、算法实现细节等未在摘要中完整呈现。
可用于图书/PPT/简报的角度
- 介绍“非马尔可夫控制问题”为什么难,以及如何用马尔可夫化技巧绕过障碍。
- 展示“连续时间强化学习”与“Hawkes过程”如何结合,可作为随机控制与机器学习交叉领域的案例。
- 用“三种核函数对比”说明方法在不同记忆结构下的适用性。
English Title / Keywords
- English Title: Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
- Keywords: continuous-time reinforcement learning; Hawkes processes; jump-diffusion; non-Markovian control; DDPG
原始材料
- 标题:Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
- arXiv ID:2608.19151v1
- 作者:Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan
- 提交时间:2026-08-19
- 分类:cs.LG, math.OC, stat.ML
- 来源:https://arxiv.org/abs/2608.19151v1