AI消息速览

调度混合RL回滚:超越前缀局部性

事件日期 2026-08-11 · 学术前沿 · 已接受

事件日期2026-08-11
信息日期2026-08-11
入库日期2026-08-13
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:调度混合RL回滚:超越前缀局部性

一句话结论

MISA-T 是一种面向混合强化学习(RL)回滚服务的路由层准入策略,通过自适应会话准入、工作负载感知的 KV 缓存容量分配和驻留时间感知的 KV 记账,在保持前缀缓存命中率和工作负载混合比例的前提下,显著提升 rollout 吞吐并缩短迭代时间。

事件概述或研究问题

现代大语言模型(LLM)的强化学习后训练流水线越来越需要组合来自多个领域和反馈范式的 rollout 工作负载。前缀感知路由可以通过缓存复用和负载均衡提升推理效率,但无法控制异构 rollout 会话如何竞争 KV 缓存容量。当 RLVR、RLHF 和 agentic rollouts 共享异步推理服务时,它们不同的序列结构、交互模式和 KV 驻留时间会产生显著不同的服务需求。因此,rollout 调度必须考虑这种异构性,同时不能扭曲训练器指定的工作负载混合比例。

方法/产品要点

MISA-T 是一种路由层准入策略,包含三个关键组件:

  • 自适应会话准入(adaptive session admission):根据当前服务状态动态决定是否接受新的 rollout 会话。
  • 工作负载感知的 KV 容量分配(workload-aware KV-capacity allocation):根据不同类型工作负载的需求分配 KV 缓存容量。
  • 驻留时间感知的 KV 记账(residency-time-aware KV accounting):在计算 KV 缓存占用时考虑会话实际驻留时间,而非仅看序列长度。

主要结果或产业意义

  • 在 Step3.7 和 Qwen3.6-35B-A3B 上的 rollout-only 消融实验中,相比经过扫描调优的 cache-aware vLLM Router,MISA-T 将 rollout 吞吐分别提升 53.3%43.6%,同时保持较高的前缀缓存命中率。
  • 在匹配的 50 次迭代 Step3.7 实验中,MISA-T 将 rollout 吞吐提升 35.6%,平均迭代时间降低 22.8%,同时使消耗的工作负载混合比例接近训练器目标,并取得相当的任务得分。

为什么重要

已有的强化学习系统优化工作多关注单类工作负载或单纯的前缀缓存复用;本条增量在于提出了一整套面向“混合 RL rollout 服务”的调度策略,解决了异构 rollout 会话共享 KV 缓存时的资源竞争问题,且不牺牲训练器所需的工作负载混合比例。这对大规模 LLM 后训练基础设施的效率和稳定性具有重要意义。

局限与不确定性

  • 实验主要基于 Step3.7 和 Qwen3.6-35B-A3B,其他模型和训练场景下的泛化性待核实。
  • 与 sweep-tuned vLLM Router 相比的具体配置细节、负载模拟方式以及实际部署中的额外开销未在摘要中给出,待核实。
  • “保持工作负载混合比例接近训练器目标”的量化偏差范围未在摘要中说明,待核实。
  • 论文是否经过同行评审、是否有完整技术报告尚未从材料中确认。

可用于图书/PPT/简报的角度

  • 大模型后训练基础设施中的“调度”问题:从前缀缓存到异构会话的 KV 缓存资源管理。
  • 强化学习工作负载的三类画像:RLVR、RLHF、agentic rollouts 的不同服务需求。
  • 路由层准入控制如何在不改变训练算法的情况下提升系统效率。

与既有脉络的关系

本条与“李雅普诺夫指数作为物理启发的密集奖励”“超越负脊端点”“SOAP 与 Muon”等已有卡片不同,后者分别关注奖励设计、符号正则化和优化器;本条关注的是 RL 后训练阶段的推理服务调度,属于系统层面的效率优化。其增量信息在于:将 KV 缓存分配和会话准入引入 rollout 调度,明确处理混合 RL 工作负载的异构性。

关键英文标题、关键词与原始来源

  • 英文标题:Scheduling Mixed RL Rollouts Beyond Prefix Locality
  • 英文关键词:reinforcement learning, rollout scheduling, KV-cache, prefix locality, mixed workload, LLM post-training
  • arXiv ID:2608.11152v1
  • 原始来源:https://arxiv.org/abs/2608.11152v1