MISA-T 是一种面向混合强化学习(RL)回滚服务的路由层准入策略,通过自适应会话准入、工作负载感知的 KV 缓存容量分配和驻留时间感知的 KV 记账,在保持前缀缓存命中率和工作负载混合比例的前提下,显著提升 rollout 吞吐并缩短迭代时间。
现代大语言模型(LLM)的强化学习后训练流水线越来越需要组合来自多个领域和反馈范式的 rollout 工作负载。前缀感知路由可以通过缓存复用和负载均衡提升推理效率,但无法控制异构 rollout 会话如何竞争 KV 缓存容量。当 RLVR、RLHF 和 agentic rollouts 共享异步推理服务时,它们不同的序列结构、交互模式和 KV 驻留时间会产…