知识卡片:弱模型引导提升RLVR中LLM的探索(Boosting LLM Exploration via Weak-Model Guidance in RLVR)
- 英文关键词:Reinforcement Learning with Verifiable Rewards (RLVR); LLM exploration; policy entropy; weak-model guidance; reasoning coverage; pass@k
一句话结论
在基于可验证奖励的强化学习(RLVR)中,用更小、更弱的语言模型生成部分推理轨迹作为外部前缀,强制目标模型基于这些前缀续写答案,可以有效缓解策略熵崩塌,提升大 k 下的 pass@k,且无需额外 SFT、复杂奖励设计或复杂提示。
事件概述或研究问题
RLVR 能显著提升 LLM 的推理能力,但训练中常出现策略熵下降,导致推理覆盖变窄、大 k 下 pass@k 退化。现有方法主要依靠算法正则化缓解熵崩塌,但忽略了“跨模型非参数扰动”这一方向。本文提出一种简单方法:在 RLVR 训练中引入外部弱模型生成的部分推理轨迹,作为目标模型的“陌生前缀”,从而促使模型探索更多样的推理路径。
方法/产品要点
- 核心设定:目标模型不完全依赖自身内部采样进行探索,而是被强制在“更小、更弱语言模型”生成的部分推理轨迹之上继续生成答案。
- 作用机制:这些陌生前缀能够打破目标模型的过度自信,鼓励它探索原本可能被忽略的推理路径。
- 方法定位:不依赖额外 SFT,不设计复杂奖励,也不使用复杂提示,是一种轻量级的探索增强手段。
- 待核实:弱模型的选择标准、前缀长度、混合比例、具体训练流程等细节,摘要中未提供。
主要结果或产业意义
- 在多个数学基准上,该方法一致优于 vanilla RLVR。
- 随着
k增大,性能提升愈发明显,表明推理覆盖范围得到了实质性扩展。 - 能有效缓解熵崩塌,且不引入额外的训练阶段或奖励建模负担。
- 待核实:具体数学基准名称、模型规模、
k的数值、提升幅度以及弱模型类型等细节。
为什么重要
现有 RLVR 多样性保持工作多聚焦于算法层面的正则化,本文提出利用“较弱模型”产生的分布外前缀作为外部扰动,是一种低成本、直觉清晰的新思路。与已有相关卡片(REDDIT、RSF-GLLM、RRC)相比,本文的增量点在于:针对 RLVR 训练中的熵崩塌问题,采用跨模型非参数扰动来扩展推理覆盖,而不是修改奖励结构或生成框架。
局限与不确定性
- 摘要只报告了数学推理基准上的结果,未说明在其他类型任务上的表现,待核实。
- 对“弱模型”的定义、规模差、领域匹配度等未展开,待核实。
- 外部前缀是否会引入错误推理模式或增加训练不稳定风险,摘要未讨论,待核实。
- 机制分析的具体实验证据(如分布差异如何影响探索动力学)尚未在摘要中详述,待核实。
可用于图书/PPT/简报的角度
- 反直觉亮点:让“更弱的模型”引导“更强的模型”进行探索,而非传统“强教师弱学生”蒸馏范式。
- 产业意义:在奖励可验证的强化学习训练中,低成本缓解多样性丧失,可能提升数学推理、代码生成等场景的覆盖面。
- 方法论启示:探索不一定要来自内部采样噪声,也可以来自外部模型的结构性扰动。
原始材料
- 英文标题:Boosting LLM Exploration via Weak-Model Guidance in RLVR
- arXiv ID:2608.27420v1
- Authors:Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao
- Published:2026-08-27
- Primary category:cs.CL
- URL:https://arxiv.org/abs/2608.27420v1