AI消息速览

Off-Context GRPO:利用特权信息在困难问题上进行推理学习

事件日期 2026-07-21 · 学术前沿 · 已接受

事件日期2026-07-21
信息日期2026-07-21
入库日期2026-07-23
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Off-Context GRPO:利用特权信息在困难问题上进行推理学习

  • 英文标题: Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
  • 英文关键词: reinforcement learning with verifiable rewards, RLVR, GRPO, privileged information, off-context rollouts, importance correction
  • 原始来源: https://arxiv.org/abs/2607.19313v1

一句话结论

Off-Context GRPO(OC-GRPO)通过在训练时向模型提供解答前缀等特权指导来生成“异上下文”轨迹,并利用重要性校正避免分布偏移,在数学推理基准上平均取得3.9%的绝对提升(13.8%相对提升),且几乎不增加额外成本。

事件概述或研究问题

  • 问题背景:使用可验证奖励的强化学习(RLVR)能提升大语言模型的推理能力,但在困难问题上,当模型无法生成任何正确解时,获得的奖励全为零,导致学习信号缺失(“学习悬崖”)。
  • 核心思路:在训练阶段,向模型提供特权信息(如部分解答前缀),引导模型生成正确解并获得非零奖励。这类轨迹称为“异上下文”(off-context)rollout,因为其生成条件(含特权信息的prompt)与最终优化的目标(原始无特权信息的prompt)不同。
  • 挑战:直接使用引导轨迹进行梯度更新会导致目标不匹配,使训练不稳定。OC-GRPO通过引入重要性校正目标函数,将更新方向校正回原始无引导的目标,从而避免此问题。

方法/产品要点

  1. 特权指导生成:对每个困难问题,自动提取或从参考解答中截取部分前缀,附加到训练prompt中,引导模型产生正确解。特权信息的具体构造方式需进一步确认(原文未详述)。
  2. Off-Context Rollout:在包含特权信息的prompt下采样轨迹,但目标奖励仍基于原始无特权prompt定义。
  3. 重要性校正:在GRPO的优化目标中引入重要性权重,校正因prompt变化导致的策略分布偏移,从而保持更新的正确性。
  4. 与标准GRPO相比:OC-GRPO对GRPO的修改最小(仅增加重要性权重项),实现简单,计算开销可忽略。

主要结果或产业意义

  • 基准测试:在标准数学推理基准上(如GSM8K、MATH等),OC-GRPO相比标准GRPO平均绝对提升3.9%,相对提升13.8%。
  • 成本:几乎不增加额外的计算成本(negligible additional cost)。
  • 意义:为RLVR在困难问题上的应用提供可行方案,无需改变模型架构或依赖外部验证器,可推广至其他需特权信息的推理任务。

为什么重要

  • 解决零信号困境:直接解决了RLVR在硬问题上的“学习悬崖”,使模型能从完全失败的问题中学习。
  • 与已有脉络的关系:本卡片之前已有AdaPrefix-GRPO(2026-07-08)同样聚焦于解决困难问题的GRPO信号问题。AdaPrefix通过自适应控制前缀长度使成功率维持在50%附近以最大化梯度;而OC-GRPO则不追求调节前缀长度,而是通过重要性校正直接使用引导轨迹,两种思路不同且互补。OC-GRPO的增量在于:无需严格调控前缀长度,更简洁,且实验证明在标准基准上稳定提升。
  • 潜在影响:可应用于任何需要从稀疏或零奖励中学习的RLVR场景,如数学、代码、逻辑推理等。

局限与不确定性

  • 特权信息的具体来源和构造方法尚未公开细节(待核实:原文未详细说明前缀如何自动提取)。
  • 重要性校正的数学推导和稳定性分析需要阅读全文确认。
  • 实验仅在数学推理基准上验证,在其他领域(如代码、常识推理)的效果待核实。
  • 与AdaPrefix-GRPO的直接对比未在摘要中提及,相对性能优劣待核实。

可用于图书/PPT/简报的角度

  • 理解RLVR困境:以“零奖励学习悬崖”为切入点,展示OC-GRPO如何利用“参考答案前缀”这一特权信息破局。
  • 对比展示两种思路:将AdaPrefix(调控前缀长度)与OC-GRPO(重要性校正)并列,说明应对同一问题的不同技术路线。
  • 简洁性工程实践:强调OC-GRPO是对GRPO的最小修改(仅加权重项),适合希望快速复现的研究者。

原始材料

  • ArXiv页面:https://arxiv.org/abs/2607.19313v1
  • PDF:https://arxiv.org/pdf/2607.19313v1
  • 作者:Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi
  • 发布/更新:2026-07-21
  • 类别:cs.LG, cs.AI