知识卡片:TREK:蒸馏探索,强化精炼
一句话结论
TREK 通过蒸馏(而非模仿)来扩展学生模型的探索支持,有效克服了 GRPO 在困难提示上的停滞问题,在数学推理和智能体任务上均取得了显著提升,且可兼容白盒、黑盒或自上下文教师。
事件概述或研究问题
GRPO 在策略能够采样有用推理轨迹时表现良好,但当正确解模式位于学生策略支持范围之外时,GRPO 会在困难提示上停滞。TREK 提出一种简单分阶段流程,利用前向 KL 散度将验证过的候选解拉入学生策略支持,随后回归标准在线 GRPO 精炼。
方法/产品要点
- 核心思想:蒸馏不用于模仿,而用于扩展探索支持(exploration support expansion)。
- 通用性:仅需验证过的输出轨迹,可使用外部黑盒教师、白盒教师,或同一模型在额外推理时上下文下自行提供建议;即使无法获取教师内部信息,也能高效识别最值得巩固的困难提示样本。
- 具体步骤:
- 识别学生在无辅助时通过率极低的提示。
- 向提议源(proposal source)查询并生成验证过的候选解。
- 按当前学生似然保留前 r 个候选解。
- 执行短阶段前向 KL(forward-KL)将这些验证模式拉入学生支持。
- 返回标准在线 GRPO 精炼。
主要结果或产业意义
- 数学推理:在 AIME 2024 和 AIME 2025 上,TREK 配合 DeepSeek-V4 提议显著提升了 Qwen3 系列模型(所有测试规模)。以 Qwen3-8B 为例(avg@16):AIME 2025 从 36.9 提升至 40.3,AIME 2024 从 47.9 提升至 51.1;不使用外部教师的自我上下文变体(self-context variant)分别达到 38.5 和 49.6。
- 智能体任务:ALFWorld 成功率从 75.8 提升至 82.8;ScienceWorld 成功率从 12.5 提升至 26.7。
- 效率优势:在最困难的任务类型上,TREK 在训练早期即实现高成功率,而未经辅助的 GRPO 需要更多优化步骤才能达到类似水平。
为什么重要
TREK 提供了一种简单且通用的框架,解决了 GRPO 在困难样本上的探索瓶颈。它不仅不依赖特定教师架构,还能通过自上下文方式独立运作,为强化学习中的探索-精炼循环提供了新思路,在数学和智能体领域均验证了有效性。
局限与不确定性
- 原文未明确讨论 TREK 在更大规模模型或更广泛任务上的泛化能力。
- 不同提议源(如 DeepSeek-V4 与自上下文)的选择对性能的影响程度待进一步分析。
- 前向 KL 阶段的超参数(如保留候选数 r、阶段长度)的调优成本未详细说明。
可用于图书/PPT/简报的角度
- 方法图示:流程图展示 TREK 的五个步骤,突出“蒸馏用于探索”与传统蒸馏的区别。
- 对比实验:在数学推理和智能体基准上,用柱状图对比 GRPO 与 TREK 的效果。
- 实用性:强调“无需教师内部信息”这一特点,适合无法访问强大教师模型的实际应用场景。
原始材料
- 论文标题:TREK: Distill to Explore, Reinforce to Refine
- arXiv ID:2607.05339v1
- 英文关键词:TREK, GRPO, Forward KL, distillation, exploration, mathematical reasoning, agentic tasks
- URL:https://arxiv.org/abs/2607.05339v1