AI消息速览

TREK:蒸馏探索,强化精炼

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:TREK:蒸馏探索,强化精炼

一句话结论

TREK 通过蒸馏(而非模仿)来扩展学生模型的探索支持,有效克服了 GRPO 在困难提示上的停滞问题,在数学推理和智能体任务上均取得了显著提升,且可兼容白盒、黑盒或自上下文教师。

事件概述或研究问题

GRPO 在策略能够采样有用推理轨迹时表现良好,但当正确解模式位于学生策略支持范围之外时,GRPO 会在困难提示上停滞。TREK 提出一种简单分阶段流程,利用前向 KL 散度将验证过的候选解拉入学生策略支持,随后回归标准在线 GRPO 精炼。

方法/产品要点

  • 核心思想:蒸馏不用于模仿,而用于扩展探索支持(exploration support expansion)。
  • 通用性:仅需验证过的输出轨迹,可使用外部黑盒教师、白盒教师,或同一模型在额外推理时上下文下自行提供建议;即使无法获取教师内部信息,也能高效识别最值得巩固的困难提示样本。
  • 具体步骤
    1. 识别学生在无辅助时通过率极低的提示。
    2. 向提议源(proposal source)查询并生成验证过的候选解。
    3. 按当前学生似然保留前 r 个候选解。
    4. 执行短阶段前向 KL(forward-KL)将这些验证模式拉入学生支持。
    5. 返回标准在线 GRPO 精炼。

主要结果或产业意义

  • 数学推理:在 AIME 2024 和 AIME 2025 上,TREK 配合 DeepSeek-V4 提议显著提升了 Qwen3 系列模型(所有测试规模)。以 Qwen3-8B 为例(avg@16):AIME 2025 从 36.9 提升至 40.3,AIME 2024 从 47.9 提升至 51.1;不使用外部教师的自我上下文变体(self-context variant)分别达到 38.5 和 49.6。
  • 智能体任务:ALFWorld 成功率从 75.8 提升至 82.8;ScienceWorld 成功率从 12.5 提升至 26.7。
  • 效率优势:在最困难的任务类型上,TREK 在训练早期即实现高成功率,而未经辅助的 GRPO 需要更多优化步骤才能达到类似水平。

为什么重要

TREK 提供了一种简单且通用的框架,解决了 GRPO 在困难样本上的探索瓶颈。它不仅不依赖特定教师架构,还能通过自上下文方式独立运作,为强化学习中的探索-精炼循环提供了新思路,在数学和智能体领域均验证了有效性。

局限与不确定性

  • 原文未明确讨论 TREK 在更大规模模型或更广泛任务上的泛化能力。
  • 不同提议源(如 DeepSeek-V4 与自上下文)的选择对性能的影响程度待进一步分析。
  • 前向 KL 阶段的超参数(如保留候选数 r、阶段长度)的调优成本未详细说明。

可用于图书/PPT/简报的角度

  • 方法图示:流程图展示 TREK 的五个步骤,突出“蒸馏用于探索”与传统蒸馏的区别。
  • 对比实验:在数学推理和智能体基准上,用柱状图对比 GRPO 与 TREK 的效果。
  • 实用性:强调“无需教师内部信息”这一特点,适合无法访问强大教师模型的实际应用场景。

原始材料

  • 论文标题:TREK: Distill to Explore, Reinforce to Refine
  • arXiv ID:2607.05339v1
  • 英文关键词:TREK, GRPO, Forward KL, distillation, exploration, mathematical reasoning, agentic tasks
  • URL:https://arxiv.org/abs/2607.05339v1