知识卡片:学习何时思考:面向测试时计算分配的自适应推理
英文标题:Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
英文关键词:adaptive reasoning; test-time compute allocation; GRPO; reasoning language models; token budget
原始来源:https://arxiv.org/abs/2608.20256v1
一句话结论
本论文让强化学习训练出的推理模型在回答的第一个 token 选择 NoThink、Short 或 Long 三种模式,从而自主决定推理长度;在 MATH 上训练的 1.5B 蒸馏模型上,平均响应长度从 4,796 个 token 降到 2,811 个 token(约 41% 减少),MATH500 准确率仍接近基线(0.782 vs. 0.796),并可以迁移到其他基准。
事件概述或研究问题
- 用强化学习训练的推理语言模型通常使用固定的 token 预算,而不是显式的自适应预算。
- 固定预算会导致简单问题过度计算、困难问题计算不足。
- 本文研究问题:模型能否学习自主分配推理努力?
- 具体做法:模型在响应的第一个 token 选择一种模式:NoThink(尽快作答)、Short(简要推理)、Long(延长推理)。
方法/产品要点
- 模式选择在 Group Relative Policy Optimization(GRPO)内部学习,不依赖外部路由器。
- 使用成形奖励(shaped reward),使每种模式在不同响应长度下都有价值。
- 设置强制的 per-mode token 上限,以保持三种模式彼此不同。
- 实验设置:在 MATH 上训练一个 1.5B 蒸馏模型。
- 推理长度分配被直接纳入生成策略,而不是由外部启发式规则决定。
主要结果或产业意义
- 三种模式自然涌现,没有坍缩到某一种选择。
- 简短模式(brief modes)的准确率反而高于 Long,说明模型不是随机选择模式,而是按问题难度来分配推理量。
- 三个种子的平均结果:MATH500 准确率为 0.782,基线为 0.796;平均响应长度从 4,796 token 降至 2,811 token(减少 41%)。
- 无需重新训练即可迁移到其他基准;问题越容易,节省越大。
- 例如在 GSM8K 上减少约 76% token,且在相似响应长度下准确率高于相关基线。
- 产业意义:可降低推理服务的测试时计算成本,尤其适合包含大量简单请求的场景;具体部署影响待核实。
为什么重要
- 它将“何时思考、思考多久”从固定预算或外部启发式问题,变成模型自身的可学习决策。
- 模式选择通过 RL 在模型内部学习,不需要额外的路由模块。
- 与已有相关卡片相比,本条不是基于模糊控制器的外部自适应采样,也不是长视频理解中的视觉证据调度,而是让模型通过首 token 选择自己的推理模式,并展示了模式差异化、可迁移性和 token 节省证据。
局限与不确定性
- 当前材料仅有摘要,具体 shaped reward 形式、per-mode token 上限数值、训练超参数、基线比较对象和统计显著性未给出,待核实。
- 实验只报告了 1.5B 蒸馏模型和 MATH 训练;能否扩展到更大模型或更多任务,待核实。
- “简短模式比 Long 更准确”的具体数值和适用范围未在摘要中完全展开,待核实。
- 跨基准迁移的节省与精度权衡可能依赖任务难度分布;完整 benchmark 结果待核实。
可用于图书/PPT/简报的角度
- 一句话概括:让模型“第一个词就决定要想多久”,把推理预算变成模型自己的可学习决策。
- 可作为“测试时计算”主题的案例:从固定预算到自适应预算,从外部调度到内部决策。
- 可展示成本-精度权衡的数字:41% 平均 token 节省、GSM8K 约 76% 节省、MATH500 精度接近基线。
- 可讨论 RL 奖励设计:shaped reward 与硬性 token 上限如何让不同推理模式共存,而不是让模型总是选择最长输出。
- 可对比其他自适应推理路线(外部控制器、启发式采样),说明“模型内部自选模式”是另一条技术路线。
原始材料
- 标题(英文):Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
- arXiv ID:2608.20256v1
- 作者:Gijs Kassenaar, Zhao Yang, Vincent François-Lavet
- 发表/更新:2026-08-20
- 分类:cs.AI
- 摘要链接:https://arxiv.org/abs/2608.20256v1
- PDF 链接:https://arxiv.org/pdf/2608.20256v1