AI消息速览

同等token成本下,重复采样胜过自我反思:从1.5B到7B的实证

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:同等token成本下,重复采样胜过自我反思:从1.5B到7B的实证

一句话结论

在把“批评、反思、重写、辩论、检查”等所有环节消耗的token都计入成本后,没有任何方法在同等成本下可靠优于“重复采样取多数答案”这个简单基线;共有10项比较显著更差,且全部来自模型检查自身输出的方法。

事件概述或研究问题

  • 许多方法让语言模型规划、批评并重写自己的答案,或反思错误、从多次尝试中挑选最佳、与自身副本辩论。这些方法通常比单条思维链生成更多文本。
  • 由于“生成更多文本”本身就能提高准确率,因此相对单条思维链的提升并不能证明该方法的“设计思想”真正起作用。
  • Wang et al. (2024) 曾报告:在预算可比时,对同一问题反复采样并保留最常见答案的简单基线经常获胜,但该报告只有点估计,没有置信区间或显著性检验。
  • 本工作将该比较重新设计为受控实验,并在更严格的统计条件下检验。

方法/产品要点

  • 比较对象:7种方法;开源模型规模为1.5B、3B、7B参数;两个数学基准,各150道题。
  • 成本口径:统计所有生成的token,包括批评、反思、辩论轮次和检查消耗的token。
  • 对照方式:每种方法与其自身测得的成本下的重复采样基线进行比较。
  • 统计分析:按问题配对,共36项成对比较;使用bootstrap置信区间与多重性校正。
  • 开源资源:作者发布代码、prompts、全部生成结果和验证脚本。

主要结果或产业意义

  • 没有任何方法在同等成本下可靠优于重复采样。
  • 10项比较显著更差,全部是模型检查自身输出的方法;18项“自我检查”类比较全部为负。
  • “选择”的伤害随模型增大而消失: 对Best-of-N的8个样本取多数答案,在1.5B上比让模型自己选高8.0和11.3个百分点;在7B上仅高2.0和1.3个百分点,不再显著。
  • “重写”不能补救: Self-Refine和强制Reflexion在7B上仍比重复采样基线低3.6到10.1个百分点。
  • Reflexion在最小模型上的实现陷阱: 按已发表实现运行时,它从未触发自己的重试,总是判断自己正确,静默退化为单条思维链。

为什么重要

  • 该工作为“自我反思/自我精炼”类方法提供了更严格的基线对照:很多收益可能来自“生成了更多文本”,而非方法本身的机制。
  • 它填补了Wang et al. (2024)缺乏推断统计的空白,用配对设计和多重性校正让结论更可靠。
  • 与已有“递归自我改进”相关卡片相比,本卡片提供了直接实验证据,对“自我评估可以作为改进信号”这一共同主张提出挑战:在至少1.5B到7B规模、数学任务上,让模型检查自己的输出不仅无益,反而可能有害。

局限与不确定性

  • 摘要未列出两个数学基准的具体名称,也未列出7种方法分别是哪些,需核实原文。
  • 实验仅覆盖1.5B、3B、7B开源模型和数学题任务,能否推广到更大模型或更广泛任务待核实。
  • “没有任何方法可靠优于重复采样”不等于所有方法都等价;部分方法显著更差。
  • Reflexion在最小模型上未触发重试,可能使其在该规模下的比较更像“实现失效”而非“方法无效”,但这也说明了已发表实现的可复现性风险。

可用于图书/PPT/简报的角度

  • 主题:“复杂不等于更好:一个严格对照实验如何拆穿‘自我反思’的幻觉”
  • 可强调:成本核算方式决定了结论——把反思生成的token计入成本后,简单重复采样成为强基线。
  • 可引用数字:18/18项自我检查比较为负,10项显著更差;Self-Refine在7B上仍比基线低3.6到10.1个百分点。
  • 警示:即使发表过的方法也可能因“从未触发重试”而静默退化为普通CoT;复现和消融至关重要。

原始材料

  • 英文标题:Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
  • 英文关键词:self-refinement, reflexion, repeated sampling, token cost, self-inspection, foundation models
  • arXiv ID:2607.28576v1
  • 作者:Iliya Mirzaei
  • 发布时间:2026-07-30
  • 分类:cs.CL, cs.AI, cs.LG
  • URL:https://arxiv.org/abs/2607.28576v1
  • PDF:https://arxiv.org/pdf/2607.28576v1