AI消息速览

Power Sampling 的悖论:更多正确概率质量,更差答案

事件日期 2026-08-14 · 学术前沿 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Power Sampling 的悖论:更多正确概率质量,更差答案

一句话结论

Power Sampling 虽然能让语言模型把更多概率质量放到“正确轨迹”上,但在下游推理任务中反而可能让结果更差;论文将其归因于“剂量失配”与“覆盖失配”,并提出一种保留支撑集、控制分布变形的修复方法,在相同预算下可逆转损失并超过标准多样本推理。

事件概述或研究问题

论文研究 Power Sampling 作为一种“无验证器”的推理时增强方法为何会失效。作者发现一个反直觉现象:Power Sampling 能驱动更多概率质量走向正确生成轨迹,却同时损害其本应增强的下游推理性。以 self-consistency 作为代表性下游方法时,准确率下降最多可达 18.5 个百分点。

方法/产品要点

  • Power Sampling:对语言模型在“完整生成轨迹”上的分布进行锐化,不需要验证器,并可能作为多种下游采样方法的通用前端。
  • 剂量失配:固定指数在不同问题之间造成的分布变化幅度差异很大,导致锐化强度无法按问题校准。
  • 覆盖失配:全局锐化会把概率质量集中到少数主导路径上;因此 pass@k 高不等于多样性保持得好,反而可能损失下游聚合、搜索、选择所需的广泛推理路径支撑。
  • 修复思路:用“变形控制、支撑集保留”的 Power 目标替代均匀轨迹幂运算,跨问题校准锐化强度,同时限制对中等概率路径的过度压制。
  • 同预算实现:在加权 self-consistency 的实例化下,修复后的采样器能逆转全局 Power 带来的损失,并在推理基准上优于标准多采样推理。

主要结果或产业意义

  • 在多个模型和推理基准上,全局 Power Sampling 结合 self-consistency 时,准确率下降最高达 18.5 个百分点。
  • 使用修复后的 Power 目标后,同预算下不仅恢复损失,还超过标准多样本推理。
  • 产业意义:采样策略不能只看“单条样本更正确”或“pass@k 更高”;集成、搜索、选择类下游方法还需要分布支撑集足够宽。这个案例对推理时计算分配、采样器设计和评估指标选择都有警示作用。

为什么重要

Power Sampling 被看作一种无需验证器、可作通用前端的推理增强方法。论文揭示了一个关键陷阱:把概率质量推向正确轨迹,并不等于提升下游推理;真正的瓶颈可能是“支撑集覆盖”的丢失。它提醒研究者,多样性指标和正确性指标需要同时观察,否则可能得到“更多正确质量、更差答案”的反直觉结果。

与既有脉络的关系:已有相关卡片比较了相同 token 成本下“重复采样”与“自我反思/自我检查”方法,指出简单重复采样基线很难被超越。本条提供了另一个层面的增量:即使对采样分布做全局锐化,也可能因为破坏支撑集而在自洽性等下游方法中失败;修复后的采样器则能在同预算下超过标准多采样推理。

局限与不确定性

  • 摘要未列出具体模型名称、推理基准列表、Power Sampling 的数学形式及训练细节,均待核实。
  • “准确率下降最高 18.5 个百分点”对应的具体模型、基准和超参数条件待核实。
  • 论文以 self-consistency 为代表案例,修复方法对其他下游采样方法是否同样有效,待核实。
  • Power Sampling 作为“通用前端”的适用范围和计算成本,待核实。

可用于图书/PPT/简报的角度

  • 反直觉案例:更多“正确概率质量”反而导致更差答案。
  • 两个核心概念:剂量失配与覆盖失配。
  • 实践提醒:不要只盯着 pass@k,还要看分布支撑集是否足够宽。
  • 适合作为“AI 推理中的多样性—正确性权衡”“采样策略设计”“推理时计算”等主题的引入案例。

原始材料

  • 英文标题:More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It
  • 英文关键词:Power Sampling; inference-time reasoning; self-consistency; distribution sharpening; coverage mismatch; dose mismatch
  • arXiv ID:2608.14420v1
  • 作者:Haohui Yang, Jiaxing Sun, Xiujun Ma
  • 提交时间:2026-08-14
  • 原文链接:https://arxiv.org/abs/2608.14420v1