知识卡片:Power Sampling 的悖论:更多正确概率质量,更差答案
一句话结论
Power Sampling 虽然能让语言模型把更多概率质量放到“正确轨迹”上,但在下游推理任务中反而可能让结果更差;论文将其归因于“剂量失配”与“覆盖失配”,并提出一种保留支撑集、控制分布变形的修复方法,在相同预算下可逆转损失并超过标准多样本推理。
事件概述或研究问题
论文研究 Power Sampling 作为一种“无验证器”的推理时增强方法为何会失效。作者发现一个反直觉现象:Power Sampling 能驱动更多概率质量走向正确生成轨迹,却同时损害其本应增强的下游推理性。以 self-consistency 作为代表性下游方法时,准确率下降最多可达 18.5 个百分点。
方法/产品要点
- Power Sampling:对语言模型在“完整生成轨迹”上的分布进行锐化,不需要验证器,并可能作为多种下游采样方法的通用前端。
- 剂量失配:固定指数在不同问题之间造成的分布变化幅度差异很大,导致锐化强度无法按问题校准。
- 覆盖失配:全局锐化会把概率质量集中到少数主导路径上;因此 pass@k 高不等于多样性保持得好,反而可能损失下游聚合、搜索、选择所需的广泛推理路径支撑。
- 修复思路:用“变形控制、支撑集保留”的 Power 目标替代均匀轨迹幂运算,跨问题校准锐化强度,同时限制对中等概率路径的过度压制。
- 同预算实现:在加权 self-consistency 的实例化下,修复后的采样器能逆转全局 Power 带来的损失,并在推理基准上优于标准多采样推理。
主要结果或产业意义
- 在多个模型和推理基准上,全局 Power Sampling 结合 self-consistency 时,准确率下降最高达 18.5 个百分点。
- 使用修复后的 Power 目标后,同预算下不仅恢复损失,还超过标准多样本推理。
- 产业意义:采样策略不能只看“单条样本更正确”或“pass@k 更高”;集成、搜索、选择类下游方法还需要分布支撑集足够宽。这个案例对推理时计算分配、采样器设计和评估指标选择都有警示作用。
为什么重要
Power Sampling 被看作一种无需验证器、可作通用前端的推理增强方法。论文揭示了一个关键陷阱:把概率质量推向正确轨迹,并不等于提升下游推理;真正的瓶颈可能是“支撑集覆盖”的丢失。它提醒研究者,多样性指标和正确性指标需要同时观察,否则可能得到“更多正确质量、更差答案”的反直觉结果。
与既有脉络的关系:已有相关卡片比较了相同 token 成本下“重复采样”与“自我反思/自我检查”方法,指出简单重复采样基线很难被超越。本条提供了另一个层面的增量:即使对采样分布做全局锐化,也可能因为破坏支撑集而在自洽性等下游方法中失败;修复后的采样器则能在同预算下超过标准多采样推理。
局限与不确定性
- 摘要未列出具体模型名称、推理基准列表、Power Sampling 的数学形式及训练细节,均待核实。
- “准确率下降最高 18.5 个百分点”对应的具体模型、基准和超参数条件待核实。
- 论文以 self-consistency 为代表案例,修复方法对其他下游采样方法是否同样有效,待核实。
- Power Sampling 作为“通用前端”的适用范围和计算成本,待核实。
可用于图书/PPT/简报的角度
- 反直觉案例:更多“正确概率质量”反而导致更差答案。
- 两个核心概念:剂量失配与覆盖失配。
- 实践提醒:不要只盯着 pass@k,还要看分布支撑集是否足够宽。
- 适合作为“AI 推理中的多样性—正确性权衡”“采样策略设计”“推理时计算”等主题的引入案例。
原始材料
- 英文标题:More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It
- 英文关键词:Power Sampling; inference-time reasoning; self-consistency; distribution sharpening; coverage mismatch; dose mismatch
- arXiv ID:2608.14420v1
- 作者:Haohui Yang, Jiaxing Sun, Xiujun Ma
- 提交时间:2026-08-14
- 原文链接:https://arxiv.org/abs/2608.14420v1