Power Sampling 虽然能让语言模型把更多概率质量放到“正确轨迹”上,但在下游推理任务中反而可能让结果更差;论文将其归因于“剂量失配”与“覆盖失配”,并提出一种保留支撑集、控制分布变形的修复方法,在相同预算下可逆转损失并超过标准多样本推理。
论文研究 Power Sampling 作为一种“无验证器”的推理时增强方法为何会失效。作者发现一个反直觉现象:Power Sampling 能驱动更多概率质量走向正确生成轨迹,却同时损害其本应增强的下游推理性。以 self-consistency 作为代表性下游方法时,准确率下降最多可达 18.5 个百分点。