AI消息速览

Consilience:无验证器测试时缩放中的置信度轨迹选择框架

事件日期 2026-08-10 · 学术前沿 · 已接受

事件日期2026-08-10
信息日期2026-08-10
入库日期2026-08-11
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Consilience:无验证器测试时缩放中的置信度轨迹选择框架

一句话结论

现有基于置信度的无验证器测试时缩放(VF-TTS)方法在复杂任务上会灾难性失效,因为“全程高置信度”往往对应探索不足和自信的错误;本文提出 Consilience 框架,通过显式建模置信度的时间不对称性——惩罚初始高置信、要求最终高确定性——来挑选更稳健的推理轨迹,并在研究生级数学和自由形式代码生成上超过基线。

事件概述或研究问题

  • 测试时缩放(Test-Time Scaling)通常依赖外部验证器(如代码中的编译器/测试用例、机器人中的价值函数)来筛选高质量采样。
  • 但很多实际应用没有高质量验证器,因此无验证器测试时缩放(VF-TTS)受到关注。
  • 其中“基于置信度”的 VF-TTS 方法仅用模型置信度对采样轨迹排序,开销小、对模型内部状态访问少,被视为很有前景。
  • 本文指出现有置信度基方法的一个关键缺陷:在复杂任务上,模型可能对错误答案给出均匀高置信度,导致方法失效。作者观察到“均匀高置信度”常常意味着探索失败,偏向于“自信地错”。

方法/产品要点

  • 核心洞察:稳健的认知搜索需要一种特定的置信度轨迹模式——初始阶段探索性分支(表现为低初始置信度),最终收敛到高置信度解。
  • 提出 Consilience:一个新颖的选择框架,显式评估推理过程中置信度的“时间不对称性”(temporal asymmetry)。
  • 实现方式:使用组合度量(combinatorial metric),主动惩罚高初始置信度,同时严格要求最终确定性。
  • 无需外部验证器,仅基于置信度轨迹进行样本排序与选择。

主要结果或产业意义

  • 实验覆盖研究生级数学问题和自由形式代码生成,Consilience 有效优于现有基线。
  • 产业意义上,为没有外部验证器的复杂推理任务提供了一种低成本、模型/任务适应性强的测试时缩放思路。
  • 对现有“置信度越高越好”的直觉提出了重要修正:不仅要看最终置信度,还要看置信度在推理过程中的变化轨迹。

为什么重要

  • 本文是对“无验证器测试时缩放”中置信度利用方式的重要更新。已有卡片讨论了自适应采样、迭代优化和重采样/重路由,本条增量信息在于:揭示了置信度基 VF-TTS 在复杂任务上的失效模式,并给出了可操作的轨迹级选择标准。
  • 为“测试时计算”资源的分配提供新视角:不是简单选择高置信度答案,而是关注探索与收敛之间的动态关系。

局限与不确定性

  • 摘要未提供 Consilience 在非数学/代码任务(如开放域问答、对话)上的表现,适用范围待核实。
  • 未说明组合度量的具体计算方式、超参数敏感性、以及是否需要额外训练(推测不需要,但文本未明确),待核实。
  • 论文为 arXiv 预印本(v1),尚未提供同行评审信息。
  • 具体基线名称、效果提升幅度、数据集规模等细节在摘要中未给出,待核实。

可用于图书/PPT/简报的角度

  • 测试时缩放的新思维:从“选高置信度”到“选置信度轨迹”。
  • 无验证器场景下的推理增强:为什么“自信地错”是致命问题。
  • 案例分析:数学题和代码生成中,探索初期低置信度可能预示更好的最终答案。
  • 商业启示:在无法获得编译器/价值函数等外部验证器的领域,如何用模型自身信号做质量筛选。

原始材料

  • 英文标题:Consilience for Verifier-Free Test-Time Scaling
  • arXiv ID:2608.09898v1
  • 作者:Lecheng Kong, Like Hui, Haitao Mao, Jun Huan
  • 提交/更新日期:2026-08-10T17:45:44Z
  • 分类:cs.CL(Primary),cs.LG
  • 建议英文关键词(据摘要提炼):Verifier-Free Test-Time Scaling, Confidence Trajectory, Consilience, LLM Reasoning, Temporal Asymmetry
  • 原始来源:https://arxiv.org/abs/2608.09898v1
  • PDF:https://arxiv.org/pdf/2608.09898v1