AI消息速览

知道何时停止:面向LLM评估的贝叶斯最优停止方法

事件日期 2026-08-14 · 学术前沿 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:知道何时停止:面向LLM评估的贝叶斯最优停止方法

一句话结论

本文提出 optstop,一种基于精度的自适应停止框架,将大语言模型(LLM)评估视为序贯测量问题:在不确定性高的地方继续采样,在估计已经足够精确或稳定时停止,从而在保持总体结论不变的情况下大幅减少测试次数。

事件概述或研究问题

LLM 评估通常使用固定的采样预算,即对每个测试项进行相同次数的重复测试,即使某些项的估计已经非常精确。作者认为这是一种计算浪费,并提出一个问题:能否根据不确定性动态分配评估计算,而不是按固定重复次数?

方法/产品要点

  • optstop:一种基于精度的自适应停止框架,把评估建模为序贯测量问题。
  • 分层贝叶斯推断:框架建立在分层贝叶斯推断之上,支持三类结果类型:
    • 二值(binary)
    • 有序(ordinal)
    • 连续(continuous)
  • 无需校准题库:每个基准测试项都保持可采样资格,不需要预先校准的项目库。
  • 两种运行方式:可在线(live)运行,也可事后(retrospectively)重放分析。
  • 安全机制:当测量到的性能趋近零时,采样会更为谨慎,因为此时稀有成功(rare successes)最为关键。

主要结果或产业意义

  • 在一个 200 项、10 轮的示例评估中,optstop 在九种验证设置下移除了 57%–97% 的计划试验次数。
  • 总体结论与完整运行等价。
  • 结果表明:LLM 评估计算可以按不确定性分配,而不是按固定重复次数分配;节省幅度取决于评估设计。

为什么重要

在 LLM 评估成本日益高昂的背景下,optstop 提供了一种“用多少算多少”的评估思路。它不同于简单的提前停止或固定采样,而是把停止决策建立在每个测试项的估计精度之上,并且兼容常见的结果类型。相比已有的“动态扩散策略的何时停止”工作,本卡的增量信息是:将“何时停止”问题从生成过程迁移到评估采样过程,用贝叶斯最优停止来减少重复试验。

局限与不确定性

  • 具体实现细节、数学推导、基准测试名称和实验设置的完整信息,在摘要中未给出,待核实。
  • “总体结论等价于完整运行”的具体衡量指标(如误差范围、统计检验)待核实。
  • 57%–97% 的节省幅度来自“示例性”评估,实际收益在不同评估设计下的适用范围待核实。

可用于图书/PPT/简报的角度

  • 用“评估也要讲效率”作为切入点:不是所有测试项都值得反复测,精度够了就停。
  • 与固定采样预算对比,解释“不确定性驱动计算分配”的基本思想。
  • 可引用“移除 57%–97% 计划试验”作为量化示例,但需说明是示例性结果。

与既有脉络的关系

已有相关卡片中有“学习何时停止——面向连续控制的前缀最优动态扩散策略”,其核心是在扩散去噪链中学习停止点以减少生成迭代。本条 optstop 则将“何时停止”应用于 LLM 评估的重复抽样过程,是贝叶斯最优停止在不同场景下的延续。

原始材料

  • 英文标题:Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations
  • arXiv ID:2608.14425v1
  • 作者:Toby D. Pilditch
  • 提交时间:2026-08-14T16:06:41Z
  • 主要类别:cs.AI
  • 摘要 URL:https://arxiv.org/abs/2608.14425v1
  • PDF URL:https://arxiv.org/pdf/2608.14425v1
  • 英文关键词:LLM evaluations; adaptive stopping; Bayesian inference; optimal stopping; uncertainty-based sampling(据摘要总结,原文未显式列出关键词)
  • 原始来源:arXiv preprint arXiv:2608.14425v1