知识卡片:知道何时停止:面向LLM评估的贝叶斯最优停止方法
一句话结论
本文提出 optstop,一种基于精度的自适应停止框架,将大语言模型(LLM)评估视为序贯测量问题:在不确定性高的地方继续采样,在估计已经足够精确或稳定时停止,从而在保持总体结论不变的情况下大幅减少测试次数。
事件概述或研究问题
LLM 评估通常使用固定的采样预算,即对每个测试项进行相同次数的重复测试,即使某些项的估计已经非常精确。作者认为这是一种计算浪费,并提出一个问题:能否根据不确定性动态分配评估计算,而不是按固定重复次数?
方法/产品要点
- optstop:一种基于精度的自适应停止框架,把评估建模为序贯测量问题。
- 分层贝叶斯推断:框架建立在分层贝叶斯推断之上,支持三类结果类型:
- 二值(binary)
- 有序(ordinal)
- 连续(continuous)
- 无需校准题库:每个基准测试项都保持可采样资格,不需要预先校准的项目库。
- 两种运行方式:可在线(live)运行,也可事后(retrospectively)重放分析。
- 安全机制:当测量到的性能趋近零时,采样会更为谨慎,因为此时稀有成功(rare successes)最为关键。
主要结果或产业意义
- 在一个 200 项、10 轮的示例评估中,optstop 在九种验证设置下移除了 57%–97% 的计划试验次数。
- 总体结论与完整运行等价。
- 结果表明:LLM 评估计算可以按不确定性分配,而不是按固定重复次数分配;节省幅度取决于评估设计。
为什么重要
在 LLM 评估成本日益高昂的背景下,optstop 提供了一种“用多少算多少”的评估思路。它不同于简单的提前停止或固定采样,而是把停止决策建立在每个测试项的估计精度之上,并且兼容常见的结果类型。相比已有的“动态扩散策略的何时停止”工作,本卡的增量信息是:将“何时停止”问题从生成过程迁移到评估采样过程,用贝叶斯最优停止来减少重复试验。
局限与不确定性
- 具体实现细节、数学推导、基准测试名称和实验设置的完整信息,在摘要中未给出,待核实。
- “总体结论等价于完整运行”的具体衡量指标(如误差范围、统计检验)待核实。
- 57%–97% 的节省幅度来自“示例性”评估,实际收益在不同评估设计下的适用范围待核实。
可用于图书/PPT/简报的角度
- 用“评估也要讲效率”作为切入点:不是所有测试项都值得反复测,精度够了就停。
- 与固定采样预算对比,解释“不确定性驱动计算分配”的基本思想。
- 可引用“移除 57%–97% 计划试验”作为量化示例,但需说明是示例性结果。
与既有脉络的关系
已有相关卡片中有“学习何时停止——面向连续控制的前缀最优动态扩散策略”,其核心是在扩散去噪链中学习停止点以减少生成迭代。本条 optstop 则将“何时停止”应用于 LLM 评估的重复抽样过程,是贝叶斯最优停止在不同场景下的延续。
原始材料
- 英文标题:Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations
- arXiv ID:2608.14425v1
- 作者:Toby D. Pilditch
- 提交时间:2026-08-14T16:06:41Z
- 主要类别:cs.AI
- 摘要 URL:https://arxiv.org/abs/2608.14425v1
- PDF URL:https://arxiv.org/pdf/2608.14425v1
- 英文关键词:LLM evaluations; adaptive stopping; Bayesian inference; optimal stopping; uncertainty-based sampling(据摘要总结,原文未显式列出关键词)
- 原始来源:arXiv preprint arXiv:2608.14425v1