EarlyEval 提出“早期结果预测”这一评估降本新轴:在 agent 执行过程中用一对 LightGBM 成功/失败分类器判断最终结局,一旦置信度过阈值就提前终止运行,从而在只让 agent 解决率平均变化 1–2 个百分点的情况下,最多减少 44.1% 输入 token 和 29.4% 输出 token。(待核实)
评估 LLM agent 对模型开发至关重要,但运行成本越来越高;一个前沿模型在 agentic benchmark 上完成一次评估可能花费数百到上千美元,并在迭代中反复支付(待核实)。现有基准蒸馏(benchmark distillation)通过减少评估任务数量降本,但没有降低每个任务内部的执行成本。EarlyEval 正是针对“任务内”成本:利用“最…