知识卡片:CalibForge:用于扩展可学习终端任务的对抗性求解器校准
一句话结论
CalibForge 提出用“求解器相对的可学习区”来合成终端任务:通过对抗性求解器校准,让候选任务既可执行可验证,又对训练中的智能体具有适当挑战性,最终构建 5,431 个校准终端任务,并在 Terminal-Bench 2.0 等基准上显著提升模型性能。
事件概述或研究问题
训练终端智能体需要可执行且可验证的任务,但“可求解”不等于“适合学习”。现有的可执行性验证只保证任务可行,无法揭示任务在给定求解器设置下对学习过程是否具有适当难度。CalibForge 针对这一问题,提出利用求解器的已验证行为来反向修订候选任务,从而自动合成“可学习”的终端任务。
方法/产品要点
- 自动终端任务合成系统,使用已验证的求解器行为对候选任务进行对抗性校准。
- 两种校准策略:
- 多求解器校准:针对异构求解器池中不同求解器之间的分歧。
- 对比求解器校准:针对指定的“强求解器通过、弱求解器失败”关系。
- 两者均以“已证明的可解性”为锚点,将求解器相对的可学习区操作化。
- 使用 CalibForge 构建了 5,431 个校准终端任务。
- 具体实现细节(如任务表示、修订算法、求解器池构成)待核实。
主要结果或产业意义
- 消融实验表明,两种校准策略比“仅编写+验证”或“普通单求解器反馈”提供更有效的监督。
- 使用完整集合训练的模型在 Terminal-Bench 2.0 上达到 32.58% 和 47.57%。
- 相对对应基线的最大提升:
- Terminal-Bench 2.0:+24.71 个百分点
- SWE-bench Pro:+27.68 个百分点
- Doc2Repo:+30.04 个百分点
- 结果支持将“求解器相对可学习性”作为构建有效且可迁移的智能体训练数据的实用目标。
为什么重要
CalibForge 将智能体训练数据生成从“可解性验证”推进到“难度校准”,为自动扩展高质量终端任务提供了新路径。它关注的是训练数据本身的可学习性,属于数据合成层面的基础设施性工作,有可能与下游智能体训练方法互补。
局限与不确定性
- 摘要未说明 CalibForge 的失败案例或局限性。
- 未说明 5,431 个任务的具体分布、领域与语言类型。
- 未说明与现有其他数据合成方法的直接对比。
- 未说明训练成本与推理开销。
- 数据集是否开源、代码是否可用待核实。
可用于图书/PPT/简报的角度
- 从“给智能体出题”的角度:好的训练题不只要有标准答案,还要“跳一跳才够得着”。
- 用“考官校准”类比:多求解器校准类似多个考官对题目难度意见不一致,对比校准则类似先让强考生做出、弱考生做错,从而定位题目难度区间。
- “数据可学习性”可作为智能体训练数据合成的新维度,强调任务难度要相对于求解器能力来设定。
与既有脉络的关系
已有相关卡片分别覆盖图式策略多智能体(GaP)、检索增强证据控制(DynaKRAG)、医学多模态数据系统(MedPMC)。本条 CalibForge 的增量在于:它不是解决下游任务的执行策略,而是为终端智能体自动合成“可学习”的训练任务,属于数据端的基础设施性工作。
原始材料
- 英文标题:CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
- 英文关键词(根据标题/摘要提炼):CalibForge; terminal-task synthesis; adversarial solver calibration; learnable tasks; agent training
- arXiv ID:2608.06352v1
- 作者:Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia
- 提交/更新日期:2026-08-06
- 原始摘要与更多信息见:https://arxiv.org/abs/2608.06352v1