AI消息速览

CodeRescue:面向编程智能体的预算校准恢复路由

事件日期 2026-07-21 · 学术前沿 · 已接受

事件日期2026-07-21
信息日期2026-07-21
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CodeRescue:面向编程智能体的预算校准恢复路由

一句话结论
CodeRescue 提出一种预算校准的恢复路由方法,通过在编程智能体失败后利用执行反馈决定是继续使用廉价模型还是升级到昂贵模型,并借助保形风险控制层在不同预算下自动调整决策,无需重新训练即可控制期望成本。

事件概述或研究问题
编程智能体通常会在可执行环境中运行,一次失败的尝试会产生可操作的反馈,而不仅仅是错误答案。现有成本感知系统多采用级联决策:先用廉价模型,失败后再升级到更强(更贵)的模型。但在编码场景中,执行反馈可能使继续使用廉价模型进行恢复依然有价值。因此需要回答一个预算约束下的部署问题:何时应该让智能体花费更多廉价计算资源,何时应该立即升级?本文将失败后的决策形式化为异构动作上的恢复路由,并利用执行轨迹训练一个有监督路由器。

方法/产品要点

  • 恢复路由:将失败后的决策建模为在不同动作(廉价恢复 vs. 升级到强模型)之间选择的路由问题。
  • 有监督训练:从智能体执行轨迹中收集数据,训练一个路由器来预测哪种恢复动作更优。
  • 保形风险控制(CRC)层:在部署时无需重新训练,通过添加一层 CRC 选择成本惩罚项,可在可交换性假设下对边际期望成本进行控制,从而使同一路由器在不同预算下都能使用。
  • 代码开源:https://github.com/Qijia-He/agent-budget-control

主要结果或产业意义

  • 在五个编码基准的保留失败样本上,廉价恢复和升级恢复表现出互补的成功模式。
  • 经 CRC 校准的前沿在固定动作、仅使用提示的路由器和二元级联基线之上取得更优的帕累托前沿。
  • 在主要的 GPT-5.4-nano / GPT-5.4 设置下,一个 CRC 校准的边界点超过了始终升级的解决率,同时平均恢复成本仅为其 35%。
  • 待核实:更详尽的性能对比表、在不同基线上的具体数值、以及对其他模型(如开源模型)的泛化情况。

为什么重要

  • 首次在编程智能体场景中系统性地将“失败后恢复”与“预算校准”结合,提供了可部署的决策框架。
  • CRC 层的引入使得路由器能在不同预算下保持成本控制,避免每次预算变动都需重新训练,降低了工程成本。
  • 与现有相关卡片(如 CompactionRL、ReCal3R、PACR-Video)不同,本工作聚焦于多模型选择与预算约束的交互,是基础模型部署效率提升的一个新方向。
  • 待核实:该方法与直接使用强化学习进行路由决策相比的优劣、实际部署中的延迟开销。

局限与不确定性

  • 保形风险控制依赖于可交换性假设,在实际非平稳数据流中可能失效,待核实作者是否讨论了鲁棒性措施。
  • 目前仅在五个编码基准上评估,且主要依赖 GPT-5.4 系列模型,待核实对更大规模模型或不同任务(如代码修复、单元测试生成)的适用性。
  • 路由器的训练需要执行轨迹数据,收集成本较高;待核实是否提供低资源场景下的迁移或零样本路由方案。
  • 待核实:文中是否比较了不同预算下的 Pareto 曲线完整形状、以及与其他成本感知方法的详细计算量对比。

可用于图书/PPT/简报的角度

  • 示例角度:“智能体成本优化新范式:失败后的智能路由”——解释为何不能简单级联,而需考虑恢复潜力。
  • 技术插图:绘制“失败→执行反馈→路由器→选择廉价恢复或升级”的流程,附上 CRC 校准前后成本-成功率曲线的对比。
  • 商业价值:对于 API 成本敏感的企业,该方案可在不牺牲解决率的前提下显著降低平均调用成本(如降低 65% 成本)。
  • 未来展望:将 CRC 层推广到多步决策、多模型池的场景,形成通用的预算校准智能体框架。

原始材料

  • URL: https://arxiv.org/abs/2607.19338v1
  • 英文标题: CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
  • 英文关键词: foundation-model, coding agents, budget calibration, recovery routing, conformal risk control, execution feedback
  • 来源类型: 学术预印本(arXiv),未能抓取正文,以上内容基于摘要与元数据生成,部分细节标注“待核实”。