知识卡片:基于轨迹感知评估的高效SWE智能体基准测试
一句话结论
本文提出一种名为 PTA-IRT 的“特权轨迹感知项目反应理论”框架,将智能体执行任务的历史轨迹与最终通过/失败结果结合,用于更高效地选择少量校准任务并估计智能体能力;在低校准预算下,该方法在四个 SWE 基准上一致优于既有 IRT 基线。
英文标题 / 英文关键词 / 原始来源
- 英文标题:Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- 英文关键词:待核实(原文页面未提供关键词字段)
- 原始来源:https://arxiv.org/abs/2609.01603v1(arXiv:2609.01603v1,cs.SE / cs.AI / cs.CL)
事件概述 / 研究问题
在真实软件工程(SWE)基准上评估智能体成本很高,因为每项任务可能涉及多步代码探索、修改和测试执行。已有高效评估方法通常只利用结果信号(如通过/失败)或静态任务语义来选择代表性子集,从而估算完整基准得分,但忽略了智能体实际解决问题的过程信息。本文研究的问题是:能否利用历史执行轨迹中的过程信号,提高低成本校准子集选择与能力估计的准确性。
方法 / 产品要点
- 提出 PTA-IRT(Privileged Trajectory-Aware Item Response Theory),一个融合过程信号与结果信号的框架。
- 历史执行轨迹提供超出通过/失败的“过程级证据”,例如探索过的上下文、尝试过的编辑、解决路径等。
- PTA-IRT 将这些轨迹作为“特权信息”(privileged information),用于两个环节:校准子集选择(calibration subset selection)和智能体能力估计(ability estimation)。
主要结果 / 产业意义
- 在四个 SWE 基准上,低校准预算条件下,PTA-IRT 在分数恢复(score recovery)和排名恢复(ranking recovery)方面一致优于先前的 IRT(Item Response Theory)基线。
- 代码和数据已公开:https://github.com/DeepSoftwareAnalytics/PTA-IRT
- 本工作的方向有助于降低持续评估软件工程智能体的成本,对模型迭代、排行榜更新等实际场景有潜在价值。
为什么重要 / 与既有脉络的关系
既有相关卡片主要涉及机器人操作组合泛化、开放词汇 3D 场景理解和视频物理一致性,而本条卡片属于“基础模型”主题下的软件工程智能体评测方向,与已有卡片没有直接重复。增量信息在于:它指出已有高效评估方法多为“只看结果”(result-only),而本文引入执行轨迹作为过程信号来改进 IRT 框架,是一种面向过程感知的低成本智能体评测思路。
局限与不确定性
- 摘要中未给出四个 SWE 基准的具体名称、对比基线的细节、绝对提升幅度等,需原文核实。
- 历史执行轨迹的获取依赖与待测智能体交互或已有记录,是否适用于全新智能体或无历史轨迹的任务,材料中未说明(待核实)。
- 论文是否经过同行评审、实验设置的具体内容、以及“privileged information”在测试时的可用性边界,均需进一步查阅原文(待核实)。
可用于图书 / PPT / 简报的角度
- 用“只看考试分数,还是同时看解题过程?”类比说明 PTA-IRT 的核心思想。
- 展示智能体评测的成本痛点:每个 SWE 任务都涉及代码探索、修改和测试执行,全量跑一遍很贵。
- 以“过程比结果更早泄露能力信号”为切入点,介绍轨迹感知的评估范式。
- 引导讨论:低成本、可靠、可解释的大模型/智能体评测方法,如何成为大模型研发基础设施的一部分。
原始材料
- 标题:Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
- arXiv ID:2609.01603v1
- 作者:Kefeng Duan, Dewu Zheng, Yanlin Wang, Xiwen Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jiachi Chen, Mingwei Liu, Zibin Zheng
- 提交/更新:2026-09-01
- 分类:cs.SE(Primary)、cs.AI、cs.CL
- URL:https://arxiv.org/abs/2609.01603v1
- 摘要来源:该 arXiv 页面中的 Abstract 字段