知识卡片:PAIChecker:检测SWE-Bench类基准中PR-Issue错位
一句话结论
SWE-bench类基准中约13.6%的PR-Issue配对存在错位;本文提出的PAIChecker多智能体系统能在SWE-Gym和SWE-bench Multilingual上分别达到最高92.12%和91.67%的二元准确率,优于四种LLM后端下的现有方法。
事件概述或研究问题
SWE-bench类基准广泛用于评估大语言模型(LLM)解决GitHub issue的能力。其常见构建流程是:从PR描述中提取issue引用,将每个PR与其关联issue配对;用issue描述作为问题陈述,用PR补丁作为测试oracle。然而,大型软件仓库的复杂开发与维护过程可能导致这种PR-Issue配对实际并不对齐。本文系统研究了SWE-bench Verified实例,发现13.6%的实例存在错位问题,并归纳为五种模式、十一个细粒度场景。
方法/产品要点
- PAIChecker:一个用于检查SWE-bench类基准中PR-Issue错位的多智能体系统。
- 三阶段设计:
- 特定模式识别(specific pattern identification)
- 跨智能体标签综合(cross-agent label synthesis)
- 代码级验证(code-level validation)
- 设计目标:更准确、更可泛化、且逐步验证的错位检测。
主要结果或产业意义
- 在SWE-bench Verified上,13.6%的实例存在PR-Issue错位。
- 在SWE-Gym和SWE-bench Multilingual两个基准上,PAIChecker在四种LLM后端下均取得最佳性能。
- 二元准确率最高分别达到92.12%(SWE-Gym)和91.67%(SWE-bench Multilingual)。
为什么重要
该工作提示我们:被广泛用作LLM评测基准的SWE-bench类数据并非完全可靠。PR-Issue错位可能导致模型在错误的问题-补丁对上训练和评测,从而高估或低估LLM的真实issue解决能力。PAIChecker为未来自动、可扩展地构建高质量SWE-bench类基准提供了一种检测和修正手段。
局限与不确定性
摘要未提供PAIChecker在真实基准构建中的端到端效果、误报率/漏报率、计算成本以及五种模式的具体定义,这些细节待核实。
可用于图书/PPT/简报的角度
- 大模型评测基准的“脏数据”问题:PR-Issue错位如何影响LLM能力评估。
- 多智能体协作在软件工程数据质量治理中的应用。
- 从“静态数据集”到“自动校验流水线”:下一代代码智能基准的构建思路。
原始材料
- 英文标题:PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
- 英文关键词:PR-Issue Misalignment; SWE-Bench-Like Benchmarks; Multi-Agent System; LLM Evaluation; Benchmark Quality
- 来源:arXiv:2607.28587v1
- URL:https://arxiv.org/abs/2607.28587v1
- 作者:Manyi Wang, Junjielong Xu, Pinjia He
- 发布时间:2026-07-30