AI消息速览

PAIChecker:检测SWE-Bench类基准中PR-Issue错位

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-07-31
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PAIChecker:检测SWE-Bench类基准中PR-Issue错位

一句话结论

SWE-bench类基准中约13.6%的PR-Issue配对存在错位;本文提出的PAIChecker多智能体系统能在SWE-Gym和SWE-bench Multilingual上分别达到最高92.12%和91.67%的二元准确率,优于四种LLM后端下的现有方法。

事件概述或研究问题

SWE-bench类基准广泛用于评估大语言模型(LLM)解决GitHub issue的能力。其常见构建流程是:从PR描述中提取issue引用,将每个PR与其关联issue配对;用issue描述作为问题陈述,用PR补丁作为测试oracle。然而,大型软件仓库的复杂开发与维护过程可能导致这种PR-Issue配对实际并不对齐。本文系统研究了SWE-bench Verified实例,发现13.6%的实例存在错位问题,并归纳为五种模式、十一个细粒度场景。

方法/产品要点

  • PAIChecker:一个用于检查SWE-bench类基准中PR-Issue错位的多智能体系统。
  • 三阶段设计
    1. 特定模式识别(specific pattern identification)
    2. 跨智能体标签综合(cross-agent label synthesis)
    3. 代码级验证(code-level validation)
  • 设计目标:更准确、更可泛化、且逐步验证的错位检测。

主要结果或产业意义

  • 在SWE-bench Verified上,13.6%的实例存在PR-Issue错位。
  • 在SWE-Gym和SWE-bench Multilingual两个基准上,PAIChecker在四种LLM后端下均取得最佳性能。
  • 二元准确率最高分别达到92.12%(SWE-Gym)和91.67%(SWE-bench Multilingual)。

为什么重要

该工作提示我们:被广泛用作LLM评测基准的SWE-bench类数据并非完全可靠。PR-Issue错位可能导致模型在错误的问题-补丁对上训练和评测,从而高估或低估LLM的真实issue解决能力。PAIChecker为未来自动、可扩展地构建高质量SWE-bench类基准提供了一种检测和修正手段。

局限与不确定性

摘要未提供PAIChecker在真实基准构建中的端到端效果、误报率/漏报率、计算成本以及五种模式的具体定义,这些细节待核实。

可用于图书/PPT/简报的角度

  • 大模型评测基准的“脏数据”问题:PR-Issue错位如何影响LLM能力评估。
  • 多智能体协作在软件工程数据质量治理中的应用。
  • 从“静态数据集”到“自动校验流水线”:下一代代码智能基准的构建思路。

原始材料

  • 英文标题:PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
  • 英文关键词:PR-Issue Misalignment; SWE-Bench-Like Benchmarks; Multi-Agent System; LLM Evaluation; Benchmark Quality
  • 来源:arXiv:2607.28587v1
  • URL:https://arxiv.org/abs/2607.28587v1
  • 作者:Manyi Wang, Junjielong Xu, Pinjia He
  • 发布时间:2026-07-30