AI消息速览

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的受控基准

事件日期 2026-07-16 · 学术前沿 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的受控基准

一句话结论:现有的仓库级问题定位评估几乎完全基于文本,而真实仓库问题常包含截图、错误对话框等视觉证据;MM-IssueLoc 提供了首个受控的多模态基准,将视觉证据作为显式评估变量,实验表明当前系统远未达到可靠的多模态定位能力。

事件概述或研究问题:仓库级问题定位(repository-level issue localization)在软件工程中通常被视为纯文本任务,但实际 issue 报告中常包含截图、UI 渲染状态、日志等视觉信息。已有的多模态软件工程基准评估的是端到端的修复过程(如生成补丁),将定位与补丁合成缠绕在一起,无法判断视觉输入是否真正被利用、帮助还是被忽略。该论文提出 MM-IssueLoc,旨在构建一个受控基准,将视觉证据作为独立的评估变量,从而明确测量系统是否因使用视觉信息而提升定位性能。

方法/产品要点

  • 数据构建:包含 652 个 issue-PR 实例,覆盖 23 种编程语言;为每个实例中的图像提供了 7 个类别和 4 个相关性等级的标注。
  • 标注粒度:提供文件级(file-level)和函数级(function-level)的金标准标签。
  • 评估协议:采用成对评估——分别进行纯文本版和带图像版评估,通过对比来判断视觉输入的影响。
  • 诊断工具:提出 VCE(Visual Captioning & Extraction)诊断,将图像转换为结构化文本证据,便于分析。
  • 受控多模态检索器:设计了 MM-IssueLoc-VL-Emb,作为可控的多模态检索基线。

主要结果

  • 现有系统在多模态仓库定位上远不可靠:最强的基于 LLM 的智能体在文件级 Acc@5 上仅达 38.96,函数级 Acc@10 为 22.45;最强的检索器在函数级 Acc@10 上仅达 33.86。
  • 跨基准比较显示,在文本主导的 SWE 基准上取得高定位分数的系统,无法干净地迁移到多模态问题定位上。

为什么重要

  • 首次将视觉证据作为显式评估变量,使未来研究能够检验系统是否真正通过利用视觉证据改进定位,而非依赖纯文本线索或下游补丁生成的附带效应。
  • 揭示了现有多模态软件工程评估的盲点,推动更严谨的基准设计。

局限与不确定性

  • 论文未明确提及基准覆盖的仓库规模或图像分辨率等细节,待核实。
  • 真实 issue 中视觉证据的分布可能与基准中的 652 个实例存在偏差,泛化边界需进一步验证。
  • VCE 方法对复杂图像(如长截图、密集日志)的转换质量可能影响评估结果,论文未提供定量误差分析。

可用于图书/PPT/简报的角度

  • 作为案例说明:多模态 AI 评估需要解耦不同能力(如定位 vs 修复),避免“复合效应”掩盖真实进展。
  • 展示视觉信息在软件工程中的实际价值:截图为何比纯文本描述更关键?基准如何量化这一差异?
  • 对比文本主导的 SWE 基准与多模态基准的分数迁移差异,说明领域特定基准的必要性。

原始材料

  • 英文标题:MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
  • 英文关键词:visual evidence, repository-level issue localization, multimodal benchmark, controlled evaluation, VCE diagnostics
  • 原始来源:https://arxiv.org/abs/2607.15205v1