知识卡片:MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的受控基准
一句话结论:现有的仓库级问题定位评估几乎完全基于文本,而真实仓库问题常包含截图、错误对话框等视觉证据;MM-IssueLoc 提供了首个受控的多模态基准,将视觉证据作为显式评估变量,实验表明当前系统远未达到可靠的多模态定位能力。
事件概述或研究问题:仓库级问题定位(repository-level issue localization)在软件工程中通常被视为纯文本任务,但实际 issue 报告中常包含截图、UI 渲染状态、日志等视觉信息。已有的多模态软件工程基准评估的是端到端的修复过程(如生成补丁),将定位与补丁合成缠绕在一起,无法判断视觉输入是否真正被利用、帮助还是被忽略。该论文提出 MM-IssueLoc,旨在构建一个受控基准,将视觉证据作为独立的评估变量,从而明确测量系统是否因使用视觉信息而提升定位性能。
方法/产品要点:
- 数据构建:包含 652 个 issue-PR 实例,覆盖 23 种编程语言;为每个实例中的图像提供了 7 个类别和 4 个相关性等级的标注。
- 标注粒度:提供文件级(file-level)和函数级(function-level)的金标准标签。
- 评估协议:采用成对评估——分别进行纯文本版和带图像版评估,通过对比来判断视觉输入的影响。
- 诊断工具:提出 VCE(Visual Captioning & Extraction)诊断,将图像转换为结构化文本证据,便于分析。
- 受控多模态检索器:设计了 MM-IssueLoc-VL-Emb,作为可控的多模态检索基线。
主要结果:
- 现有系统在多模态仓库定位上远不可靠:最强的基于 LLM 的智能体在文件级 Acc@5 上仅达 38.96,函数级 Acc@10 为 22.45;最强的检索器在函数级 Acc@10 上仅达 33.86。
- 跨基准比较显示,在文本主导的 SWE 基准上取得高定位分数的系统,无法干净地迁移到多模态问题定位上。
为什么重要:
- 首次将视觉证据作为显式评估变量,使未来研究能够检验系统是否真正通过利用视觉证据改进定位,而非依赖纯文本线索或下游补丁生成的附带效应。
- 揭示了现有多模态软件工程评估的盲点,推动更严谨的基准设计。
局限与不确定性:
- 论文未明确提及基准覆盖的仓库规模或图像分辨率等细节,待核实。
- 真实 issue 中视觉证据的分布可能与基准中的 652 个实例存在偏差,泛化边界需进一步验证。
- VCE 方法对复杂图像(如长截图、密集日志)的转换质量可能影响评估结果,论文未提供定量误差分析。
可用于图书/PPT/简报的角度:
- 作为案例说明:多模态 AI 评估需要解耦不同能力(如定位 vs 修复),避免“复合效应”掩盖真实进展。
- 展示视觉信息在软件工程中的实际价值:截图为何比纯文本描述更关键?基准如何量化这一差异?
- 对比文本主导的 SWE 基准与多模态基准的分数迁移差异,说明领域特定基准的必要性。
原始材料:
- 英文标题:MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
- 英文关键词:visual evidence, repository-level issue localization, multimodal benchmark, controlled evaluation, VCE diagnostics
- 原始来源:https://arxiv.org/abs/2607.15205v1