AI消息速览

SWE-Prime:更少轨迹,更好性能

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:SWE-Prime:更少轨迹,更好性能

一句话结论

SWE-Prime 提出一种多粒度、两阶段的监督微调(SFT)数据选择方法,通过对轨迹级和片段级的质量筛选,仅使用完整已解决数据集中10%的轨迹进行训练,即可在SWE-Bench Pro和SWE-Bench Verified上取得优于全量数据训练的模型性能。

事件概述或研究问题

先前工作倾向于构建大规模智能体轨迹数据集,并在成功轨迹上进行SFT。但任务成功并不等于轨迹质量高:成功轨迹仍可能包含无效、冗余甚至危险的步骤。直接用这些轨迹训练会引入噪声监督,使模型模仿不良问题解决行为。本研究旨在回答:如何从成功轨迹中进一步筛选高质量子集,以提升大语言模型解决真实软件问题的能力。

方法/产品要点

  • 提出SWE-Prime,一种多粒度、两阶段的SFT数据选择方法。
  • 第一阶段:轨迹级筛选(trajectory-level screening),基于过程质量、结果质量和数据代表性,选出高质量且有代表性的成功轨迹子集。
  • 第二阶段:片段级选择(segment-level selection),将连续步骤分组为语义片段,并依据每个片段对最终解决方案的贡献、可学习性以及潜在风险进行评估。
  • 训练方式:所有片段保留在序列中以维持上下文,但只有被选中的片段会参与损失计算。
  • 具体质量度量指标、阈值和算法细节:待核实。

主要结果或产业意义

  • 在SWE-Bench Pro和SWE-Bench Verified上的实验显示,使用SWE-Prime筛选出的10%轨迹子集进行训练,优于在完整已解决数据集上训练。
  • 相对性能提升分别最高达12.2%(SWE-Bench Pro)和24.2%(SWE-Bench Verified)。
  • 这提示更少但更高质量的轨迹数据可以带来更好的模型性能,有助于降低训练成本,提升数据利用效率。

为什么重要

  • 对“成功轨迹”进行进一步质量筛选,而不是全盘接受,是数据驱动智能体训练中的一个重要纠偏。
  • 在软件工程智能体领域,已有工作如SWE-Pruner Pro聚焦于推理时工具输出剪枝以节省token,而SWE-Prime聚焦于训练前数据选择,以提升SFT监督信号质量。这是不同于推理时剪枝的增量视角。
  • 多粒度筛选(轨迹级+片段级)以及只对选中片段计算损失的方式,为细粒度训练数据选择提供了新思路。

局限与不确定性

  • 本卡片基于论文摘要/已知元数据生成,未能抓取全文,部分信息待核实。
  • 具体实验设置(模型规模、基础模型、数据规模、训练超参数等)待核实。
  • 质量评估的具体算法、人工/自动评估方式、代表性的定义等待核实。
  • 在更多基准和实际场景中的泛化效果尚未从材料中确认。
  • 10%轨迹子集的选择是否对不同规模的初始数据集均稳健,待核实。

可用于图书/PPT/简报的角度

  • “少即是多”:高质量数据筛选优于全量数据训练,适合作为数据效率主题的案例。
  • 从“成功轨迹”到“高质量轨迹”:如何定义监督学习中的“优质示范”。
  • 两阶段筛选机制:宏观(轨迹)与微观(片段)结合的思路可迁移到其他序列决策任务。
  • 具体数字:12.2%和24.2%的相对提升可用于强调效果。

原始材料

  • 英文标题:SWE-Prime: Fewer Trajectories, Better Performance
  • 英文关键词:large language model; software engineering; data selection; supervised fine-tuning; agent trajectory
  • 来源:arXiv:2608.27449v1
  • URL: https://arxiv.org/abs/2608.27449v1
  • 说明:未能抓取正文,仅基于已知元数据生成,部分内容已标注“待核实”。