知识卡片:SWE-Prime:更少轨迹,更好性能
一句话结论
SWE-Prime 提出一种多粒度、两阶段的监督微调(SFT)数据选择方法,通过对轨迹级和片段级的质量筛选,仅使用完整已解决数据集中10%的轨迹进行训练,即可在SWE-Bench Pro和SWE-Bench Verified上取得优于全量数据训练的模型性能。
事件概述或研究问题
先前工作倾向于构建大规模智能体轨迹数据集,并在成功轨迹上进行SFT。但任务成功并不等于轨迹质量高:成功轨迹仍可能包含无效、冗余甚至危险的步骤。直接用这些轨迹训练会引入噪声监督,使模型模仿不良问题解决行为。本研究旨在回答:如何从成功轨迹中进一步筛选高质量子集,以提升大语言模型解决真实软件问题的能力。
方法/产品要点
- 提出SWE-Prime,一种多粒度、两阶段的SFT数据选择方法。
- 第一阶段:轨迹级筛选(trajectory-level screening),基于过程质量、结果质量和数据代表性,选出高质量且有代表性的成功轨迹子集。
- 第二阶段:片段级选择(segment-level selection),将连续步骤分组为语义片段,并依据每个片段对最终解决方案的贡献、可学习性以及潜在风险进行评估。
- 训练方式:所有片段保留在序列中以维持上下文,但只有被选中的片段会参与损失计算。
- 具体质量度量指标、阈值和算法细节:待核实。
主要结果或产业意义
- 在SWE-Bench Pro和SWE-Bench Verified上的实验显示,使用SWE-Prime筛选出的10%轨迹子集进行训练,优于在完整已解决数据集上训练。
- 相对性能提升分别最高达12.2%(SWE-Bench Pro)和24.2%(SWE-Bench Verified)。
- 这提示更少但更高质量的轨迹数据可以带来更好的模型性能,有助于降低训练成本,提升数据利用效率。
为什么重要
- 对“成功轨迹”进行进一步质量筛选,而不是全盘接受,是数据驱动智能体训练中的一个重要纠偏。
- 在软件工程智能体领域,已有工作如SWE-Pruner Pro聚焦于推理时工具输出剪枝以节省token,而SWE-Prime聚焦于训练前数据选择,以提升SFT监督信号质量。这是不同于推理时剪枝的增量视角。
- 多粒度筛选(轨迹级+片段级)以及只对选中片段计算损失的方式,为细粒度训练数据选择提供了新思路。
局限与不确定性
- 本卡片基于论文摘要/已知元数据生成,未能抓取全文,部分信息待核实。
- 具体实验设置(模型规模、基础模型、数据规模、训练超参数等)待核实。
- 质量评估的具体算法、人工/自动评估方式、代表性的定义等待核实。
- 在更多基准和实际场景中的泛化效果尚未从材料中确认。
- 10%轨迹子集的选择是否对不同规模的初始数据集均稳健,待核实。
可用于图书/PPT/简报的角度
- “少即是多”:高质量数据筛选优于全量数据训练,适合作为数据效率主题的案例。
- 从“成功轨迹”到“高质量轨迹”:如何定义监督学习中的“优质示范”。
- 两阶段筛选机制:宏观(轨迹)与微观(片段)结合的思路可迁移到其他序列决策任务。
- 具体数字:12.2%和24.2%的相对提升可用于强调效果。
原始材料
- 英文标题:SWE-Prime: Fewer Trajectories, Better Performance
- 英文关键词:large language model; software engineering; data selection; supervised fine-tuning; agent trajectory
- 来源:arXiv:2608.27449v1
- URL: https://arxiv.org/abs/2608.27449v1
- 说明:未能抓取正文,仅基于已知元数据生成,部分内容已标注“待核实”。