知识卡片:Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化
一句话结论
Task-CoEvolve 提出在 LLM agent 的 harness 优化中动态选择有区分度的验证任务,并通过采样概率校正部分评估结果;在匹配全量验证集搜索最终性能的同时,可将优化过程中的评估数量减少约 80%。
事件概述/研究问题
Harness 优化通过迭代重写 harness 代码来提升 LLM agent 的表现,而不需要更新模型权重。现有方法每次迭代都在固定验证集上全量评估,成本高昂,且随着 harness 演化,部分任务可能逐渐失去区分度。Task-CoEvolve 试图让验证任务与 harness“共同演化”,以降低评估开销并保持优化效果。
方法/产品要点
- 核心观察:候选 harness 之间表现不一致的任务,比一直成功或一直失败的任务更能有效区分不同候选。
- 采用基于历史结果的方差加权采样,把评估集中在 agent 能力边界附近的任务上;采样分布会随 harness 演化而调整。
- 从部分任务估计全量验证集得分时,会考虑采样概率,从而在不同迭代评估不同子集时仍能进行一致比较。
主要结果或产业意义
- 实验场景:在线文本分类和 Terminal-Bench 2.1。
- 结果:Task-CoEvolve 一致优于固定子集基线,最终性能可匹配全量集搜索,同时将优化过程中的评估数量减少 80%。
- 产业意义:若该结果稳定,可显著降低 LLM agent 自动优化的算力开销,有利于在不训练模型权重的前提下迭代改进智能体系统。
为什么重要
与已有相关卡片分别关注电路优化、运筹建模和物理推理不同,本条聚焦 LLM agent 的 harness 优化评估策略。它在“不更新模型权重”的基础上进一步压缩验证成本,属于基础模型/智能体开发效率的增量进展。
局限与不确定性
- 材料仅来自 arXiv 摘要,具体的方差加权采样公式、基线细节、实验设置未在摘要中给出,待核实。
- 80% 的评估减少仅来自两个实验场景,在其他任务上的泛化性待核实。
- 摘要称代码将发布,但尚未确认是否已公开,复现细节待核实。
可用于图书/PPT/简报的角度
- 用“少评估、更准确”说明自适应评估策略在大模型智能体优化中的价值。
- 可作为一个案例,阐述“只改 harness、不更新模型权重”的轻量级 agent 优化方向。
原始材料
- 英文标题:Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- 英文关键词:LLM agent, harness optimization, adaptive validation task selection, variance-weighted sampling, evaluation efficiency
- arXiv ID:2608.20169v1
- 作者:Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki
- 提交/更新:2026-08-20
- 类别:cs.CL, cs.AI, cs.LG
- URL:https://arxiv.org/abs/2608.20169v1