AI消息速览

Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化

一句话结论

Task-CoEvolve 提出在 LLM agent 的 harness 优化中动态选择有区分度的验证任务,并通过采样概率校正部分评估结果;在匹配全量验证集搜索最终性能的同时,可将优化过程中的评估数量减少约 80%。

事件概述/研究问题

Harness 优化通过迭代重写 harness 代码来提升 LLM agent 的表现,而不需要更新模型权重。现有方法每次迭代都在固定验证集上全量评估,成本高昂,且随着 harness 演化,部分任务可能逐渐失去区分度。Task-CoEvolve 试图让验证任务与 harness“共同演化”,以降低评估开销并保持优化效果。

方法/产品要点

  • 核心观察:候选 harness 之间表现不一致的任务,比一直成功或一直失败的任务更能有效区分不同候选。
  • 采用基于历史结果的方差加权采样,把评估集中在 agent 能力边界附近的任务上;采样分布会随 harness 演化而调整。
  • 从部分任务估计全量验证集得分时,会考虑采样概率,从而在不同迭代评估不同子集时仍能进行一致比较。

主要结果或产业意义

  • 实验场景:在线文本分类和 Terminal-Bench 2.1。
  • 结果:Task-CoEvolve 一致优于固定子集基线,最终性能可匹配全量集搜索,同时将优化过程中的评估数量减少 80%。
  • 产业意义:若该结果稳定,可显著降低 LLM agent 自动优化的算力开销,有利于在不训练模型权重的前提下迭代改进智能体系统。

为什么重要

与已有相关卡片分别关注电路优化、运筹建模和物理推理不同,本条聚焦 LLM agent 的 harness 优化评估策略。它在“不更新模型权重”的基础上进一步压缩验证成本,属于基础模型/智能体开发效率的增量进展。

局限与不确定性

  • 材料仅来自 arXiv 摘要,具体的方差加权采样公式、基线细节、实验设置未在摘要中给出,待核实。
  • 80% 的评估减少仅来自两个实验场景,在其他任务上的泛化性待核实。
  • 摘要称代码将发布,但尚未确认是否已公开,复现细节待核实。

可用于图书/PPT/简报的角度

  • 用“少评估、更准确”说明自适应评估策略在大模型智能体优化中的价值。
  • 可作为一个案例,阐述“只改 harness、不更新模型权重”的轻量级 agent 优化方向。

原始材料

  • 英文标题:Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
  • 英文关键词:LLM agent, harness optimization, adaptive validation task selection, variance-weighted sampling, evaluation efficiency
  • arXiv ID:2608.20169v1
  • 作者:Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki
  • 提交/更新:2026-08-20
  • 类别:cs.CL, cs.AI, cs.LG
  • URL:https://arxiv.org/abs/2608.20169v1