AI消息速览

AutoDesign——面向长时程智能体设计的元框架优化

事件日期 2026-08-13 · 学术前沿 · 已接受

事件日期2026-08-13
信息日期2026-08-13
入库日期2026-08-15
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:AutoDesign——面向长时程智能体设计的元框架优化

英文标题:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
英文关键词:AutoDesign; Meta-Harness Optimization; Long-Horizon Agentic Design; PosterBench; Recursive Self-Improvement
原始来源:https://arxiv.org/abs/2608.13560v1

一句话结论

AutoDesign 将“模型-框架(harness)系统”本身作为优化对象,通过元框架优化器驱动代码智能体依据运行反馈递归改进框架,在论文转海报任务上以低于 3 美元、40 分钟的自主运行达到接近会议海报质量,并在 PosterBench 上超越闭源商业系统 Claude Design。

事件概述或研究问题

多模态源材料到精简结构化媒介输出(如学术论文转海报)可被概念化为一个以模型-框架系统为中心的长时程智能体过程。理想框架系统应满足两点:贴合人类设计先验,并能通过经验探索积累可复用经验、实现递归自我改进。论文指出现有范式是静态的,缺乏这种能力。为此提出 AutoDesign,并选择论文到海报生成作为实例化与评估场景。

方法/产品要点

  • AutoDesign 框架:与人类设计先验对齐;由“元框架优化器(meta-harness optimizer)”指导一个代码智能体,基于 rollout 反馈递归地改进 harness 系统。
  • PosterBench 基准:包含 100 篇论文的 Main Track(覆盖五个学科)和一个共享的 10 篇论文子集 PosterBench-mini,用于受控评估。
  • DesignHarness:学习得到的设计框架;在七个受控的代码智能体-模型配置中,加入 DesignHarness 均带来性能提升。
  • 自主运行循环:完全自主的长时程循环内执行 253 次工具调用、11 次编辑回合,40 分钟内完成,成本低于 3 美元。

主要结果或产业意义

  • PosterBench Main Track 上 AutoDesign 得分 78.32,超过 Claude Design 7.45 分。
  • 七个受控配置中,整合 DesignHarness 将平均 PosterBench Score 从 54.99 提升到 67.39(+12.4%)。
  • 完全自主循环在人类评估中达到平均会议海报质量;系统盲测中 AutoDesign 的人类偏好最高。

为什么重要

  • 展示了在模型权重不变的情况下,通过优化外部“框架/harness”也能让智能体在长时程任务中实现自我改进,这与已有相关卡片中的 Argus、CompactionRL、Cortex 形成互补。
  • 与既有脉络相比,AutoDesign 的增量在于:把“harness 系统”作为显式的元优化目标,以论文转海报为落地任务,并发布了 PosterBench 基准和可复现的自主循环成本/质量数据。
  • 对自动化科研传播、会议海报制作、演示材料生成等场景有直接应用潜力。

局限与不确定性

  • 论文实例化任务仅为学术论文到海报生成,AutoDesign 是否可推广到其他长时程智能体设计任务尚待验证。
  • 摘要未提供 PosterBench 评分标准、人类评估协议、对比系统细节,因此分数差异的统计显著性与实际差距需要核实原文。
  • “253 次工具调用、11 个编辑回合、40 分钟、低于 3 美元”是特定配置下的结果;计算环境、模型 API、硬件等细节待核实。
  • “平均会议海报质量”属于人类评价结论,其主观性和评审标准待核实。

可用于图书/PPT/简报的角度

  • 智能体自我改进的第三种路径:不调权重、不换模型,而是让智能体“升级自己的框架”。
  • 学术论文转海报的自动化:展示一个 40 分钟、不到 3 美元即可生成接近会议海报质量的系统。
  • 基准设计启示:PosterBench 的主轨+共享小子集模式可用于控制变量评估。
  • 多学科覆盖:100 篇论文、五个学科,验证跨领域设计能力。

原始材料

  • 英文标题:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
  • arXiv 编号:2608.13560v1
  • 分类:cs.CV, cs.AI, cs.CL
  • 作者:Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
  • 发布时间:2026-08-13
  • 来源 URL:https://arxiv.org/abs/2608.13560v1