AI消息速览

Argus——面向长时程推理的通用智能体运行时

事件日期 2026-08-05 · 学术前沿 · 已接受

事件日期2026-08-05
信息日期2026-08-05
入库日期2026-08-06
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Argus——面向长时程推理的通用智能体运行时

英文标题:Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
英文关键词:Agentic Runtime; Long-Horizon Reasoning; Self-Evolving Runtime; Fixed-Weight Models; Verification-Gated Self-Evolution

一句话结论

Argus 是一个持久化、自进化的通用智能体运行时,在不改变模型权重的前提下,通过持久项目状态和控制策略实现自我进化,并在软件工程、数学研究、论文流水线等长时程推理任务上取得显著提升。

事件概述与研究问题

长时程推理需要一个智能体运行时:当证据支持当前方法时能够持续执行,当测量显示失败、隐藏约束或目标设定错误时能够转向。Argus 针对这一问题,提出由 Manager(管理者)、Planner(规划者)、Engineer(工程师)、Reviewer(评审者)四种角色在持久项目状态上执行有界任务的框架,并将稳定的用户意图与操作目标、约束和验证标准分离。

方法/产品要点

  • 角色分工:Manager、Planner、Engineer、Reviewer 在持久项目状态上协作执行有界任务。
  • 意图与目标分离:区分稳定用户意图、操作目标、约束和验证标准。
  • 验证门控吸收:记忆、技能、程序、验证器、路由决策和被拒绝的路线,只有在角色负责的审查之后(并在可用时通过任务原生验证)才会被纳入运行时。
  • 固定权重与运行时自进化:模型权重保持不变,自进化通过持久运行时状态和控制策略实现;在操作者掌控的升级节点之间自主执行。
  • 结构化轨迹输出:可产生结构化轨迹,用于未来的监督学习和强化学习。

主要结果或产业意义

  • 在七个 GPT-5.5 基准竞技场中,Argus 在 SWE-Bench Pro 上达到约 78%,而 Direct Copilot 为 59%,代价是总体 token 用量为后者的 1.41 倍。
  • 经过验证门控自进化后,成熟的 SWE-Bench 批次相比启动批次,每个任务的求解输入 token 减少 21%,活跃工作流时间减少 15%,并记录 34 次验证器恢复和 22 次严格审查循环挽救。
  • AARRI-Bench 上达到 76.8%;在数学数据合成任务中报告了 28.0 个百分点的差距(具体对比对象与方向待核实)。
  • 在 GPU 内核和语言模型训练方面取得了有竞争力的结果(具体指标待核实)。
  • 基准之外:一个优化的 RWKV6 内核已合并到上游;一次多日数学活动保留了被证伪的路线和基于证明的前沿更新;六条论文流水线完成了 254 个任务,出现 16 次阶段回滚。
  • 这些结果说明,一个固定权重、自进化的运行时可以修正、恢复并积累经过验证的方法,同时为未来的监督学习和强化学习生成结构化轨迹。

为什么重要

与已有相关卡片相比,CompactionRL 通过训练策略改进长程智能体,Cortex 针对具身智能体操作,而 Argus 提供了一条不改变模型权重、仅通过持久运行时状态与控制策略进行自进化的通用路线。其增量信息在于:Argus 展示了在复杂软件工程、数学研究和论文流水线等真实长程任务上,固定权重模型也能通过运行时机制实现效率提升、错误恢复和可追溯积累,为后续监督学习和强化学习提供结构化数据。

局限与不确定性

  • 摘要未披露 Argus 的完整架构细节、角色间具体交互协议和控制策略实现,待核实。
  • “GPT-5.5 基准竞技场”的具体含义和构建方式未在摘要中说明,待核实。
  • “28.0-point gap”的对比基线和方向未说明,待核实。
  • GPU-kernel 与语言模型训练结果的具体数值、评测方式未给出,待核实。
  • 未说明七个竞技场的整体平均表现;token 成本为基线 1.41 倍的实际权衡需要更详细评估。
  • 目前为 arXiv 预印本,尚未提供同行评审信息。

可用于图书/PPT/简报的角度

  • 主题:不微调模型,也能让 AI 越用越强?——Argus 的运行时自进化思路。
  • 核心图示:Manager/Planner/Engineer/Reviewer 四角色如何围绕持久项目状态协作,并经过验证门控吸收新知识。
  • 数据支撑:SWE-Bench Pro 78% vs 59%,token 成本 1.41 倍,成熟批次 token 减少 21%、时间减少 15%。
  • 应用案例:RWKV6 内核合并上游、多日数学攻关、论文流水线完成 254 个任务。
  • 对比脉络:与 CompactionRL(训练内压缩)和 Cortex(具身智能体)对照,突出“运行时自进化”是另一条技术路线。

原始材料

  • 英文标题:Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
  • arXiv ID:2608.05144v1
  • 链接:https://arxiv.org/abs/2608.05144v1
  • 作者:Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng(完整名单见原文)
  • 发表/更新时间:2026-08-05T17:58:58Z
  • 分类:cs.AI