AI消息速览

SkillProx——通过近端文本梯度下降实现自进化智能体技能

事件日期 2026-08-07 · 学术前沿 · 已接受

事件日期2026-08-07
信息日期2026-08-07
入库日期2026-08-10
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:SkillProx——通过近端文本梯度下降实现自进化智能体技能

英文标题:SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

英文关键词:SkillProx; self-evolving agent skills; proximal textual gradient descent; LLM agents

一句话结论

SkillProx 提出一种“前向—后向”框架,将闭环诊断式技能演化与效用感知的近端精炼相结合,在分布内和分布外基准上比最强梯度基线平均准确率提升 3.0 个百分点。

事件概述/研究问题

大语言模型智能体通过“技能”(轻量、可复用的文本构件)积累程序性知识,使用时被加载进上下文,无需更新权重。近期方法通过迭代执行、失败诊断和轨迹引导的文本空间更新来精炼技能。但现有框架缺乏显式的“诊断—结果反馈”,并将“删除”视为一种通用编辑操作,而不是用于整合积累知识的专门机制。

方法/产品要点

  • 框架来源:受近端梯度(proximal gradient)启发,构建前向—后向框架。
  • 前向阶段:在同一任务批次上重新执行诊断驱动的编辑,回滚回归性改动,并将测量到的结果反馈给后续诊断。
  • 后向阶段:将技能分解为可审计的知识单元,使用冻结的留一法效用审计估计各单元贡献,并执行验证门控的整合、降级或移除。
  • 优化动机:复合目标函数,平衡任务损失与技能复杂度。
  • 说明:具体前向/后向算法的实现细节在摘要中未提供,待核实。

主要结果或产业意义

  • 在分布内(in-distribution)和分布外(out-of-distribution)基准、多个骨干大语言模型上,SkillProx 相比最强梯度基线平均准确率提升 3.0 个百分点。
  • 组件消融实验表明,闭环诊断与近端精炼具有互补效果。
  • 具体任务、数据集、基线和骨干模型名称在摘要中未列出,待核实。

为什么重要

通常自进化智能体只关注记忆累积或轨迹复用,较少把“删除”和“降级”作为知识整理的核心机制。SkillProx 将技能视为可审计的知识单元,并用近端思想约束文本空间更新,使技能演化更可解释、更可验证,也为“让智能体像维护代码一样维护自己的技能”提供了新思路。

与既有脉络的关系

本条与已有相关卡片(RoMeRL、HealthClaw 等)同属自进化智能体主题,但增量信息在于:它不是聚焦通用记忆反馈或健康管理记忆,而是专门处理“技能文本”的演化,并特别关注诊断结果反馈与删除/降级机制。

局限与不确定性

  • 论文目前只有 arXiv 摘要,完整方法细节、实验设置、基线对比和消融方案尚未在本材料中体现,待核实。
  • “可审计知识单元”如何自动分解、验证门控的具体阈值与规则,待核实。
  • 3.0 个百分点的提升是否在所有骨干模型和任务上一致,待核实。
  • 是否已开源代码,待核实。

可用于图书/PPT/简报的角度

  • 智能体如何像程序员一样“重构”自己的技能代码。
  • 文本空间中的梯度下降:把近端优化思想引入大模型智能体技能编辑。
  • 删除也是学习的一部分:从“只增不改”到“可审计地删除与降级”。
  • 从记忆到技能:自进化智能体的知识载体演进。

原始材料

  • 论文标题:SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent
  • arXiv ID:2608.07449v1
  • 作者:Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo
  • 发布/更新时间:2026-08-07T17:40:33Z
  • URL:https://arxiv.org/abs/2608.07449v1
  • 摘要原文:LLM agents increasingly adapt to recurring tasks by accumulating procedural knowledge in skills. These skills are lightweight, reusable textual artifacts that are loaded into the agent's context without weight updates. Recent methods refine skills through iterative task execution, failure diagnosis, and trajectory-guided text-space updates. However, existing frameworks lack explicit diagnosis--outcome feedback and treat deletion as a generic edit operation rather than a dedicated mechanism for consolidating accumulated knowledge. We introduce SkillProx, a proximal-gradient-inspired forward--backward framework that couples closed-loop diagnostic evolution with utility-aware proximal refinement. Motivated by a composite objective balancing task loss and skill complexity, the forward stage re-executes diagnosis-driven edits on the same task batch, rolls back regressions, and feeds measured outcomes into subsequent diagnoses. The backward stage decomposes the resulting skill into auditable knowledge units, estimates their contributions using a frozen leave-one-out utility audit, and applies validation-gated consolidation, demotion, or removal. Experiments on in-distribution and out-of-distribution benchmarks across multiple backbone LLMs show that SkillProx improves average accuracy by 3.0 percentage points over the strongest gradient-based baseline. Component ablations demonstrate the complementary effects of closed-loop diagnosis and proximal refinement.