AI消息速览

跨任务技能迁移在LLM智能体中的可靠性

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:跨任务技能迁移在LLM智能体中的可靠性

一句话结论

LLM智能体能否从过往任务中可靠迁移“技能”,关键取决于技能的归纳方式:将任务分解为子任务并以文本形式归纳出的技能,通常比整任务级归纳和代码形式更可靠;任务级技能甚至可能让智能体低于无记忆基线。研究还提出一个只需技能和任务描述即可计算的“技能效用分数”,用于在新任务运行前诊断技能记忆。

研究问题与事件概述

  • 背景:LLM智能体可以从已完成任务中归纳技能并复用到后续任务,从而随经验变得更强大。
  • 现实问题:实际中,智能体归纳出的技能可能迁移不可靠,甚至伤害检索该技能的智能体。
  • 核心问题:智能体归纳出的技能在什么条件下能够可靠跨任务迁移?
  • 研究设计:作者对“技能的归纳方式如何影响跨任务迁移”进行了受控研究,聚焦现有方法差异最大的两个维度:任务级 vs. 子任务级技能归纳;文本 vs. 代码技能格式。

方法要点

  • 对比分析两类技能归纳方式:
    • 任务级技能归纳:把整个任务作为一条技能提取。
    • 子任务级技能归纳:把任务拆解为子任务后再提取技能。
  • 对比两种技能格式:文本格式 vs. 代码格式。
  • 提出两个互补属性:
    • 特异性(specificity):技能与真实任务的匹配紧密程度。
    • 抽象性(abstractness):技能相关性在任务之间的均匀程度。
  • 发现单独属性都无法预测任务成功,但二者组合有效,据此提出“技能效用分数”(skill utility score)。
  • 技能效用分数只需技能和任务描述即可计算,不需要实际执行任务。

主要结果

  • 任务级技能“大多”会让智能体性能低于无记忆基线。
  • 子任务级技能“平均”能让智能体性能高于无记忆基线。
  • 文本技能的迁移效果优于代码技能。
  • 特异性和抽象性单独都不能预测任务成功,但它们的组合效应可以。
  • 技能效用分数在技能被迁移时与任务成功表现存在稳定相关。
  • 子任务级技能和文本技能在技能效用分数上得分更高。

为什么重要

  • 该研究直接回应了“智能体经验何时可靠迁移”这一开放问题,表明“怎么记录经验”比“有没有经验”更重要。
  • 技能效用分数不需要执行任务,因此可以成为技能记忆的“运行前体检工具”,帮助智能体在复用历史技能前规避负迁移。
  • 对LLM智能体产品设计有指导意义:默认倾向子任务级、文本化技能记录,而非简单保存整任务经验。

与既有脉络的关系

  • 与“同图跨任务迁移在GNN中的协议与预测器”相比,本条关注的是LLM智能体技能记忆的跨任务迁移,而不是图神经网络表示迁移;但二者共同强调“迁移不一定有益,需要预测和规避负迁移”。
  • 与“多智能体辩论中潜在目标涌现”不直接重叠:本条不涉及多智能体社会结构,而是智能体自身经验记忆的可靠性。
  • 与“ToolFailBench”不直接重叠:本条不是工具使用失败基准,而是技能归纳方式与迁移效果的系统比较。
  • 增量信息:现有卡片更多讨论“什么时候迁移会失败”,本条进一步指出“归纳层级”和“技能格式”是影响跨任务迁移的两条关键轴,并提出免执行的技能效用分数作为诊断工具。

局限与不确定性

  • 摘要只给出“mostly”和“on average”方向,未报告具体任务集、数据集、模型规模、任务数量、效应量等细节,待核实。
  • “技能效用分数”的具体公式、特异性/抽象性的量化方式、与任务成功相关的强度,未在摘要中说明,待核实。
  • 是否在多种LLM骨干、不同任务族、不同检索和记忆机制下保持一致,待核实。
  • 任务级技能并非在所有情况下都失败,代码技能在某些条件下是否可能更优,摘要未提供细分结果,待核实。

可用于图书/PPT/简报的角度

  • “LLM智能体需要记忆管理:怎么记比记多少更重要。”
  • “不要直接把历史任务丢给智能体:把任务拆成子任务、用自然语言记录技能,跨任务迁移更可靠。”
  • “经验也可能成为负担:任务级技能让智能体低于无记忆基线。”
  • “运行前体检:技能效用分数可以不执行新任务,提前筛查技能记忆中的负迁移风险。”

原始材料

  • 英文标题:Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
  • 英文关键词(根据摘要整理):LLM agents; cross-task skill transfer; skill induction; subtask-level skills; text vs. code skills; skill utility score
  • 作者:Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou
  • 来源:arXiv:2608.20274v1 [cs.AI, cs.CL]
  • 发布/更新:2026-08-20
  • 摘要链接:https://arxiv.org/abs/2608.20274v1
  • PDF链接:https://arxiv.org/pdf/2608.20274v1