AI消息速览

工具调用的苦涩教训

事件日期 2026-08-06 · 学术前沿 · 已接受

事件日期2026-08-06
信息日期2026-08-06
入库日期2026-08-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:工具调用的苦涩教训

一句话结论

将工具调用从“原生 JSON 调用”改为“程序化工具调用(Programmatic Tool Calling, PTC)”,在 BFCL v4 基准上对 14 个语言模型的评测中,多数情况下能匹配甚至超越原有基线,并在并行与上下文退化条件下表现更稳定;但部分细节因未能抓取论文正文而待核实。

事件概述或研究问题

本文系统评估了“工具即代码”这一范式:让模型通过代码(而非固定 JSON)来调用外部工具,从而把工具调用扩展为可自然链式组合、并行执行的脚本。研究问题主要有两个:

  • 程序化工具调用是否能替代原生 JSON 工具调用?
  • 在面对并行调用、上下文退化等真实任务条件时,程序化调用是否依然稳健?

该研究在 BFCL v4 基准上,跨当前与先前多代模型进行了对比评测。

方法/产品要点

  • 在程序化工具调用范式中,工具被暴露为类型化的 Python 存根(typed Python stubs)。
  • 模型通过生成代码来调用工具,而不是生成结构化 JSON。
  • 执行与结果处理在同一 agent 轮次内完成。
  • 与原生 JSON 工具调用进行对比,覆盖 14 个语言模型。
  • 额外考察了两种真实世界条件:并行扇出(parallel fan-out)和上下文腐烂(context rot,即上下文退化/污染)。

主要结果或产业意义

  • 在 BFCL v4 上,程序化工具调用在 14 个模型中有 11 个达到或超过原生 JSON 工具调用基线。
  • GPT-5.6 家族相比 JSON 基线平均提升 10.6%。
  • 在并行扇出条件下,14 个模型中有 13 个达到或超过基线。
  • 在上下文腐烂条件下,程序化工具调用保持稳定,而基线平均性能下降 2.3%。
  • 结果说明程序化工具调用是原生 JSON 工具调用的可行且稳健替代方案,其性能随模型代际能力提升而同步增长。

注:上述数据来自摘要;具体模型名单、统计显著性和任务分解需以原文为准。

为什么重要

工具调用是将大语言模型从“只能输出文本”转变为“能执行行动的智能体”的关键机制。此前主流做法是让模型生成 JSON 去调用工具,但 JSON 格式在表达复杂链式、并行逻辑时较为僵硬。本文给出的“苦涩教训”式结论是:与其为模型设计复杂格式,不如让模型直接写代码——代码本身更接近模型的训练数据,也更自然地表达工具组合逻辑。该增量信息可与已有“工具调用 / agent”研究脉络互补。

局限与不确定性

  • 仅基于摘要生成,论文正文未能抓取,模型列表、具体 prompt、实现细节、统计显著性等均待核实。
  • 模型名称“GPT-5.6”以及基准“BFCL v4”的具体版本与发布状态待核实。
  • “上下文腐烂”条件下的实验设置、退化测量方式以及“稳定”的定义需查看原文。
  • 是否覆盖多轮、人机交互、动态工具注册等更复杂场景不明。

可用于图书/PPT/简报的角度

  • 例:“让 Agent 直接写代码调用工具,效果反而更好”——工具调用范式的转变。
  • 可对比 JSON 调用与代码调用的差异,说明“贴近模型训练分布”的接口设计可能优于“为机器设计”的格式。
  • 可引用“11/14 模型匹配或超越基线”“GPT-5.6 家族提升 10.6%”等数据作为论据。

与既有脉络的关系

已有相关卡片分别涉及具身推理、图稀疏采样和 3D 点云投毒攻击,均不直接覆盖大模型工具调用。本卡片补充的是“程序化工具调用 vs JSON 工具调用”的系统性实证视角,属于“基于模型的 agent 能力与接口设计”这一脉络。

原始材料

  • URL: https://arxiv.org/abs/2608.06370v1
  • 英文标题: The Bitter Lesson of Tool Calling
  • Track: academic
  • Topics: foundation-model
  • 来源类型:arXiv 预印本摘要;正文未抓取。