AI消息速览

MidTool:面向智能体工具使用的中间训练数据合成

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MidTool:面向智能体工具使用的中间训练数据合成

一句话结论

MidTool 提出了一套面向通用工具使用能力的中间训练(mid-training)语料构建流程,并通过在 Qwen3-4B/8B-Base 上进行中间训练、再叠加 SFT 与 RL 后训练,在 BFCL、tau2-Bench 和 MCP Universe 上稳定提升了工具使用表现,表明通用工具使用也应获得专门的中间训练阶段,而非完全交给后训练。

事件概述或研究问题

论文研究的问题是:大语言模型中的“中间训练”阶段能否像增强数学、科学推理以及软件工程智能体能力那样,提升更通用的智能体工具使用能力?作者认为,通用工具使用是一个相对未被充分探索的智能体能力,因此提出 MidTool pipeline 和语料 MidTool-Mix。

方法/产品要点

  • MidTool 是一个“开放语料构建流程”(open corpus construction pipeline),用于生成智能体工具使用的中间训练数据。
  • 数据来源包括大规模网页数据、PDF 数据和代码数据,并结合来自真实世界工具 API、MCP 技能和文档驱动工作流的合成监督信号。
  • 设计目标包括教会模型:
    • 识别工具可供性(tool affordances)
    • 从上下文中抽取/落地参数(ground arguments from context)
    • 组合工具调用工作流(compose tool call workflow)
    • 从不完整信息中恢复(recover from incomplete information)
  • 实验设置:对 Qwen3-4B-Base 和 Qwen3-8B-Base 使用 MidTool-Mix 进行中间训练,之后分别采用监督微调(SFT)和强化学习(RL)进行后训练。

主要结果或产业意义

  • 与基线相比,MidTool-Mix 在 SFT 和 RL 两种后训练设置下,均一致提升了 BFCL、tau2-Bench 和 MCP Universe 上的下游表现。
  • 该结果表明,通用工具使用与其他重要 LLM 能力一样,能受益于专门的中间训练,而不是完全依赖后训练阶段。
  • 对于产业界,这意味着构建工具调用型智能体时,中间训练数据的设计可能是一个值得投入的方向。

为什么重要

已有工作更多关注中间训练对数学、科学推理或软件工程场景的增强,而 MidTool 将这一思路拓展到“通用工具使用”这一更广泛但研究较少的智能体能力。它提供了可复现的语料构建思路,并给出在多种工具调用基准上的正向证据,为后续工具型智能体的训练流程设计提供了增量参考。

局限与不确定性

  • 摘要未提供 MidTool-Mix 的规模、具体数据配比、过滤规则等细节,待核实。
  • 摘要未报告性能提升的具体数值、基线类型以及不同规模模型上的差异,待核实。
  • 所谓“开放语料构建流程”是否包含完整数据集或代码开源、具体许可证等,待核实。
  • 实验仅在 Qwen3-4B/8B 两个规模上验证,更大模型或更多模型家族上的效果待核实。
  • 通用工具使用的实际泛化性(如跨领域、跨工具协议)仍需进一步验证。

可用于图书/PPT/简报的角度

  • 中间训练(mid-training)作为介于预训练和后训练之间的能力塑造阶段,其价值正在从推理扩展到智能体工具使用。
  • 工具使用能力可以被拆解为多个可学习子任务:识别工具、参数落地、流程组合、信息恢复。
  • 数据合成与真实工具 API、MCP 技能、文档工作流结合,可以构造高质量的中间训练语料。
  • “专门训练工具使用”可能比“全部交给后训练”更有效,这一结论对智能体产品研发有启发。

英文标题与关键词

  • English Title: MidTool: Mid-training Data Synthesis for Agentic Tool Use
  • Keywords: Mid-training, Tool Use, Agentic, Data Synthesis, Large Language Models

原始材料

  • 来源:arXiv:2608.20314v1
  • 标题:MidTool: Mid-training Data Synthesis for Agentic Tool Use
  • 作者:Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He
  • 发布/更新:2026-08-20
  • 类别:cs.AI
  • 摘要链接:https://arxiv.org/abs/2608.20314v1
  • PDF 链接:https://arxiv.org/pdf/2608.20314v1