AI消息速览

腾讯联合高校推出E-Bench,实测智能体多步工具调用能力

事件日期 2026-08-04 · 产业观察 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-04
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:腾讯联合高校推出E-Bench,实测智能体多步工具调用能力

一句话结论

E-Bench是一个面向智能体多步工具调用能力的中文场景基准测试,由腾讯混元联合清华、东南大学推出,用王者荣耀、QQ音乐、腾讯会议等真实产品原型设计任务;测试显示11个前沿模型平均成功率仅54.56%,可靠性不足是当前最大瓶颈。

事件概述

腾讯混元联合清华大学、东南大学推出E-Bench,专门考核智能体在真实产品场景中的多步工具调用能力。基准以王者荣耀、QQ音乐、腾讯会议为原型,要求智能体通过连续调用多个工具完成状态改变类任务。结果发现,即便是前沿模型,在干扰信息干扰下也经常“过早行动”,导致任务失败。

方法/产品要点

  • 任务原型:王者荣耀、QQ音乐、腾讯会议三个真实产品场景。
  • 任务类型:包含323个“改状态”任务,覆盖7.6万余行数据。
  • 考核目标:智能体需要完成多步工具调用,而非单步指令响应。
  • 关键发现:可靠性是瓶颈;海量干扰信息下,“过早行动”是最常见失败模式。
  • 对比模型:测试了11个前沿模型;腾讯混元Hy3以低成本取得优异性价比。

主要结果

  • 11个前沿模型平均成功率仅54.56%。
  • 表现最强的模型成功率也只有73.79%。
  • 混元Hy3在成本可控的前提下表现出较好的性价比(具体成本数字待核实)。

为什么重要

当前智能体评测多集中在单轮指令或简单工具调用,而E-Bench强调“多步工具调用”和“干扰信息下的可靠性”,更贴近真实产品落地。它指出了一个此前容易被忽视的事实:模型能力不仅取决于“会不会用工具”,更取决于“在复杂信息中能否忍住不提前行动”。这一结论对智能体从演示走向可用有直接参考意义。

局限与不确定性

  • 材料未给出E-Bench的完整英文标题,英文名“E-Bench”系中文报道原文。
  • 混元Hy3的具体参数量、训练方式、成本数字均未在材料中披露。
  • “7.6万余行数据”的确切含义(是任务轨迹、日志还是评测样本)待核实。
  • 323个“改状态任务”的具体定义和评估细节未展开说明。
  • 11个模型的具体名单、测试环境、复现方式等未在材料中提供。

可用于图书/PPT/简报的角度

  • 智能体评测不能只看“单步正确率”,要设计“干扰环境下的多步任务”。
  • 国产模型在多步工具调用评测中的真实水平与差距。
  • 从“能力测试”到“可靠性测试”:智能体评测范式的演进。
  • 实际产品(如王者荣耀、QQ音乐、腾讯会议)作为智能体训练与考核场的价值。

原始材料

  • 来源:腾讯研究院AI速递 20260804(搜狐号)
  • URL: https://m.sohu.com/a/1058375324_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4
  • 英文标题:待核实(中文报道未提供完整英文标题)
  • 英文关键词:AI agents; multi-step tool calling; benchmark; reliability; Tencent Hunyuan; E-Bench