知识卡片:腾讯联合高校推出E-Bench,实测智能体多步工具调用能力
一句话结论
E-Bench是一个面向智能体多步工具调用能力的中文场景基准测试,由腾讯混元联合清华、东南大学推出,用王者荣耀、QQ音乐、腾讯会议等真实产品原型设计任务;测试显示11个前沿模型平均成功率仅54.56%,可靠性不足是当前最大瓶颈。
事件概述
腾讯混元联合清华大学、东南大学推出E-Bench,专门考核智能体在真实产品场景中的多步工具调用能力。基准以王者荣耀、QQ音乐、腾讯会议为原型,要求智能体通过连续调用多个工具完成状态改变类任务。结果发现,即便是前沿模型,在干扰信息干扰下也经常“过早行动”,导致任务失败。
方法/产品要点
- 任务原型:王者荣耀、QQ音乐、腾讯会议三个真实产品场景。
- 任务类型:包含323个“改状态”任务,覆盖7.6万余行数据。
- 考核目标:智能体需要完成多步工具调用,而非单步指令响应。
- 关键发现:可靠性是瓶颈;海量干扰信息下,“过早行动”是最常见失败模式。
- 对比模型:测试了11个前沿模型;腾讯混元Hy3以低成本取得优异性价比。
主要结果
- 11个前沿模型平均成功率仅54.56%。
- 表现最强的模型成功率也只有73.79%。
- 混元Hy3在成本可控的前提下表现出较好的性价比(具体成本数字待核实)。
为什么重要
当前智能体评测多集中在单轮指令或简单工具调用,而E-Bench强调“多步工具调用”和“干扰信息下的可靠性”,更贴近真实产品落地。它指出了一个此前容易被忽视的事实:模型能力不仅取决于“会不会用工具”,更取决于“在复杂信息中能否忍住不提前行动”。这一结论对智能体从演示走向可用有直接参考意义。
局限与不确定性
- 材料未给出E-Bench的完整英文标题,英文名“E-Bench”系中文报道原文。
- 混元Hy3的具体参数量、训练方式、成本数字均未在材料中披露。
- “7.6万余行数据”的确切含义(是任务轨迹、日志还是评测样本)待核实。
- 323个“改状态任务”的具体定义和评估细节未展开说明。
- 11个模型的具体名单、测试环境、复现方式等未在材料中提供。
可用于图书/PPT/简报的角度
- 智能体评测不能只看“单步正确率”,要设计“干扰环境下的多步任务”。
- 国产模型在多步工具调用评测中的真实水平与差距。
- 从“能力测试”到“可靠性测试”:智能体评测范式的演进。
- 实际产品(如王者荣耀、QQ音乐、腾讯会议)作为智能体训练与考核场的价值。
原始材料
- 来源:腾讯研究院AI速递 20260804(搜狐号)
- URL: https://m.sohu.com/a/1058375324_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4
- 英文标题:待核实(中文报道未提供完整英文标题)
- 英文关键词:AI agents; multi-step tool calling; benchmark; reliability; Tencent Hunyuan; E-Bench