AI消息速览

VAKRA——在工具使用策略下评估跨API与检索的多跳推理

事件日期 2026-08-12 · 学术前沿 · 已接受

事件日期2026-08-12
信息日期2026-08-12
入库日期2026-08-14
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:VAKRA——在工具使用策略下评估跨API与检索的多跳推理

一句话结论

VAKRA 是一个面向企业级代理的可执行基准,将结构化 API 调用与文档检索结合在同一评测中,并引入自然语言工具使用策略约束。评测发现当前最强模型在组合 API 任务上仅约 50% 准确率,在策略约束下的不可回答查询上最低仅有 2.4%。

事件概述或研究问题

现有基准通常分别评估 API 调用能力和知识检索能力,但企业代理实际部署中需要同时跨结构化 API 和文档集合进行推理,并遵守工具使用策略。该论文提出 VAKRA 基准来填补这一评估空白。

方法/产品要点

  • VAKRA 包含超过 8,000 个可执行 API,覆盖 62 个领域。
  • 任务设置由易到难分三种:多样 API 交互风格、结构化 API 上的多跳推理、带自然语言工具使用策略约束的多源推理。
  • 正确性验证通过重新执行预测的工具调用并对照实时 API 完成,允许多个有效路径。
  • 使用固定 ReAct harness 来隔离模型能力与代理架构差异。
  • 评测对象包括前沿模型和开放权重模型。具体模型名单待核实。

主要结果或产业意义

  • 最佳模型在单跳端点式任务上准确率为 70.4%,在组合 API 任务上降至 50%–51%。
  • 随着推理深度增加,性能下降超过 50%(具体数值与对比基线待核实)。
  • 策略约束问题暴露出严重失败,例如不可回答查询上的性能最低仅为 2.4%。
  • 痕迹分析显示失败主要集中在语言中介的推理环节(如实体消歧、跨源信息对齐),而非工具调用本身。

为什么重要

现有评测或关注个人代理的同意约束(SovereignPA-Bench),或关注检索增强生成与知识图谱问答的新方法(DynaKRAG、RSF-GLLM),而 VAKRA 将企业场景中的 API 调用、多跳检索与自然语言策略约束综合进一个可执行基准。其增量贡献在于暴露了模型在“语言推理”而非“工具调用机制”上的瓶颈,并为后续研究提供代码与数据资源。

局限与不确定性

  • 本卡片仅基于 arXiv 摘要,任务细节、具体模型列表、策略约束类型、性能下降的具体数值比较等尚未从材料完全确认,标记为待核实。
  • 摘要未提供与既有基准的对比实验细节,也未说明数据集的标注方式与构建流程。

可用于图书/PPT/简报的角度

  • 企业 AI 代理评测:为什么不能只测 API 调用或只测检索。
  • 工具使用策略合规:自然语言约束下不可回答问题的安全性含义。
  • 多跳推理的真正瓶颈:语言理解与跨源对齐,而非工具执行。

与既有脉络的关系

本卡片对应的是 VAKRA 基准(2026-08-12),它是对企业级代理评测的补充;与 SovereignPA-Bench 相比,它更关注结构化 API 与检索的组合及工具使用策略,而不是个人数据主权;与 DynaKRAG、RSF-GLLM 相比,它不是新方法,而是评测基准,并基于固定 ReAct 框架给出模型能力现状。

原始材料

  • 英文标题:VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
  • 英文关键词:API reasoning; multi-hop reasoning; retrieval; tool-use policies; agent benchmark
  • arXiv ID:2608.12282v1
  • 作者:Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
  • 发布时间:2026-08-12
  • URL:https://arxiv.org/abs/2608.12282v1
  • PDF:https://arxiv.org/pdf/2608.12282v1
  • 代码:https://github.com/IBM/VAKRA
  • 数据:https://huggingface.co/datasets/ibm-research/VAKRA