知识卡片:VAKRA——在工具使用策略下评估跨API与检索的多跳推理
一句话结论
VAKRA 是一个面向企业级代理的可执行基准,将结构化 API 调用与文档检索结合在同一评测中,并引入自然语言工具使用策略约束。评测发现当前最强模型在组合 API 任务上仅约 50% 准确率,在策略约束下的不可回答查询上最低仅有 2.4%。
事件概述或研究问题
现有基准通常分别评估 API 调用能力和知识检索能力,但企业代理实际部署中需要同时跨结构化 API 和文档集合进行推理,并遵守工具使用策略。该论文提出 VAKRA 基准来填补这一评估空白。
方法/产品要点
- VAKRA 包含超过 8,000 个可执行 API,覆盖 62 个领域。
- 任务设置由易到难分三种:多样 API 交互风格、结构化 API 上的多跳推理、带自然语言工具使用策略约束的多源推理。
- 正确性验证通过重新执行预测的工具调用并对照实时 API 完成,允许多个有效路径。
- 使用固定 ReAct harness 来隔离模型能力与代理架构差异。
- 评测对象包括前沿模型和开放权重模型。具体模型名单待核实。
主要结果或产业意义
- 最佳模型在单跳端点式任务上准确率为 70.4%,在组合 API 任务上降至 50%–51%。
- 随着推理深度增加,性能下降超过 50%(具体数值与对比基线待核实)。
- 策略约束问题暴露出严重失败,例如不可回答查询上的性能最低仅为 2.4%。
- 痕迹分析显示失败主要集中在语言中介的推理环节(如实体消歧、跨源信息对齐),而非工具调用本身。
为什么重要
现有评测或关注个人代理的同意约束(SovereignPA-Bench),或关注检索增强生成与知识图谱问答的新方法(DynaKRAG、RSF-GLLM),而 VAKRA 将企业场景中的 API 调用、多跳检索与自然语言策略约束综合进一个可执行基准。其增量贡献在于暴露了模型在“语言推理”而非“工具调用机制”上的瓶颈,并为后续研究提供代码与数据资源。
局限与不确定性
- 本卡片仅基于 arXiv 摘要,任务细节、具体模型列表、策略约束类型、性能下降的具体数值比较等尚未从材料完全确认,标记为待核实。
- 摘要未提供与既有基准的对比实验细节,也未说明数据集的标注方式与构建流程。
可用于图书/PPT/简报的角度
- 企业 AI 代理评测:为什么不能只测 API 调用或只测检索。
- 工具使用策略合规:自然语言约束下不可回答问题的安全性含义。
- 多跳推理的真正瓶颈:语言理解与跨源对齐,而非工具执行。
与既有脉络的关系
本卡片对应的是 VAKRA 基准(2026-08-12),它是对企业级代理评测的补充;与 SovereignPA-Bench 相比,它更关注结构化 API 与检索的组合及工具使用策略,而不是个人数据主权;与 DynaKRAG、RSF-GLLM 相比,它不是新方法,而是评测基准,并基于固定 ReAct 框架给出模型能力现状。
原始材料
- 英文标题:VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
- 英文关键词:API reasoning; multi-hop reasoning; retrieval; tool-use policies; agent benchmark
- arXiv ID:2608.12282v1
- 作者:Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
- 发布时间:2026-08-12
- URL:https://arxiv.org/abs/2608.12282v1
- PDF:https://arxiv.org/pdf/2608.12282v1
- 代码:https://github.com/IBM/VAKRA
- 数据:https://huggingface.co/datasets/ibm-research/VAKRA