知识卡片:COVER:可识别地评估多智能体联盟路由
英文标题:COVER: Identifiable Evaluation of Coalition Routing
英文关键词:coalition routing; identifiable evaluation; multi-agent systems; foundation models(基于摘要内容推断)
一句话结论
COVER 是一种评估契约,通过在结果生成前固定公共信息边界、下游栈 G 和有限合法团队族,使有限基准上的“路由后悔值”(oracle regret)可被识别;受控测试表明它能暴露选择余量,但并未制造出“路由必胜”的结论。
事件概述或研究问题
多智能体系统在改变其团队时,也会改变它产生的消息和最终答案,因此端到端准确率差距本身并不能识别出“路由效应”。COVER 试图解决这一识别问题:如何在没有额外假设的情况下,把“选择不同团队/路由”的效果从系统整体表现中分离出来。
方法/产品要点
- 提出一种评估契约:在生成结果之前,固定公共信息边界、下游栈 G 和有限合法团队族。
- “完全覆盖”(complete coverage)可以在该固定栈条件下,识别出精确的有限基准 oracle regret。
- 对于任意有限集合的冻结策略,执行它们各自选定团队的并集,是对每对策略对比的最小无假设支持;但这并不支持绝对 oracle regret。
- 使用两个受控表进行测试,采用 source-ID-disjoint 的数据划分。
主要结果或产业意义
- MuSiQue-12:预先指定的特权阳性对照将 regret 从 0.532 降至 0.402;后来的公共接口对照达到 0.424(对比 0.554),但该对照是回顾性的。
- HotpotQA-4:预先指定的公共直接评分器将 regret 从 0.313 降至 0.110。
- 固定栈 Llama 执行:验证的路由 regret 改善 0.190;但原始答案增益仅为 0.010,且置信区间跨越零。
- ToolSandbox 五族变体偏移验证:对 14 个未接触任务变体彻底评估 16 个声明团队(224/224 有效行)。声明族 oracle 达到 0.768 安全证据完成率,而前瞻性冻结路由器为 0.637(regret 0.131),未通过预设的 0.10 标准。后来的回顾性比较器达到 0.655,与全工作人员匹配(平均工作人员数 4.57 vs 5.00)。
- 交叉栈诊断:绝对分数取决于下游栈 G,但未检测到可察觉的路由器×最终评分器交互。
产业意义在于:COVER 是一种可审计的评估方法论,而非对“栈无关”或“通用代理路由优越性”的宣称。它可以用来暴露模型/路由选择中的剩余空间,同时避免把路由效应与模型、栈或提示的效应混为一谈。
为什么重要
在智能体系统评测中,简单地比较端到端准确率会混淆多个因素。COVER 通过预先注册的评估契约和有限团队覆盖,使得“路由效果”在固定栈上可被识别。这有助于防止事后挑选对照来制造虚假的路由优势,也为多智能体路由评估提供了更严格的基准。
局限与不确定性
- 本卡片仅基于元数据生成,原文正文未能抓取;所有细节待核实。
- 所有 regret 结果均条件于固定下游栈 G 和有限团队族,不能外推为栈无关结论。
- 回顾性对照(retrospective)的证据强度低于预先指定对照。
- “未检测到交互”不等于不存在交互;统计功效和样本量信息待核实。
- 方法适用于有限合法团队族和冻结策略,对开放策略族或持续学习场景的适用性待核实。
可用于图书/PPT/简报的角度
- 以“团队换了,答案也换了,如何把路由效果识别出来?”作为引入问题。
- 展示“预注册评估契约”如何防止事后挑选有利对照或结果。
- 用 ToolSandbox 案例说明:即使路由器的 regret 未达到预设标准,这种“失败”恰恰证明了 COVER 的识别力——它没有制造出一个虚假的路由胜利。
与既有脉络的关系
本卡片是对“大模型智能体评估方法”脉络的延续,与已有卡片中关于预注册安慰剂对照(PoPE)和成本感知评估的侧重点不同。COVER 的增量信息在于:它专门处理多智能体“路由/团队选择”效应的可识别性问题,并引入有限基准 oracle regret 和团队覆盖作为评估契约。
原始材料
- 英文标题:COVER: Identifiable Evaluation of Coalition Routing
- 原始来源:https://arxiv.org/abs/2608.28475v1
- 正文:未能抓取,以上内容基于已知元数据(摘要/候选摘要)生成,细节待核实。