AA-Briefcase 是由 Artificial Analysis 发布的前沿知识工作基准测试,通过在模拟多周真实项目场景中评估 AI 模型的代理能力,揭示了当前顶级模型在长周期、碎片化上下文知识任务中的表现、成本与缺陷。
2026 年 6 月 18 日,Artificial Analysis 宣布推出 AA-Briefcase,这是一个用于测试 AI 模型在复杂、长期知识工作项目中表现的新基准。该基准由来自 Google、麦肯锡、波士顿咨询集团等机构的行业专家耗时数月构建,包含 4 个多周项目场景、91 个私有任务,以及近 2000 个源文件(包括超过 3500 封邮件和…