知识卡片:APEX-Accounting——前沿模型会计能力基准
一句话结论
APEX-Accounting 是一个由 Mercor 与 Ramp 联合构建的封闭会计任务基准,用于评估前沿模型是否能完成真实会计师的工作。当前最佳模型 Claude-Fable-5 (Max) 在 Mean Criteria@3 上仅达到 56.4%,且所有模型在严格通过率(Pass^8)上均低于 3%,表明现有模型尚不具备可靠的会计实务能力。
事件概述或研究问题
APEX-Accounting 旨在回答:当前最先进的 AI 模型能否像专业会计师一样完成对账、应计费用、过账和生成报告等真实业务操作?该基准将会计任务从理论问题扩展为包含完整会计系统、电子表格、PDF 等真实工作环境的综合评估。
方法/产品要点
- 数据与任务:私有评估集包含 160 个任务,分布在 10 个“世界”(world)中。每个世界模拟一个独立会计环境,包含会计系统、电子表格、PDF 及其他文件。
- 专家参与:每项任务均由会计与簿记专家亲手编写并求解,同时制定详细的评分标准(grading rubrics)。
- 评估指标:主要指标是 Mean Criteria@3(前三候选的平均标准符合度)和 Pass^8(在 8 次尝试中至少一次完全正确?原文为 Pass^8 和 Pass@8,需进一步确认定义)。
- 闭源基准:APEX-Accounting 是封闭基准,可按要求为任意前沿模型运行排行榜评估。
主要结果或产业意义
- 在 9 个前沿模型中,Claude-Fable-5 (Max) 以 56.4% Mean Criteria@3 领先,Muse-Spark-1.1 (xHigh) 以 52.6% 紧随其后。
- 严格通过率极低:所有模型在 Pass^8 上均不超过 2.6%(GPT-5.6-Sol (Max+Pro)),最高 Pass@8 为 21.5%(Muse-Spark-1.1 (xHigh))。
- 辛普森悖论:当 token 预算从 $1 增加到 $50 时,整体分数上升,但在同一预算水平内,花费更多 token 的任务上模型得分反而更低。这揭示了成本-性能关系的复杂性。
为什么重要
- 现有 AI 基准多聚焦于代码生成、数学推理或通用知识,APEX-Accounting 首次系统评估了模型在专业会计实务(涉及多文件、多步骤、多凭证操作)中的表现。
- 结果明确显示当前最强模型距离胜任会计工作仍有很大差距(Pass^8 < 3%),为财务自动化领域指出当前技术天花板。
- 辛普森悖论的发现提示研究者:简单增加推理计算量并不总能带来对应收益,需关注预算分配对评测公平性的影响。
局限与不确定性
- 基准完全闭源,无法独立复现或验证任务难度;模型评估结果可能因提示措辞、评估协议不同而变化(待核实是否提供标准评估接口)。
- 指标 Pass^8 和 Pass@8 的具体计算方式(如是否允许多次采样、采样策略)未经详细说明(待核实)。
- 测试的模型名单中包含多个非公开模型(如 Claude-Fable-5、Muse-Spark-1.1、GPT-5.6-Sol),其确切版本和训练信息需参考原文。
- 160 个任务是否覆盖会计行业的全谱系技能(如税务、审计、报表合并等)尚不明确(待核实)。
可用于图书/PPT/简报的角度
- 财务自动化现状:展示 AI 在专业会计领域的进展与瓶颈,适合作为“AI 赋能行业”章节的案例分析。
- 基准设计方法论:如何构建包含多文件、多步骤、专家评分标准的真实世界基准,可迁移至法律、医疗等类似领域。
- 辛普森悖论案例:作为模型评测中资源分配陷阱的教学示例,提示实验设计需谨慎。
- 提示工程启示:尽管 token 预算增加,高成本任务仍表现更差,说明单纯增加算力不解决底层推理缺陷。
原始材料
- URL: https://arxiv.org/abs/2607.27189v1
- 标题: APEX-Accounting(待核实正式论文标题)
- 关键词: foundation-model, benchmarking, accounting, AI capability
- 来源: arXiv preprint, 2026(根据 ID 推测)