AI消息速览

Epoch AI 能力与基准测试中心

事件日期 2026-08-03 · 产业观察 · 已接受

事件日期2026-08-03
信息日期2026-08-03
入库日期2026-08-05
通道产业观察
状态已接受
来源epoch.ai

知识卡片:Epoch AI 能力与基准测试中心

一句话结论:Epoch AI 运营着一个公开的 AI 能力与基准测试数据库,汇集自测与外部基准结果,用于追踪前沿模型在数学、编程、代理任务等维度的表现趋势。

事件概述或研究问题

Epoch AI 在其官网上推出“AI Capabilities and Benchmarking Hub”(AI 能力与基准测试中心),目标是建立关于基准测试结果的数据库,展示领先 AI 模型在挑战性任务上的表现。该数据库既包含 Epoch AI 内部评测的基准,也包含从外部来源收集的数据,支持按时间、基准或模型探索 AI 能力趋势。

方法/产品要点

  • 数据库类型:一个可交互的基准测试数据平台,提供 “Data explorers”(数据探索器),并与 Epoch AI 的模型、数据中心、芯片、公司等数据产品并列。
  • 基准来源分类:
    • Epoch AI–run benchmarks:如 FrontierMath Tiers 1-3/4、MirrorCode、SWE-bench Verified、Chess Puzzles、GPQA Diamond、MATH Level 5 等。
    • Benchmark creator–run benchmarks:如 Humanity's Last Exam、ARC-AGI-2、GDPval、OSWorld 2.0、Terminal-Bench 2.0、SciCode、Video-MME 等。
    • Model developer–run benchmarks:如 LiveBench、MMLU、GSM8K、HellaSwag、SuperGLUE 等。
  • 可按基准类型筛选:数学、代理(Agent)、软件工程、游戏、世界知识、科学、多模态、长上下文、写作与创造力。
  • 页面提供 “Frontier trend only” 等设置选项,并可进一步按国家、机构、可访问性筛选。

主要结果或产业意义

页面中的“Benchmarking updates”显示近期更新示例:

  • 2026 年 8 月 3 日:MirrorCode 排行榜更新,Claude Fable 5 以 64% 的得分领先,GPT-5.6 Sol 为 20%。
  • 2026 年 7 月 31 日:FrontierMath: Open Problems 扩展至 50 个重要的未解数学问题,AI 目前解决了 3 个。
  • 2026 年 7 月 28 日:AI 找到了 2-adic 数域绝对 Galois 群的一个表示,成为 FrontierMath: Open Problems 中解决的第二个问题。

这些更新反映了该中心正在持续跟踪前沿模型在编程和数学研究等方面的能力进展。

为什么重要

该中心是一个聚合型基准测试基础设施:不同于单个基准(如 AA-Briefcase 或模型融合实验),它同时提供自建基准、外部基准和模型开发者基准的汇总视图,并给出趋势分析入口。这为研究机构、政策制定者和产业界提供了一个统一观察 AI 能力演进的窗口。相对于已有相关卡片中针对单一基准或单一工具的介绍,本条增量信息在于:Epoch AI 正在运营一个持续更新的、多来源、多维度的基准测试平台,并已产出如 MirrorCode 和 FrontierMath Open Problems 的最新结果。

局限与不确定性

  • 页面本身是介绍性门户,未给出各基准的具体评测方法、数据采样、评分标准和潜在偏差,相关细节待核实。
  • 更新中提到的模型名称(如 Claude Fable 5、GPT-5.6 Sol)和具体分数来自页面显示,但其完整评测条件、日期口径和可重复性待核实。
  • “Epoch Capabilities Index”在页面中仅为菜单项,未在抓取文本中给出具体定义或方法,待核实。
  • FrontierMath: Open Problems 中“AI 已解决 3 个”的具体问题名称和验证流程待核实。

可用于图书/PPT/简报的角度

  • 以 Epoch AI 的基准测试中心为例,说明“AI 能力评估基础设施”如何通过标准化基准、公开排行榜和趋势数据帮助社会理解 AI 进展。
  • 引用 MirrorCode 更新展示前沿模型在代码生成上的相对差距;引用 FrontierMath: Open Problems 展示 AI 在数学研究任务中已能解决部分公开未解问题。
  • 比较不同基准来源(Epoch 自测、基准创建者、模型开发者)在可信度和利益冲突上的差异,作为评估 AI 能力的讨论素材。

原始材料

  • 英文标题:AI Capabilities and Benchmarking Hub
  • 英文关键词:benchmark-evaluation; AI capabilities; Epoch AI; FrontierMath; MirrorCode
  • 原始来源:https://epoch.ai/benchmarks
  • 页面更新日期:Aug. 5, 2026(据抓取内容显示)