AI消息速览

schema框架近乎攻破ARC-AGI-3,让AI像物理学家思考

事件日期 2026-07-20 · 产业观察 · 已接受

事件日期2026-07-20
信息日期2026-07-20
入库日期2026-07-20
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:schema框架近乎攻破ARC-AGI-3,让AI像物理学家思考

一句话结论

伯克利等团队提出的harness框架schema,通过将世界模型编写为可运行、可验证、可搜索的程序,在不改动模型权重的前提下,将Claude Code基线在ARC-AGI-3公开集上的42.83% RHAE提升至98.98%,但成绩为自报告,尚未经官方独立复核。

事件概述

伯克利等研究团队推出名为“schema”的harness框架,在ARC-AGI-3公开集上,配合Claude Opus 4.8与Fable 5模型,达到了98.98%的RHAE(Robot-Human Alignment Evaluation?待核实具体指标全称)。该方法的核心思想是让AI像物理学家一样思考:通过“观察—推演—执行—记录”的闭环,让模型主动实验并用现实来否证假设。

方法/产品要点

  • 核心机制:将世界模型写成可运行、可验证、可搜索的程序,形成一个外层harness(支架)。
  • 工作流程:“观察—推演—执行—记录”闭环,使模型能够通过实验来检验和修正假设。
  • 模型无关性:不修改底层模型权重,仅依靠外层harness来引导推理过程。

主要结果

  • 在ARC-AGI-3公开集上,使用Claude Opus 4.8与Fable 5,schema框架达到98.98% RHAE。
  • 对比基线:Claude Code单独使用时仅为42.83% RHAE,提升幅度超过56个百分点。
  • 成绩来源:团队自报告,官方尚未进行独立复核。

为什么重要

  • 范式突破:展示了无需更新模型参数,仅通过外部推理框架即可大幅提升模型在抽象推理任务上的表现,为“小模型+强支架”路线提供了有力证据。
  • 启发意义:将科学方法论(实验、否证)引入AI推理流程,可能适用于其他需要复杂常识推理的场景。
  • 增量信息:与已有卡片(如AlphaEvolve关注自动算法发现、AlphaEarth Earthings关注地理映射)不同,本卡片聚焦于通过“世界模型程序化”提升抽象推理能力,属于AI对齐与推理框架的创新。

局限与不确定性

  • 未独立复核:98.98%为团队自报告结果,需等待第三方独立验证。
  • 公开集限制:仅在ARC-AGI-3公开集上测试,未说明在私有集或更广泛任务上的泛化能力。
  • 计算成本:使用Claude Opus 4.8与Fable 5等顶级模型,框架本身的额外开销和运行成本未披露。
  • 可迁移性:该方案是否适用于其他模型家族(如开源模型)或低性能模型尚待确认。

可用于图书/PPT/简报的角度

  • 主题:AI推理的新范式——从“大模型”到“强支架”
  • 关键案例:schema框架如何通过“物理学家式思考”让AI成绩翻倍
  • 对比:传统微调 vs. 外部harnes框架的优缺点
  • 启示:未来AI研发的重心可能从模型规模转向推理架构设计

原始材料

  • URL: https://m.sohu.com/a/1052230396_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=7
  • Parent digest: 腾讯研究院AI速递 20260720
  • 英文标题: schema framework nearly cracks ARC-AGI-3, making AI think like a physicist
  • 英文关键词: schema, ARC-AGI-3, harness, world model, RHAE