AI消息速览

GPT-5.6《构建者指南》:最小模型成本暴降25倍,ARC-AGI-3提升至38.3%

事件日期 2026-08-15 · 产业观察 · 已接受

事件日期2026-08-15
信息日期2026-08-15
入库日期2026-08-15
通道产业观察
状态已接受
来源新智元

知识卡片:GPT-5.6《构建者指南》:最小模型成本暴降25倍,ARC-AGI-3提升至38.3%

英文关键词:GPT-5.6; ARC-AGI-3; BrowseComp; Ultrafast; cost reduction; builders guide

一句话结论

OpenAI 在《GPT-5.6 构建者指南》中披露:换用 Responses API 并开启“推理保留”与“压缩”后,GPT-5.6 Sol 在 ARC-AGI-3 公开题集上从 13.3% 提升到 38.3%,输出 Token 减少 6 倍;家族最小模型 Luna 在 BrowseComp 上以 84.04% 的成绩逼近 GPT-5.5 的 84.36%,成本从 33.27 美元降到 1.33 美元(约 25 倍)。

事件概述 / 研究问题

  • 2026年8月15日,新智元报道 OpenAI 发布《GPT-5.6 构建者指南》(Builders Guide to GPT-5.6),展示 GPT-5.6 在性能、成本与推理加速方面的改进。
  • 重点围绕三类工程手段:程序化工具调用、原生多智能体、提示词缓存;以及 Ultrafast 模式预览版。

方法/产品要点

  • ARC-AGI-3 提升
    • 原因诊断:ARC 官方“通用 harness”会每走一步丢弃模型私有推理过程,并在上下文满时从最老的截断,导致模型记忆被清空。
    • 解决方案:改用 Responses API,开启“推理保留”和“压缩”。
    • 结果:GPT-5.6 Sol 在公开题集上从 13.3% 升至 38.3%,输出 Token 减少 6 倍(材料原文表述)。
  • Luna 成本对比(BrowseComp)
    • GPT-5.5 Extra High:84.36%,总花费 33.27 美元。
    • GPT-5.6 最小模型 Luna Extra High:84.04%,总花费 1.33 美元。
    • 成绩相差 0.32 个百分点,成本下降约 25 倍。
  • 三种低成本部署方式
    • 程序化工具调用:模型可写 JavaScript 在沙箱中批量调用、筛选、汇总工具,只把最终结果返回主线程;Rogo 实测质量持平,输入 Token 少用 21%。
    • 原生多智能体:主模型拆解任务,子模型并行执行并汇总;ChatGPT ultra 档默认四个 agent 同时开工;Obvious 联创 Jon Bell 称六份需求同时处理“全程没散架”。
    • 提示词缓存:缓存有效期至少 30 分钟,支持自定义断点;Ploy 工程师对 29000 token 共享提示词加断点后,未命中缓存的输入少了 28%。
  • Ultrafast 模式预览版
    • GPT-5.6 Sol 最高 14 倍速,每秒 750 token,先在 OpenAI API 上线。
    • Cerebras 对照测试:Sol Ultrafast 跑完 Humanity’s Last Exam 全部 2500 题用时 11 小时 11 分;Claude Fable 5 用时 78 小时 27 分;准确率相当,速度差近 7 倍。

主要结果 / 产业意义

  • 官方叙事:三个月前只有旗舰模型才能完成的任务,现在最小最便宜的 Luna 也能做到“八九不离十”。
  • 实时响应不再是“换小模型”的专属场景:Ultrafast 模式用旗舰 Sol 实现了高吞吐、低延迟,可能改变部署策略。
  • 低成本部署组合(工具调用、多智能体、缓存)为初创团队提供了“保姆级”路径。

为什么重要

  • 本条是 GPT-5.6 发布一个月后的性能、成本更新,与此前“GPT-5.6 发布与 Claude 额度重置”等卡片形成延续。增量信息包括 ARC-AGI-3 具体提升、Luna 的 25 倍降本、Ultrafast 实测对比等。
  • 它说明大模型能力提升不只是基准分数的线性增长,也与推理保留、压缩、缓存等工程机制密切相关。

与既有脉络的关系

  • 已有卡片提到 GPT-5.6 分 Sol、Terra、Luna 三档并引入 ultra 多 agent 并行模式;本条补充了各档位的具体成本/性能证据,以及“ultra 默认四个 agent 同时开工”的细节。
  • 已有卡片提到 Anthropic 重置 Claude Fable 5 额度;本条补充了另一组对照:Claude Fable 5 跑 Humanity’s Last Exam 用时为 Sol Ultrafast 的近 7 倍。

局限与不确定性

  • 文中数据来自新智元对 OpenAI《构建者指南》及相关公司测试的转述;ARC-AGI-3 “官方榜 7.8%”与“换 harness 后公开题集 38.3%”的具体评分范围是否一致,待核实。
  • BrowseComp 的成本对比未说明是否包含全部 API 费用、是否计入缓存等,待核实。
  • Ultrafast 模式为预览版,最终可用范围、定价和延迟表现待核实。
  • 第三方测试(Rogo、Obvious、Ploy、Cerebras)的具体方法、样本量和复现性未在本材料中完整公开。

可用于图书/PPT/简报的角度

  • 用“同一模型换一套 harness 从 13.3% 到 38.3%”说明推理工程对模型表现的影响。
  • 用“Luna 成本从 33.27 美元降到 1.33 美元”说明模型降本的速度与边际。
  • 用“Ultrafast 模式每秒 750 token / 14 倍速”说明实时 AI 应用的新可能性。
  • 用“程序化工具调用 / 原生多智能体 / 提示词缓存”作为企业部署低成本的三个操作抓手。

原始材料

  • 中文标题:GPT-5.6一夜刷新AI智能天花板!最小模型成本暴降25倍
  • 作者/发布方:AIERA 转载新智元报道;发布于 2026年8月15日
  • 英文关键词(原题为中文,以下为检索用关键词):GPT-5.6; ARC-AGI-3; BrowseComp; Ultrafast; cost cut
  • URL: https://aiera.com.cn/2026/08/15/other/admin/109218/gpt-5-6%e4%b8%80%e5%a4%9c%e5%88%b7%e6%96%b0ai%e6%99%ba%e8%83%bd%e5%a4%a9%e8%8a%b1%e6%9d%bf%ef%bc%81%e6%9c%80%e5%b0%8f%e6%a8%a1%e5%9e%8b%e6%88%90%e6%9c%ac%e6%9a%b4%e9%99%8d25%e5%80%8d