AI消息速览

GPT-5.6 实测:跑分领先,深度协作仍逊 Fable 5

事件日期 2026-07-13 · 产业观察 · 已接受

事件日期2026-07-13
信息日期2026-07-13
入库日期2026-07-13
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:GPT-5.6 实测:跑分领先,深度协作仍逊 Fable 5

一句话结论

GPT-5.6 在多项标准基准测试中领先、单任务官方标称成本约为 Fable 5 的一半,但第三方评测的智能指数接近 Fable 5;作者实测深度项目协作时表现死板、耗时巨大、额度消耗快,实际成本优势存疑。

事件概述

OpenAI 全量上线 GPT-5.6,官方宣称在 Terminal-Bench、DeepSWE 等基准上全面领先,单任务成本约为 Fable 5 的一半。第三方机构 Artificial Analysis 的 Sol 智能指数显示 GPT-5.6 得 59 分,贴近 Fable 5 的 60 分;Codex+Sol 以 80 分登顶编程榜单。作者实测一个深度项目协作任务,GPT-5.6 每步反复核对,一小时未完成 Fable 5 十分钟搞定的任务,且额度消耗极快,质疑官方“成本减半”的说法。

方法/产品要点

  • 模型版本:GPT-5.6(OpenAI 最新全量上线版本)。
  • 基准表现:官方称在 Terminal-Bench、DeepSWE 等基准全面领先,单任务成本约为 Fable 5 的一半。
  • 第三方评测:Artificial Analysis 的 Sol 智能指数:GPT-5.6 59 分 vs Fable 5 60 分;编程榜 Codex+Sol 以 80 分登顶。
  • 实测协作:作者进行深度项目协作测试,GPT-5.6 显得死板、每步反复核对,一小时未完成 Fable 5 十分钟完成的同类任务,额度消耗极快。
  • 发布会其他信息:Codex 更名 ChatGPT Work;桌面 App 五入口合一;GPT-5.4 将于 7 月 23 日下线;Sites 可将成果一键变为可交互网站。

主要结果或产业意义

  • 标准基准测试上 GPT-5.6 处于领先地位,但真实代理协作任务中表现不及 Fable 5,说明跑分与实际用户感受存在差距。
  • 官方宣称的成本优势在实测中受到质疑,任务耗时和额度消耗可能抵消单次任务标称成本优势。
  • 产品迭代加速:GPT-5.4 即将下线,Codex 改名、“Sites”功能上线,表明 OpenAI 在整合产品线、提升成果可交付性。

为什么重要

  • 这是 GPT-5.6 上线后首次从第三方实测角度揭示其“跑分强、协作弱”的短板,与已有 OpenRouter Fusion 等通过模型融合超越前沿性能的报道形成对比:即便单模型跑分领先,在复杂多步协作场景中传统预算模型+融合策略可能更具效率。
  • 为企业在选择 AI 模型时提供参考:不能仅看基准分数和理论成本,须在真实业务流中验证实际耗时、额度消耗和协作流畅度。
  • 与已有知识卡片《AA-Briefcase:前沿知识工作评估基准》形成补充:AA-Briefcase 侧重长周期知识工作评估,本条则聚焦单次深度项目协作中基准与实测的偏差。

局限与不确定性

  • 作者实测为单次任务、个案性质,未提供可复现的详细任务描述、参数设置和额度消耗数据,结论代表性待验证。
  • 未说明 Fable 5 的具体版本和配置,对比条件是否完全对等(如上下文长度、工具调用模式)待核实。
  • “单任务成本约为 Fable 5 一半”的官方声明与作者实测存在矛盾,需要更多第三方独立测试确认实际成本。
  • ChatGPT Work(原 Codex)的命名变更、桌面 App 合并等产品细节的功能影响待核实。

可用于图书/PPT/简报的角度

  • 技术对比:用 GPT-5.6 和 Fable 5 的跑分与实测对比,说明“基准不等于真实能力”。
  • 成本陷阱:以实测中额度消耗快为例,提醒企业警惕“标称成本”与实际使用成本之间的差距。
  • 产品演进:从 Codex 更名到 GPT-5.4 下线,反映 OpenAI 加速迭代并整合产品线,可作为 AI 产业快速变化的案例。
  • 选型决策:结合 OpenRouter Fusion 等融合方案,建议在需要复杂协作任务时考虑多模型组合而非单一旗舰模型。

原始材料

  • 来源:搜狐文章《实测GPT-5.6:跑分领先,深度协作仍逊Fable 5》(腾讯研究院AI速递 20260713)
  • URL: https://m.sohu.com/a/1049403897_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=1
  • 英文标题:GPT-5.6 Hands-on: Benchmark Leading, but Deep Collaboration Still Lags Behind Fable 5
  • 英文关键词:GPT-5.6, Fable 5, benchmark, evaluation, deep collaboration, cost