AI消息速览

半价干翻Fable 5?Anthropic 发布 Claude Opus 5 实测炸场

事件日期 2026-07-25 · 产业观察 · 已接受

事件日期2026-07-25
信息日期2026-07-25
入库日期2026-07-26
通道产业观察
状态已接受
来源量子位

知识卡片:半价干翻Fable 5?Anthropic 发布 Claude Opus 5 实测炸场

英文标题: Claude Opus 5: Half the Price, Beats Fable 5?
英文关键词: AI industry; Claude; Opus 5; Fable 5; coding agent; cost efficiency
原始来源: https://www.qbitai.com/2026/07/460253.html

一句话结论

Anthropic 于 2026 年 7 月 25 日发布的 Claude Opus 5 在多项硬核评测中追平或反超竞品 Fable 5,价格仅为后者一半,且模型判断力的大幅提升使 Claude Code 系统提示词被删减逾 80% 而成绩不变。

事件概述

Anthropic 于 2026 年 7 月 25 日凌晨正式推出 Claude Opus 5 模型。该模型在 Frontier-Bench、ARC-AGI-3、Human’s Last Exam 等测试中表现优异,尤其以“半价对标 Fable 5”的性价比引发热议。发布当天,网友已展示大量代码、3D 可视化、物理模拟等创意用例,评价普遍正面。

方法/产品要点

  • 定价:每百万 token 输入 5 美元、输出 25 美元,与 Opus 4.8 同价,为 Fable 5 的一半。另提供 Fast 模式(两倍价格,2.5 倍速度)。
  • 核心性能
    • Frontier-Bench v0.1:43.3%(Fable 5 为 33.7%,Opus 4.8 为 21.1%)
    • ARC-AGI-3:30.2%(GPT-5.6 Sol 仅 7.8%,Opus 4.8 提升近 20 倍)
    • Human’s Last Exam(无工具):56.3%(Fable 5 为 56.5%);启用工具后 64.7%(反超 Fable 5 的 63.9%)
    • 编程智能体、搜索问答等多项均小幅领先。
  • 安全护栏:预计触发拦截频率较 Fable 5 降低约 85%。
  • IMO 2026 竞赛:取得满分成绩,未使用外部工具。
  • Claude Code 系统提示词优化:为适配 Opus 5 的判断力,Anthropic 将系统提示词删减超 80%,编码评测成绩未下降;核心改动包括:将“默认不写注释”规则替换为“贴合周围代码风格”;工具接口简化;采用“渐进式披露”上下文加载;模型可自主判断并写入记忆。

主要结果或产业意义

  • Opus 5 以 Fable 5 一半的价格实现了接近或超越的性能,尤其在 ARC-AGI-3(全新问题泛化)和 Frontier-Bench(硬核编程)上优势显著。
  • 在多个第三方测试中(如 atomic.chat 的物理破坏场景),Opus 5 以 0.508 美元全部正确完成任务,Fable 5 成本几乎翻倍且部分失败。
  • 博主 Victor M 的波音 747 重建测试中,Opus 5 执行了更严格的自检流程(从渲染图像提取 14 项几何指标并核对公差),展现了“自我验证”的建模能力。
  • 网友评价包括“差点从椅子上摔下来”“甩开所有其他模型”“像 Fable 6”等。

为什么重要

  • 本条卡片是对已有卡片(如 AlphaEvolve)的更新与延续:Opus 5 证明了前沿模型在“判断力”上的跃升,使得系统设计从“规则硬堵”转向“信任模型自主决策”,这为下一代 AI Agent 架构提供了新的范本。
  • 价格减半而性能不降,可能加速行业对高性能模型的采用,并加剧主要模型厂商之间的性价比竞争。

局限与不确定性

  • 部分评测项目的具体方法论和随机误差未详细披露,需等待第三方独立复现。
  • Opus 5 在部分测试(如 Fable 5 擅长的某些维度)上仍存在微小差距(如 CursorBench 最高设置差 0.5%),极端场景下的鲁棒性待验证。
  • “半价”仅基于公开定价,实际使用中若 token 消耗量显著高于 Fable 5,总成本可能接近(文章指出旧版本泄露时曾有此担忧,但本次测试未再现该问题)。
  • Claude Code 系统提示词删减的具体效果仅针对编码评测,对其他场景的泛化性尚未公布。

可用于图书/PPT/简报的角度

  • 性价比之战:以 Opus 5 为例,说明 AI 模型竞争已从单纯性能转向“性能/价格比”的精准博弈。
  • 判断力经济:提示词工程正从“写规则”迈向“给信任”,模型判断力提升后,系统复杂度可大幅降低。
  • 自验证能力:Opus 5 在 CAD/建模任务中展示的“自己验证自己”的能力,是 Agent 自主性从“执行”到“评估”的关键跃迁。

原始材料

  • Anthropic 官方公告:https://www.anthropic.com/news/claude-opus-5
  • Claude 博客关于系统提示词优化的文章:https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
  • 量子位报道(本文来源):https://www.qbitai.com/2026/07/460253.html