知识卡片:Claude Opus 5 正式发布,性能接近Fable 5但价格减半
一句话结论
Anthropic于2026年7月27日正式发布Claude Opus 5,在多项编程与知识工作评测中刷新纪录,智能水平接近竞品Fable 5,但每百万输入/输出价格仅为其一半(输入5美元、输出25美元),并已成为Claude Max默认模型。官方称其为迄今对齐程度最高、欺骗行为发生率最低的模型,但在生物研究与进攻性网络安全两用能力方面仍落后于Mythos 5。
事件概述
2026年7月27日,Anthropic发布新一代旗舰模型Claude Opus 5。该模型在Frontier-Bench、ARC-AGI 3等评测中取得领先成绩,自主核查与迭代能力增强,可自建测试框架并修复真实漏洞。定价策略极具竞争力:每百万输入token仅5美元、输出25美元,约为Fable 5的一半。模型现已作为Claude Max默认模型上线。
方法/产品要点
- 定价与可用性:每百万输入5美元、输出25美元;已成为Claude Max默认模型。
- 评测表现:在Frontier-Bench、ARC-AGI 3等编程与知识工作基准中刷新纪录。
- 核心能力提升:自主核查与迭代能力增强,能够自建测试框架并修复真实环境中的漏洞。
- 对齐与安全:官方称其为迄今对齐程度最高的模型,欺骗行为发生率最低;但在生物研究与进攻性网络安全等两用能力上仍落后于Mythos 5(待核实Mythos 5的具体身份,可能为另一家竞品)。
产业意义
- 价格竞争加剧:以接近顶级性能但半价策略,进一步压低大模型API使用成本,可能迫使竞品跟进降价。
- 对齐新标杆:官方强调“欺骗行为最低”和“对齐程度最高”,为AI安全实践提供了可量化的新基准。
- 自主性增强:模型可自建测试框架并修复漏洞,预示着AI在软件开发自动化中从辅助角色向执行角色演进。
为什么重要
相比此前已发布的Claude Opus 5信息(2026-07-24至07-26),本条材料提供了更具体的价格数字、两用能力对比(落后于Mythos 5),以及官方对齐评价。这些增量细节有助于理解Opus 5在安全与性能平衡上的真实位置,以及其定价策略对行业格局的冲击。
局限与不确定性
- 关于“Mythos 5”的身份与来源:材料中未明确其所属公司,需进一步确认是否为另一家模型(如Google或OpenAI未来产品)。
- 自主核查与迭代能力的具体评测场景与可信度尚需第三方复现。
- “欺骗行为发生率最低”的评估方法与数据集未在材料中详细披露。
可用于图书/PPT/简报的角度
- 大模型定价战的拐点:半价策略如何重塑市场竞争格局。
- AI对齐的新评估维度:从“能力”到“诚实度”的转向。
- 自主编程代理的进化:模型自建测试框架修复漏洞的实践意义。
与既有脉络的关系
本卡片补充了已有卡片中未提及的价格细节、两用能力对比、以及“对齐最高”的官方声明,是对前序卡片(Claude Opus 5发布、半价干翻Fable 5、自我保护意识)在安全性与价格战术层面的事实更新。
原始材料
- URL: https://m.sohu.com/a/1055048777_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=1
- 原始标题: 腾讯研究院AI速递 20260727
- 英文关键词: Claude Opus 5, Anthropic, AI pricing, frontier benchmarks, AI alignment