知识卡片:Claude Opus 5模型发布
一句话结论:Anthropic于2026年7月24日发布Claude Opus 5,在编程、知识工作和长期代理任务上实现显著性能提升,定价与上一代Opus 4.8相同,但多项基准测试性能接近旗舰模型Fable 5并在部分任务超越之,成为Claude Max的新默认模型和Claude Pro上的最强模型。
事件概述:Anthropic发布了Opus家族的升级版本Claude Opus 5。该模型专为需要长时间运行的代理任务设计,在编码、知识工作、科学研究和视觉输出等方面均有改进。根据官方公告,Opus 5在多项基准测试中创下新纪录,尤其是在软件工程任务(如Frontier-Bench v0.1、CursorBench 3.2)和知识推理任务(如ARC-AGI 3、Zapier AutomationBench)上表现突出。它还是Anthropic在自动化行为审计中被评为“最对齐”和“最安全”的模型。
方法/产品要点:
- 定价与定位:Opus 5的价格与上一代Opus 4.8相同,但性能大幅提升。它被定位为Fable 5以下的最强“前沿”模型,但成本仅为Fable 5的一半。
- 努力度设置(Effort Setting):用户可以调节模型的“努力度”以平衡智能水平与成本效率。在低努力度下,Opus 5在完成任务数量上仍超越其他模型。
- 默认与可用性:Opus 5成为Claude Max的默认模型,同时也是Claude Pro上最强的可用模型。
- 安全与对齐:在部署前的自动化行为审计中,Opus 5在整体“不当行为”评分上达到2.3,是近期评估模型中的最低值;它更好地遵循了Claude宪法,欺骗行为率最低,且最不容易被诱导滥用。
主要结果:
- 软件工程:在Frontier-Bench v0.1上,Opus 5的表现超过所有其他模型,且性能是Opus 4.8的两倍以上,每任务成本更低。在CursorBench 3.2上,以最大努力度运行时,性能接近Fable 5的峰值(差距在0.5%以内),但每任务成本减半。
- 知识工作与推理:在ARC-AGI 3(解决新颖问题)上,Opus 5的得分是次优模型的三倍。在Zapier AutomationBench(端到端业务任务)上,同样成本下的通过率约为次优模型的1.5倍;即使在最低努力度设置下,它也超过了其他任何模型能完成的任务数。
- 计算机使用(OSWorld 2.0):Opus 5以略高于Fable 5三分之一的成本超越了Fable 5的最佳成绩。
- 科学研究:在所有生命科学评估(结构生物学、有机化学、生物信息学)上,Opus 5均优于Opus 4.8。在有机化学任务(从光谱数据推断分子结构)上得分高出10.2个百分点;在蛋白质序列-功能预测上高出7.7个百分点。
- 早期用户反馈:来自Cursor、Devin、Zapier、Lovable、Box、JetBrains等多家公司的CEO与CTO反馈,Opus 5在复杂调试、金融建模、法律代理、前沿编码和数值推理等任务中表现出更强的判断力、一致性和效率,经常在较少的推理token和延迟下实现超越上一代的准确性。
为什么重要:
- 提升Opus系列的性价比天花板:Opus 5在同等成本下实现了接近旗舰Fable 5的智能水平,使“高智能+低成本”的组合更加普及。
- 强化长期代理与自主工作能力:材料中的多个早期测试案例显示,Opus 5能够自主发现并解决复杂问题(如没有直接查看图纸时自行编写视觉管道重建3D模型、发现开源包管理器中社区补丁遗漏的深层bug),体现了更强的主动性和自我纠正能力。
- 对齐与安全新标杆:Anthropic声称Opus 5是其最对齐且最安全的模型,这对企业用户和监管关注尤为重要。
局限与不确定性:
- 安全任务的短板:材料明确说明,在网络安全任务上Opus 5仍然落后于Mythos 5模型。
- 第三方独立验证:所有基准成绩和用户反馈均由Anthropic或其早期合作伙伴提供,尚未有大规模、独立的第三方复现报告。材料的实验设置(如努力度调节、具体提示工程)是否完全可复现,待核实。
- 长期应用表现:虽然短期评测优秀,但Opus 5在超大规模、数月以上的实际生产环境中的表现,待核实。
- 对比模型命名:材料提到“Fable 5”、“Mythos 5”等模型,这些模型的公开定价和适用场景,待核实。
与既有脉络的关系:
- 与“阿尔伯塔省政府使用Claude Code”和“UST引入Claude”相比:本条是对Anthropic模型家族的根本更新(而非具体应用案例),提供了新一代Opus模型的核心能力基准。阿尔伯塔和UST案例中使用的可能是Opus 4.8或更早版本,Opus 5的发布将使这些应用获得性能提升潜力。
- 延续了“Claude for Teachers”所体现的Anthropic规模化产品策略:通过降低高昂定价的障-碍(Opus 5同等价格、更高性能),Anthropic继续推动前沿模型在日常场景中的可用性。
可用于图书/PPT/简报的角度:
- “成本减半,能力翻倍”:以Feable 5一半成本实现接近其性能的Opus 5,可用于讲述前沿AI算力的普惠趋势。
- “智能体自觉纠错”:用“自行构建视觉管道读取图纸”、“发现社区遗漏的深层bug”等案例,强调AI从“执行指令”到“自主判断与验证”的跳变。
- “对齐与安全不是滞后项”:展示量化评分(行为审计得分2.3),说明前沿模型可以在能力飞跃同时降低风险,回应社会对AI安全的关切。
原始材料: URL: https://www.anthropic.com/news/claude-opus-5 Track: industry Topics: ai-industry Original English Title: Introducing Claude Opus 5 Keywords: Anthropic, Claude Opus 5, frontier model, coding, knowledge work, cost-effectiveness, safety, alignment, agent performance