知识卡片:马斯克发布 Grok 4.5,编码性能逼近 Opus,成本更低
一句话结论
马斯克旗下 SpaceXAI 与 Cursor 联合推出的旗舰模型 Grok 4.5 专为编码和智能体设计,在 SWE Bench Pro 和 Terminal Bench 2.1 上表现优异,以更低 Token 消耗和更快的推理速度实现了接近 Opus 4.8 的性能,被称为性价比之王。
事件概述
2026 年 7 月 10 日前后,马斯克旗下 SpaceXAI 联合代码开发平台 Cursor 发布了最新旗舰模型 Grok 4.5。该模型专注于代码生成与智能体长任务执行,训练数据包含数万亿 Token 的 Cursor 真实开发数据,采用“单 Token 智能度”策略和异步训练栈。发布时宣称其编码性能整体打平 GPT-5.5,逼近 Opus 4.8。
方法/产品要点
- 模型定位:专为编码与智能体打造,主攻长步骤、多步骤的连续任务。
- 训练数据:喂入数以万亿计 Cursor 真实开发数据,强调“单 Token 智能度”(每个 Token 携带更多信息)。
- 训练架构:采用异步训练栈,支持智能体连续数小时执行长任务。
- 推理速度:达 80 TPS(每秒 Token 处理数)。
- 成本优势:同任务 Token 消耗仅为 Opus 4.8 的四分之一;定价为输入 2 美元、输出 6 美元(每百万 Token),被媒体称为“性价比之王”。
主要结果或产业意义
- 基准测试成绩:SWE Bench Pro 得分为 64.7%,Terminal Bench 2.1 得分为 83.3%。
- 对比表现:整体打平 GPT-5.5,逼近 Opus 4.8(具体差距百分比待核实)。
- 产业意义:以更低的算力成本实现了接近顶级模型的编码能力,可能推动 AI 编程工具和智能体应用的普及,降低企业使用门槛。
为什么重要
Grok 4.5 在编码和智能体领域证明了“性价比路线”的可行性——不依赖最高算力堆叠,而是通过训练数据优化和架构创新,用更少的 Token 实现接近顶尖模型的效果。这对依赖 API 成本的中小开发者和企业尤其有吸引力,可能改变大模型市场的竞争格局。
局限与不确定性
- 基准测试的具体实验设置和复现细节未在材料中说明(待核实)。
- “逼近 Opus 4.8”的量化差距(如百分比)未给出;材料中仅提及“整体打平 GPT-5.5”,但 GPT-5.5 自身性能水平也未详细说明。
- 异步训练栈对长任务稳定性的实际表现缺乏第三方验证。
- 定价是否包含所有使用场景(如缓存、批量推理)未明确。
可用于图书/PPT/简报的角度
- 技术路线对比:Grok 4.5 的“单 Token 智能度” vs. 传统模型堆参数的做法,可作为 AI 模型设计“少即是多”的案例。
- 成本经济学:用该模型的实际定价(输入 2 美元、输出 6 美元)与 Opus 4.8 对标,制作成本-性能对比表。
- 编码工具变革:结合 Cursor 平台,展示 AI 如何从辅助编码向自主智能体演进。
- 竞争格局:对比 GPT-5.5、Opus 4.8 和 Grok 4.5 在编码任务上的表现,引出“性价比为王”的时代命题。
原始材料
- 标题:腾讯研究院AI速递 20260710
- 来源:搜狐(https://m.sohu.com/a/1048210346_455313)
- 英文标题:Grok 4.5 Release by SpaceXAI and Cursor
- 英文关键词:Grok 4.5, coding, agent, SWE Bench Pro, Terminal Bench, token efficiency, cost performance