AI消息速览

马斯克发布 Grok 4.5,编码性能逼近 Opus,成本更低

事件日期 2026-07-10 · 产业观察 · 已接受

事件日期2026-07-10
信息日期2026-07-10
入库日期2026-07-10
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:马斯克发布 Grok 4.5,编码性能逼近 Opus,成本更低

一句话结论
马斯克旗下 SpaceXAI 与 Cursor 联合推出的旗舰模型 Grok 4.5 专为编码和智能体设计,在 SWE Bench Pro 和 Terminal Bench 2.1 上表现优异,以更低 Token 消耗和更快的推理速度实现了接近 Opus 4.8 的性能,被称为性价比之王。

事件概述
2026 年 7 月 10 日前后,马斯克旗下 SpaceXAI 联合代码开发平台 Cursor 发布了最新旗舰模型 Grok 4.5。该模型专注于代码生成与智能体长任务执行,训练数据包含数万亿 Token 的 Cursor 真实开发数据,采用“单 Token 智能度”策略和异步训练栈。发布时宣称其编码性能整体打平 GPT-5.5,逼近 Opus 4.8。

方法/产品要点

  • 模型定位:专为编码与智能体打造,主攻长步骤、多步骤的连续任务。
  • 训练数据:喂入数以万亿计 Cursor 真实开发数据,强调“单 Token 智能度”(每个 Token 携带更多信息)。
  • 训练架构:采用异步训练栈,支持智能体连续数小时执行长任务。
  • 推理速度:达 80 TPS(每秒 Token 处理数)。
  • 成本优势:同任务 Token 消耗仅为 Opus 4.8 的四分之一;定价为输入 2 美元、输出 6 美元(每百万 Token),被媒体称为“性价比之王”。

主要结果或产业意义

  • 基准测试成绩:SWE Bench Pro 得分为 64.7%,Terminal Bench 2.1 得分为 83.3%。
  • 对比表现:整体打平 GPT-5.5,逼近 Opus 4.8(具体差距百分比待核实)。
  • 产业意义:以更低的算力成本实现了接近顶级模型的编码能力,可能推动 AI 编程工具和智能体应用的普及,降低企业使用门槛。

为什么重要
Grok 4.5 在编码和智能体领域证明了“性价比路线”的可行性——不依赖最高算力堆叠,而是通过训练数据优化和架构创新,用更少的 Token 实现接近顶尖模型的效果。这对依赖 API 成本的中小开发者和企业尤其有吸引力,可能改变大模型市场的竞争格局。

局限与不确定性

  • 基准测试的具体实验设置和复现细节未在材料中说明(待核实)。
  • “逼近 Opus 4.8”的量化差距(如百分比)未给出;材料中仅提及“整体打平 GPT-5.5”,但 GPT-5.5 自身性能水平也未详细说明。
  • 异步训练栈对长任务稳定性的实际表现缺乏第三方验证。
  • 定价是否包含所有使用场景(如缓存、批量推理)未明确。

可用于图书/PPT/简报的角度

  • 技术路线对比:Grok 4.5 的“单 Token 智能度” vs. 传统模型堆参数的做法,可作为 AI 模型设计“少即是多”的案例。
  • 成本经济学:用该模型的实际定价(输入 2 美元、输出 6 美元)与 Opus 4.8 对标,制作成本-性能对比表。
  • 编码工具变革:结合 Cursor 平台,展示 AI 如何从辅助编码向自主智能体演进。
  • 竞争格局:对比 GPT-5.5、Opus 4.8 和 Grok 4.5 在编码任务上的表现,引出“性价比为王”的时代命题。

原始材料

  • 标题:腾讯研究院AI速递 20260710
  • 来源:搜狐(https://m.sohu.com/a/1048210346_455313)
  • 英文标题:Grok 4.5 Release by SpaceXAI and Cursor
  • 英文关键词:Grok 4.5, coding, agent, SWE Bench Pro, Terminal Bench, token efficiency, cost performance