知识卡片:Grok 4.5:Cursor与SpaceXAI联合发布的首个多领域智能模型
一句话结论
Grok 4.5 是 Cursor 与 SpaceXAI 联合训练的混合专家模型,在软件工程之外还能处理数据科学、金融、法律等复杂知识工作,通过强化学习和大规模真实环境数据实现了跨领域的高性能,但 CursorBench 测试因训练数据意外泄露而存在偏差。
事件概述
2026年7月8日,Cursor 团队在官方博客宣布与 SpaceXAI 合作,正式发布 Grok 4.5。这是 Cursor 迄今为止最智能的模型,也是第一个为超越软件工程而构建的模型。模型可处理需要创造性使用工具的长期复杂任务,覆盖软件工程、数据科学、金融、法律等领域。同时,Cursor 上线了新的订阅计划,对个人和团队用户提供显著用量,并在首周双倍配额。
方法/产品要点
- 模型架构:混合专家模型(Mixture-of-Experts),由 Cursor 和 SpaceXAI 联合训练。
- 训练数据:使用了数万亿 token 的 Cursor 数据,覆盖用户与代码库及软件工具的广泛交互,包括开发者工作流和代理与环境的交互模式。训练数据混合刻意保持广泛,加入了高质量的 STEM 任务、研究论文及其他知识工作数据。
- 强化学习:在同时涵盖软件工程和更广泛知识工作的真实环境中进行强化学习,环境设计为即便前沿模型也容易失败的高难度任务。模型学会调查问题、使用工具、从错误中恢复并验证结果。
- 分布式代理系统:为构建上述训练环境,开发了分布式代理系统,工程师只指定问题和验证方式,大量代理自动构建、测试和优化环境,所需人力从数百名工程师数月的工作量大幅减少。
主要结果或产业意义
- 定价:基础版 $2/M 输入 token、$6/M 输出 token;快速版 $4/M 输入 token、$18/M 输出 token。
- 可用性:在 Cursor 桌面端、网页端、iOS、CLI 和 SDK 中均可使用。个人/团队计划包含大量用法,首周翻倍。
- 基准测试:SWE-Bench Pro 和 Terminal-Bench 上展示了自报分数(具体值未提供,待核实)。SWE-Bench 多语言中 GPT 5.5 分数来自内部运行(待核实具体数值)。
- CursorBench 偏差声明:Grok 4.5 在 CursorBench 上具有优势,因为早期版本的 Cursor 代码库被意外包含在训练数据中。团队已移除该数据,并正在更新 CursorBench。
为什么重要
Grok 4.5 是首个不止面向软件工程的通用智能模型,展示了通过大规模真实交互数据与强化学习相结合,模型可自然地拓展到多种知识工作领域。同时,它体现了“用前代模型加速下一代模型训练”的范式(分布式代理系统),以及开源协作(与 SpaceXAI)在基础模型研发中的价值。
局限与不确定性
- 训练数据污染:CursorBench 的分数被承认因训练数据中意外包含早期 Cursor 代码库而存在偏差,精确影响未知。
- 基准测试数值:SWE-Bench Pro 和 Terminal-Bench 的分数仅为自报,未提供第三方独立验证结果;SWE-Bench 多语言中 GPT 5.5 分数为内部运行,可靠性待核实。
- 模型能力边界:文章未提及在多语言、多模态、安全性等方面的详细评测,也未说明与 GPT-5.5 等其他前沿模型的直接横向对比。
可用于图书/PPT/简报的角度
- 人工智能前沿进展:展示 2026 年大模型从“编码专家”向“通用知识工作者”演进的典型案例。
- AI 训练方法论:混合专家模型 + 大规模真实交互数据 + 高难度强化学习环境的协同。
- 训练数据治理:意外数据泄露如何影响基准测试的公平性,以及团队应对措施。
- 开源与商业合作:Cursor 与 SpaceXAI 联合训练模式对产业格局的启示。
原始材料
URL: https://cursor.com/blog/grok-4-5
英文标题
Introducing Grok 4.5
英文关键词
Grok 4.5, Cursor, SpaceXAI, mixture-of-experts, reinforcement learning, SWE-Bench, CursorBench, knowledge work, software engineering