知识卡片:Grok 4.6
英文标题:Grok 4.6
英文关键词:Grok 4.6; Artificial Analysis; benchmark; GPT-5.6 Sol; Fable 5; API pricing
原始来源:腾讯研究院AI速递 20260814
一句话结论
Grok 4.6 在 Artificial Analysis 综合智能指数上拿到 61 分,追平 GPT-5.6 Sol,仅落后 Fable 5 一分;在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,同时 API 价格保持不变。
事件概述
据腾讯研究院 AI 速递(2026-08-14)报道,马斯克发布旗舰模型 Grok 4.6。该模型在 Artificial Analysis 综合智能指数中得 61 分,进入第一梯队,追平 GPT-5.6 Sol,仅落后 Fable 5 一分。在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,法律场景以 22% 对 14.2% 领先。不过,在 DeepSWE、Terminal-Bench 等复杂软件工程任务上仍有差距。
方法/产品要点
- 综合智能指数:61 分(Artificial Analysis)。
- API 价格:维持 2 美元/6 美元(原文未标明计费单位,待核实)。
- 单任务平均成本:约 0.84 美元,约为对手的三分之一。
- 后续规划:官方预告 Grok 4.7 将在 3 至 4 周内发布(具体日期待核实)。
主要结果或产业意义
- 在 Artificial Analysis 综合智能指数上追平 GPT-5.6 Sol,仅落后 Fable 5 一分,表明已进入顶级模型第一梯队。
- 在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,其中法律场景领先幅度较大(22% 对 14.2%,具体基准名称待核实)。
- 升级未涨价,API 价格维持不变,单任务平均成本约为对手的三分之一,可能加剧大模型价格竞争。
为什么重要
Grok 4.6 以不涨价的策略进入第一梯队,说明“性能接近顶级、成本更低”成为竞争突破口。它同时展示了不同模型在不同任务类型上的分化:法律/知识工作可能领先,复杂软件工程仍落后。这为评估与选型提供了具体参照。
局限与不确定性
- “2美元/6美元”的具体计数单位(如每百万 Token 输入/输出价格)原文未说明,待核实。
- “法律场景以22%对14.2%领先”所对应的具体基准名称未在原文中明确,待核实。
- DeepSWE、Terminal-Bench 等任务与对手的具体差距数值未提供,待核实。
- 消息来自腾讯研究院 AI 速递,非官方完整公告;Grok 4.7 发布时间为官方预告,实际时间可能变动。
- 成本计算口径(单任务平均成本)未展开,待核实。
与既有脉络的关系
本条是对已有卡片“AA-Briefcase”的更新:Grok 4.6 在该基准上反超 Fable 5,成为 AA-Briefcase 记录的新成绩之一。同时,本条可补充说明:AA-Briefcase 等知识工作基准上的领先,与 DeepSWE、Terminal-Bench 等软件工程基准上的落后并存,体现了模型能力的维度分化。
可用于图书/PPT/简报的角度
- 大模型竞争新格局:Grok 4.6 以更低成本追平顶级模型。
- 性能与成本解耦?从 Grok 4.6 看 API 定价策略。
- 从基准差异看模型能力分化:法律/知识工作 vs. 软件工程。
- 竞品同日发布:根据来源材料,Grok 4.6 与 DeepSeek V4 Pro、Qwen3.8 等同日/同夜发布,可作产业分析起点。
原始材料
- 标题:腾讯研究院AI速递 20260814
- 链接:https://m.sohu.com/a/1062532068_455313
- 原文涉及条目:一、Grok 4.6 发布,跑分追平GPT-5.6不涨价