AI消息速览

Grok 4.6

事件日期 2026-08-14 · 产业观察 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-14
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:Grok 4.6

英文标题:Grok 4.6
英文关键词:Grok 4.6; Artificial Analysis; benchmark; GPT-5.6 Sol; Fable 5; API pricing

原始来源腾讯研究院AI速递 20260814

一句话结论

Grok 4.6 在 Artificial Analysis 综合智能指数上拿到 61 分,追平 GPT-5.6 Sol,仅落后 Fable 5 一分;在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,同时 API 价格保持不变。

事件概述

据腾讯研究院 AI 速递(2026-08-14)报道,马斯克发布旗舰模型 Grok 4.6。该模型在 Artificial Analysis 综合智能指数中得 61 分,进入第一梯队,追平 GPT-5.6 Sol,仅落后 Fable 5 一分。在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,法律场景以 22% 对 14.2% 领先。不过,在 DeepSWE、Terminal-Bench 等复杂软件工程任务上仍有差距。

方法/产品要点

  • 综合智能指数:61 分(Artificial Analysis)。
  • API 价格:维持 2 美元/6 美元(原文未标明计费单位,待核实)。
  • 单任务平均成本:约 0.84 美元,约为对手的三分之一。
  • 后续规划:官方预告 Grok 4.7 将在 3 至 4 周内发布(具体日期待核实)。

主要结果或产业意义

  • 在 Artificial Analysis 综合智能指数上追平 GPT-5.6 Sol,仅落后 Fable 5 一分,表明已进入顶级模型第一梯队。
  • 在 GDPVal、AA-Briefcase、Harvey LAB 等基准上反超 Fable 5,其中法律场景领先幅度较大(22% 对 14.2%,具体基准名称待核实)。
  • 升级未涨价,API 价格维持不变,单任务平均成本约为对手的三分之一,可能加剧大模型价格竞争。

为什么重要

Grok 4.6 以不涨价的策略进入第一梯队,说明“性能接近顶级、成本更低”成为竞争突破口。它同时展示了不同模型在不同任务类型上的分化:法律/知识工作可能领先,复杂软件工程仍落后。这为评估与选型提供了具体参照。

局限与不确定性

  • “2美元/6美元”的具体计数单位(如每百万 Token 输入/输出价格)原文未说明,待核实。
  • “法律场景以22%对14.2%领先”所对应的具体基准名称未在原文中明确,待核实。
  • DeepSWE、Terminal-Bench 等任务与对手的具体差距数值未提供,待核实。
  • 消息来自腾讯研究院 AI 速递,非官方完整公告;Grok 4.7 发布时间为官方预告,实际时间可能变动。
  • 成本计算口径(单任务平均成本)未展开,待核实。

与既有脉络的关系

本条是对已有卡片“AA-Briefcase”的更新:Grok 4.6 在该基准上反超 Fable 5,成为 AA-Briefcase 记录的新成绩之一。同时,本条可补充说明:AA-Briefcase 等知识工作基准上的领先,与 DeepSWE、Terminal-Bench 等软件工程基准上的落后并存,体现了模型能力的维度分化。

可用于图书/PPT/简报的角度

  • 大模型竞争新格局:Grok 4.6 以更低成本追平顶级模型。
  • 性能与成本解耦?从 Grok 4.6 看 API 定价策略。
  • 从基准差异看模型能力分化:法律/知识工作 vs. 软件工程。
  • 竞品同日发布:根据来源材料,Grok 4.6 与 DeepSeek V4 Pro、Qwen3.8 等同日/同夜发布,可作产业分析起点。

原始材料

  • 标题:腾讯研究院AI速递 20260814
  • 链接:https://m.sohu.com/a/1062532068_455313
  • 原文涉及条目:一、Grok 4.6 发布,跑分追平GPT-5.6不涨价