AI消息速览

Meta新旗舰Muse Spark 1.3,Artificial Analysis指数榜反超Gemini 3.8 Flash

事件日期 2026-09-04 · 产业观察 · 已接受

事件日期2026-09-04
信息日期2026-09-04
入库日期2026-09-04
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:Meta新旗舰Muse Spark 1.3,Artificial Analysis指数榜反超Gemini 3.8 Flash

英文标题(整理):Meta Releases New Flagship Muse Spark 1.3, Overtakes Gemini 3.8 Flash on Artificial Analysis Index
英文关键词:Meta; Muse Spark 1.3; Artificial Analysis Index; benchmark; long-context; coding; token efficiency; pricing
原始来源腾讯研究院AI速递 20260904(搜狐号)

一句话结论

Meta 发布新旗舰 Muse Spark 1.3,在 Artificial Analysis 指数获得 62 分,排名仅次于 Claude Fable 5.1 与 Opus 5,发布数小时即反超 Gemini 3.8 Flash;该模型主打长上下文与编程,API 定价与前代持平,并低于 DeepSeek-V4-Pro 高峰期价格。

事件概述

根据腾讯研究院AI速递(20260904)简报,Meta 推出新一代旗舰模型 Muse Spark 1.3,并被视为“指数榜反超 Gemini”的进展。该速递将 Muse Spark 1.3 放在生成式 AI 模型竞争的头条位置,强调其评测分数、定价和后续开源计划。

具体信息来自二手行业速递,不是 Meta 官方公告原文,也未附完整技术报告。

方法/产品要点

  • 能力方向:主攻长上下文与编程。
  • 评测表现:Artificial Analysis 指数得分 62 分,仅次于 Claude Fable 5.1 与 Opus 5。
  • 排名变化:发布数小时即反超 Gemini 3.8 Flash。
  • 对比上一版:相比 1.2,工具调用次数减少 20%,Token 用量减少 25%。
  • API 定价:输入每百万 Token 1.25 美元;缓存命中每百万 Token 0.15 美元;输出每百万 Token 4.25 美元。
  • 价格对比:定价与前代持平,并比 DeepSeek-V4-Pro 高峰期价格更低。
  • 后续计划:将推出更大参数模型与开源权重版本。

主要结果

  • Meta Muse Spark 1.3 进入 Artificial Analysis 指数头部区间,以 62 分位列 Claude Fable 5.1 与 Opus 5 之后。
  • 在同一榜单或指数排序中,该模型已经超过 Gemini 3.8 Flash。
  • 在工具调用和 Token 使用效率上比 1.2 更优,意味着单位任务的推理成本可能进一步下降。

产业意义

旗舰模型的竞争已从单一“跑分”蔓延到“评测名次 + API 价格 + 推理效率 + 开源路线”的组合竞争。

Muse Spark 1.3 的亮点不只是 Artificial Analysis 指数得分,而是同时做到:

  • 榜单位置迅速反超;
  • 工具调用次数和 Token 用量下降;
  • 价格未上涨;
  • 官方预告了更大参数版本和开源权重版本。

这有利于企业用户把 Muse Spark 1.3 放入长上下文和编程类任务的实际选型比较中。

与既有脉络的关系

已有“AA-Briefcase:前沿知识工作评估基准”卡片说明 Artificial Analysis 在代理式知识工作评测上的定位。本卡不是对 AA-Briefcase 概念的重复,而是 Artificial Analysis 指数榜上的一个具体模型排名更新,属于既有基准评测脉络的新实例。

也可与“通过模型融合超越前沿性能”的叙事对照观察:闭源厂商继续发布更强单体旗舰,而 OpenRouter 等工具正在尝试通过多模型融合形成低成本替代方案。

为什么重要

这项信息的增量在于:Meta 在榜单前部的位置、定价策略、效率改进和开源路线这几个信号同时出现。若后续“更大参数模型”和“开源权重版本”按计划落地,可能进一步压低长上下文与编程任务的使用成本,并加剧开放模型与闭源模型之间的竞争。

局限与不确定性

  • 原文为腾讯研究院AI速递的摘要,未说明 Artificial Analysis 指数的具体评测方法、评测集规模或“反超”的统计口径。待核实。
  • Muse Spark 1.3 的具体上下文窗口长度、编程基准名称、参数量、训练方式等材料中未提供。待核实。
  • “相比 1.2 工具调用次数减少 20%、Token 用量减少 25%”未说明是在哪些任务或数据集上测得的。待核实。
  • “比 DeepSeek-V4-Pro 高峰期价格更低”未给出 DeepSeek-V4-Pro 高峰期的具体价格。待核实。
  • “更大参数模型与开源权重版本”没有时间表。待核实。

可用于图书/PPT/简报的角度

  • 大模型竞争的一天:Muse Spark 1.3 如何在数小时内反超 Gemini 3.8 Flash。
  • 从跑分到账单:AI 模型竞争为什么越来越看重“每百万 Token 价格”和“Token 用量”。
  • 效率指标比分数更重要:工具调用次数减少 20%、Token 用量减少 25% 可能意味着什么。
  • 开源预告的产业影响:性能接近头部闭源模型的开源权重版本,会如何改变企业选型。

原始材料

Meta发布新旗舰Muse Spark 1.3,Artificial Analysis指数得62分,仅次于Claude Fable 5.1与Opus 5,发布数小时即反超Gemini 3.8 Flash;
定价与前代持平,每百万Token输入1.25美元、缓存命中0.15美元、输出4.25美元,比DeepSeek-V4-Pro高峰期价格更低;
主攻长上下文与编程,相比1.2工具调用次数减少20%、Token用量减少25%,后续将推出更大参数模型与开源权重版本。

来源:腾讯研究院AI速递 20260904