知识卡片:Grok语音模型登顶智能体测评
英文标题: Grok Voice Think Fast 2.0
英文关键词: Grok; Voice Model; AI Agent; Tau Voice Benchmark; SpaceXAI
一句话结论
马斯克旗下SpaceXAI推出的语音模型Grok Voice Think Fast 2.0,在Tau Voice智能体基准中以56.5%的准确率排名第一,平均首音频响应时间仅0.70秒,定价为每秒0.08美元,在性能、速度和成本上均展现出显著优势。
事件概述
2026年7月,马斯克旗下SpaceXAI发布了新一代语音模型Grok Voice Think Fast 2.0。该模型在最新的Tau Voice智能体基准测试中,以56.5%的综合准确率超越OpenAI、谷歌和阿里千问等竞品,位居榜首。其最大亮点在于极低的响应延迟和极具竞争力的定价策略。
方法/产品要点
- 核心产品:Grok Voice Think Fast 2.0,一款面向AI智能体的语音模型。
- 性能基准:在Tau Voice智能体基准上获得56.5%的准确率,排名第一。
- 响应速度:平均首音频响应时间为0.70秒,是榜单前五名中唯一低于1秒的模型。
- 定价策略:每分钟0.08美元,约为GPT-Realtime-2.1 High版本定价的45%。
主要结果或产业意义
- 标志着语音模型在智能体任务上取得了重大性能突破,尤其在响应速度上实现了质的飞跃。
- 极低的延迟(<1秒)使得语音交互更接近人类对话节奏,为实时语音助手、客服等场景提供了可能。
- 具有竞争力的定价(仅为GPT-Realtime-2.1 High的45%)可能加速语音智能体的商业化落地。
为什么重要
- 新标杆:不仅性能登顶,更在响应速度上设定了“低于1秒”的新标准,这有可能成为语音智能体产品体验的下一个竞争焦点。
- 挑战巨头:SpaceXAI作为新入局者,在语音智能体领域直接挑战了OpenAI、谷歌等行业巨头。
局限与不确定性
- 基准测试的具体任务类型和评估细节待核实,不同场景下的实际表现可能存在差异。
- “56.5%”的排名是否有统计显著性(如与其他模型的差距)待核实。
- 模型的技术细节(如参数量、架构)尚未公布,其适用场景和泛化能力待核实。
- 每分钟0.08美元的定价是否包含数据处理、API调用等全部成本待核实。
可用于图书/PPT/简报的角度
- 速度决定体验:强调从“能回答”到“即时回答”的进化,以及0.70秒响应时间对用户体验的颠覆性意义。
- 价格竞争:展示AI行业从“技术竞赛”转向“性价比竞赛”的趋势,以Grok 45%的价格优势为例。
- 语音智能体的爆发前夜:结合已有的Cursor、SIMA等智能体卡片,说明语音正成为下一代AI交互的核心入口。
与既有脉络的关系
- 本卡片聚焦于语音模型在智能体基准上的表现,区别于已有的SIMA 2(虚拟3D世界通用代理)、Cursor Design Mode(UI设计代理)和编码智能体基准。本条信息呈现了语音作为交互新范式的竞争力,以及成本下降如何推动智能体普及。
原始材料
URL: https://m.sohu.com/a/1056862819_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
- 标题:腾讯研究院AI速递 20260731
- 相关原文:“马斯克旗下SpaceXAI推出语音模型Grok Voice Think Fast 2.0,在Tau Voice智能体基准以56.5%排名第一,超越OpenAI、谷歌、千问;平均首音频响应时间仅0.70秒,为榜单前五唯一低于1秒的模型,定价每分钟0.08美元,约为GPT-Realtime-2.1 High的45%。”