知识卡片:英伟达开源全双工语音
英文标题:VoiceChat 11B(材料未提供完整英文标题,待核实)
英文关键词:NVIDIA; VoiceChat 11B; full-duplex speech; end-to-end; tool calling
一句话结论
英伟达开源端到端全双工语音模型 VoiceChat 11B,整合ASR、LLM与TTS,平滑轮换延迟约448毫秒,并设计独立工具调用通道,把等待外部工具API的时间纳入对话话术;但工具调用的参数准确率仅44%,且部署门槛高、工具执行期间无法打断。
事件概述
据腾讯研究院AI速递(2026-08-11)消息,英伟达开源全双工语音模型 VoiceChat 11B。该模型为端到端语音到语音架构,训练使用约55万小时音频。与常见级联方案不同,它在一个模型中整合自动语音识别(ASR)、大语言模型(LLM)和文本转语音(TTS),实现低延迟平滑轮换对话。模型核心特点是独立的工具调用通道:通过TOOLCALL脚本配合预设“保持”话术,在外部API运行期间填补对话空档,将等待工具响应的时间纳入交互设计。
方法/产品要点
- 端到端语音到语音架构,单一模型覆盖ASR、LLM、TTS。
- 训练数据:约55万小时音频。
- 全双工对话,平滑轮换延迟约448毫秒。
- 独立工具调用通道:使用TOOLCALL脚本,预设“保持”话术,在API调用期间维持对话流畅。
- 开源发布(具体许可证、权重获取方式待核实)。
主要结果或产业意义
VoiceChat 11B展示了全双工语音模型中内置工具调用的可行性,尤其是把“等待外部工具返回”这一行为显式设计为对话的一部分,而非简单静默。这种设计对实时语音助手、Agent电话客服、语音控制Agent等场景具有参考价值。作为英伟达开源的模型,它也降低了研究社区获取端到端语音Agent基座的门槛(尽管仍需较高GPU资源)。
为什么重要
现有开源语音模型多侧重识别或合成,而VoiceChat 11B将语音对话与Agent工具调用结合,提供了“边说边等工具结果”的交互范式。它提示实时语音Agent不仅需要低延迟的“说”,还需要管理任务执行中的时间空隙与用户预期。相比传统流水线,端到端方式可能减少误差累积,并为后续优化提供统一模型。
局限与不确定性
- 工具调用可靠性不足:材料给出工具调用参数准确率仅44%。
- 部署门槛高:单卡需80GB显存起步,且“仅供研究”使用。
- 工具执行期间无法打断:外部工具运行时用户不能插话。
- Agent状态管理被材料列为“下一挑战”。
- 关于模型权重、开源协议、具体评测基准、硬件要求等细节,材料未展开,待核实。
可用于图书/PPT/简报的角度
- 语音Agent的“等待策略”:如何用预设话术和TOOLCALL脚本管理用户预期。
- 端到端语音模型 vs 级联ASR+LLM+TTS:延迟与可控性的取舍。
- 全双工语音与工具调用结合的产品设计边界(不能打断、可靠性不足)。
- 英伟达在开源语音Agent方向的动作,以及“仅供研究”对产业落地的限制。
原始材料
来源:腾讯研究院AI速递 20260811(搜狐号)
URL: https://m.sohu.com/a/1061193334_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334