AI消息速览

英伟达开源全双工语音

事件日期 2026-08-11 · 产业观察 · 已接受

事件日期2026-08-11
信息日期2026-08-11
入库日期2026-08-11
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:英伟达开源全双工语音

英文标题:VoiceChat 11B(材料未提供完整英文标题,待核实)
英文关键词:NVIDIA; VoiceChat 11B; full-duplex speech; end-to-end; tool calling

一句话结论

英伟达开源端到端全双工语音模型 VoiceChat 11B,整合ASR、LLM与TTS,平滑轮换延迟约448毫秒,并设计独立工具调用通道,把等待外部工具API的时间纳入对话话术;但工具调用的参数准确率仅44%,且部署门槛高、工具执行期间无法打断。

事件概述

据腾讯研究院AI速递(2026-08-11)消息,英伟达开源全双工语音模型 VoiceChat 11B。该模型为端到端语音到语音架构,训练使用约55万小时音频。与常见级联方案不同,它在一个模型中整合自动语音识别(ASR)、大语言模型(LLM)和文本转语音(TTS),实现低延迟平滑轮换对话。模型核心特点是独立的工具调用通道:通过TOOLCALL脚本配合预设“保持”话术,在外部API运行期间填补对话空档,将等待工具响应的时间纳入交互设计。

方法/产品要点

  • 端到端语音到语音架构,单一模型覆盖ASR、LLM、TTS。
  • 训练数据:约55万小时音频。
  • 全双工对话,平滑轮换延迟约448毫秒。
  • 独立工具调用通道:使用TOOLCALL脚本,预设“保持”话术,在API调用期间维持对话流畅。
  • 开源发布(具体许可证、权重获取方式待核实)。

主要结果或产业意义

VoiceChat 11B展示了全双工语音模型中内置工具调用的可行性,尤其是把“等待外部工具返回”这一行为显式设计为对话的一部分,而非简单静默。这种设计对实时语音助手、Agent电话客服、语音控制Agent等场景具有参考价值。作为英伟达开源的模型,它也降低了研究社区获取端到端语音Agent基座的门槛(尽管仍需较高GPU资源)。

为什么重要

现有开源语音模型多侧重识别或合成,而VoiceChat 11B将语音对话与Agent工具调用结合,提供了“边说边等工具结果”的交互范式。它提示实时语音Agent不仅需要低延迟的“说”,还需要管理任务执行中的时间空隙与用户预期。相比传统流水线,端到端方式可能减少误差累积,并为后续优化提供统一模型。

局限与不确定性

  • 工具调用可靠性不足:材料给出工具调用参数准确率仅44%。
  • 部署门槛高:单卡需80GB显存起步,且“仅供研究”使用。
  • 工具执行期间无法打断:外部工具运行时用户不能插话。
  • Agent状态管理被材料列为“下一挑战”。
  • 关于模型权重、开源协议、具体评测基准、硬件要求等细节,材料未展开,待核实。

可用于图书/PPT/简报的角度

  • 语音Agent的“等待策略”:如何用预设话术和TOOLCALL脚本管理用户预期。
  • 端到端语音模型 vs 级联ASR+LLM+TTS:延迟与可控性的取舍。
  • 全双工语音与工具调用结合的产品设计边界(不能打断、可靠性不足)。
  • 英伟达在开源语音Agent方向的动作,以及“仅供研究”对产业落地的限制。

原始材料

来源:腾讯研究院AI速递 20260811(搜狐号)
URL: https://m.sohu.com/a/1061193334_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334