AI消息速览

阿里发布Qwen-Audio-3.0实时语音交互模型

事件日期 2026-07-16 · 产业观察 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-16
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:阿里发布Qwen-Audio-3.0实时语音交互模型

一句话结论

阿里推出的Qwen-Audio-3.0-Realtime实时语音交互模型支持音色克隆与情感感知生成,可动态调整语气节奏,在Artificial Analysis语音推理子项综合排名第一,超越GPT-Realtime-2。

事件概述

2026年7月16日,阿里升级其语音交互模型为Qwen-Audio-3.0-Realtime。该模型在实时语音交互中具备情感感知能力,能根据上下文动态调整语气和节奏,告别机械朗读感;内置多模态双工控制模型,支持声纹级背景过滤,可在嘈杂多人环境中精准锁定主对话者,打断检测与响应时延领先;同时支持动态工具调用完成路线规划、信息查询等任务。

方法/产品要点

  • 音色克隆与情感感知:支持音色克隆,并可基于情感感知生成语音,动态调整语气与节奏。
  • 多模态双工控制:内置多模态双工控制模型,具备声纹级背景过滤能力,在嘈杂多人环境下精准锁定主对话者。
  • 打断检测:打断检测与响应时延处于行业领先水平。
  • 动态工具调用:支持动态调用工具以完成路线规划、信息查询等复杂任务。

主要结果或产业意义

在Artificial Analysis的语音推理子项综合排名中,Qwen-Audio-3.0-Realtime位列第一,超越GPT-Realtime-2,表明其在语音交互性能上具备竞争力。该模型有望推动实时语音助手从机械朗读向自然、有情感的交互体验演进。

为什么重要

当前语音交互模型大多缺乏情感和语调变化,Qwen-Audio-3.0通过情感感知生成和音色克隆技术,显著提升了用户体验。此外,其在多人嘈杂环境下的精准锁定和低时延打断能力,使得实时对话更加流畅自然,为智能音箱、车载语音、客服等场景提供了更优秀的技术基础。

局限与不确定性

  • 具体技术细节(如模型参数量、训练数据规模、情感感知的具体实现方式)未在材料中披露,待核实。
  • 实际部署中的延迟、资源消耗以及在不同语言和口音上的表现尚未说明,待核实。
  • 与GPT-Realtime-2的具体对比维度(评测基准、评分标准)未详细展开,待核实。

可用于图书/PPT/简报的角度

  • 语音交互新范式:从“机械朗读”到“情感阅读”,AI语音如何模仿人类语气和节奏。
  • 双工控制与声纹过滤:嘈杂环境下的语音交互突破,技术原理与应用场景。
  • 工具调用集成:语音模型突破单纯对话,直接调用外部工具完成任务(如路线规划)。
  • 行业竞争格局:阿里Qwen-Audio-3.0 vs OpenAI GPT-Realtime-2,国产模型在实时语音领域的领先表现。

原始材料

  • 来源:腾讯研究院AI速递 20260716
  • URL:https://m.sohu.com/a/1050798744_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=3
  • 原始摘录:“阿里语音交互模型升级为Qwen-Audio-3.0-Realtime,支持音色克隆与情感感知生成,可动态调整语气节奏,告别机械朗读感;内置多模态双工控制模型,具备声纹级背景过滤,嘈杂多人环境下精准锁定主对话者,打断检测与响应时延领先;支持动态工具调用完成路线规划、信息查询等任务,Artificial Analysis语音推理子项综合排名第一,超越GPT-Realtime-2。”