阿里推出的Qwen-Audio-3.0-Realtime实时语音交互模型支持音色克隆与情感感知生成,可动态调整语气节奏,在Artificial Analysis语音推理子项综合排名第一,超越GPT-Realtime-2。
2026年7月16日,阿里升级其语音交互模型为Qwen-Audio-3.0-Realtime。该模型在实时语音交互中具备情感感知能力,能根据上下文动态调整语气和节奏,告别机械朗读感;内置多模态双工控制模型,支持声纹级背景过滤,可在嘈杂多人环境中精准锁定主对话者,打断检测与响应时延领先;同时支持动态工具调用完成路线规划、信息查询等任务。