知识卡片:迈向通用听觉智能——机器听与说的基础模型综述
一句话结论
这篇发表于 Nature Machine Intelligence 的综述文章认为,计算机听觉正从传统任务范式走向以大语言模型(LLM)为核心的“通用听觉智能”,关键路径是将音频理解、音频生成、语音交互和音视频融合统一纳入基础模型框架。
事件概述或研究问题
- 本文是一篇 Review Article,在线发表于 2026 年 8 月 14 日。
- 研究问题:如何让机器像人一样自然地“听”和“说”?如何把音频模态嵌入大语言模型,使系统具备更深层的声音语义理解、更自然的音频生成,以及更像人类的语音交互能力?
- 综述聚焦四个关键领域:音频理解、音频生成、基于语音的交互、音视频联合理解。
方法/产品要点
- 根据摘要,综述系统梳理了“将音频集成进大语言模型”的近期进展。
- 四个重点方向:
- 音频理解(audio comprehension)
- 音频生成(audio generation)
- 基于语音的交互(speech-based interaction)
- 音视频理解(audio–visual understanding)
- 文中包含多张综述图,分别涉及听觉 LLM 与世界的接口、LLM 中的音频表征范式、音频 LLM 总览、基于 LLM 的音频生成、语音交互架构、全双工对话、流式语音处理、音视频建模等;具体图示细节无法从摘要确认,待核实。
- 参考文献中出现 AudioPaLM、SpeechGPT、SALMONN、CosyVoice、UniAudio、SpeechX、GPT-4o、Qwen-Audio、Qwen2-Audio、WavLLM、GAMA、Audio Flamingo、E2 TTS、DiTAR 等模型/系统,说明综述覆盖了学术界与工业界的重要进展,但作者对它们的具体评价需以全文为准。
主要结果或产业意义
- 作者认为,大语言模型正在重塑音频感知与推理,使机器能够更深入地理解声音语义,生成更有表现力的音频输出,并参与类似人类的语音对话。
- 音频与视觉模态的融合可以增强情境感知和跨模态推理,推动多模态智能的边界。
- 从产业角度看,全双工语音对话、流式语音处理、实时语音 Agent 等方向可能是下一代语音交互产品的基础;文中引用了 GPT-4o、gpt-realtime 等工业系统,但具体产业判断待核实。
为什么重要
- 音频是富含语义、情感和情境线索的模态,对实现自然化和具身化的机器智能至关重要。
- 该综述提出“通用听觉智能”这一整体愿景,区别于过去针对单一语音或音频任务的传统范式。
- 它为“音频 + 大语言模型”这一快速发展的方向提供了系统化综述框架,可作为计算机听觉、多模态大模型和人机交互研究的重要参考文献。
局限与不确定性
- 本知识卡片仅基于公开摘要、标题、图表标题及参考文献列表,未获取全文;综述中的具体方法比较、评测结果、挑战清单和未来方向细节待核实。
- 文中的图 1 至图 8 为订阅内容,具体内容无法从当前材料确认。
- 参考文献列表只说明该领域的研究图谱,不能据此推断作者对每个模型或方法的最终结论。
- 发表日期为 2026 年 8 月 14 日,属于较新综述;相关技术仍在快速演进,部分判断可能随后续研究变化。
与既有脉络的关系
- 本条与已有相关卡片(机器学习原子间势优化、抑郁症筛查、ergoCub 人形机器人)主题不同,不构成延续或更新,属于“音频/语音基础模型综述”方向的独立条目。
- 它可作为“基础模型在听觉与多模态交互领域应用”脉络中的综述性锚点。
可用于图书/PPT/简报的角度
- 标题角度:从“听见”到“理解”——大语言模型如何赋予机器通用听觉智能。
- 一页 PPT 框架:音频理解、音频生成、语音交互、音视频理解四大板块。
- 引言素材:计算机听觉正在经历从传统信号处理范式到基础模型范式的转变。
- 引用价值:Nature Machine Intelligence 的权威综述,可用于论证“音频模态正在成为多模态智能的核心组成部分”。
原始材料
- 英文标题:Towards general auditory intelligence for machine listening and speaking
- 英文关键词:computer audition; auditory foundation models; large language models; speech interaction; audio-visual understanding
- 作者:Siyin Wang, Zengrui Jin, Changli Tang, Qiujia Li, Bo Li, Chen Chen, Yuchen Hu, Wenyi Yu, Yixuan Li, Jimin Zhuang, Yudong Yang, Mingqiu Wang, Michael Han, Yifan Ding, Junwen Bai, Tom Ouyang, Shuo-yiin Chang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Guangzhi Sun, Zhehuai Chen, Ji Wu, Bowen Zhou, Yuxuan Wang, Tara Sainath, Yonghui Wu, Chao Zhang 等(Wang et al.)
- 期刊:Nature Machine Intelligence(2026)
- 发表日期:2026 年 8 月 14 日(在线发表)
- DOI:10.1038/s42256-026-01281-1
- URL:https://www.nature.com/articles/s42256-026-01281-1