AI消息速览

宇生月伴 Luna-TTS 登顶语音榜单,中国版“Thinking Machines”浮现

事件日期 2026-08-15 · 产业观察 · 已接受

事件日期2026-08-15
信息日期2026-08-15
入库日期2026-08-15
通道产业观察
状态已接受
来源新智元

知识卡片:宇生月伴 Luna-TTS 登顶语音榜单,中国版“Thinking Machines”浮现

一句话结论

据新智元报道,中国初创公司宇生月伴(VUI Labs)发布语音模型 Luna-TTS,宣称在 Hugging Face TTS Arena 登顶全球第一,并在 Artificial Analysis 的 Speech Arena 榜单上超越谷歌、获得全球第三。其核心路线是用非自回归扩散式 TTS 替代传统自回归逐 Token 生成,试图同时实现高情感表现力与工业级低延迟。上述均为媒体报道/厂商口径,未独立核实。

事件概述 / 研究问题

  • 2026年8月15日,新智元报道称,宇生月伴(VUI Labs)的 Luna-TTS 模型在 Hugging Face TTS Arena 上击败 ElevenLabs、MiniMax、Cartesia 等厂商,登顶全球第一。
  • 文章称,在 Artificial Analysis 的 Speech Arena 榜单上,Luna-TTS 超越谷歌,获得全球第三。
  • 研究/产品问题:TTS 如何在“像真人一样有情绪、呼吸和节奏”与“实时对话所需低延迟”之间取得平衡。

方法/产品要点

  • 架构思路:Luna-TTS 不是自回归逐 Token 生成,而是先把语音压缩成离散 Token,再用基于 Qwen3-0.6B 改造的 Diffusion LM 并行预测大量语音 Token。
  • 实时方案:Luna-TTS Realtime 将语音切成 1.28 秒(32 帧)的小块;块间采用自回归方式并支持 KV Cache,块内用 8~16 步并行去噪,一次生成 32 帧和 8 个码本。
  • Tokenizer:Luna-Codec 采用 8 码本架构,24kHz 采样率、25Hz 帧率(每秒 200 Token);通过预训练 WavLM 语义蒸馏 Loss,将语义信息“锚定”在第一层码本,其余码本负责音色、情绪、韵律等声学细节。
  • 强化学习:文章称将 GRPO 迁移到非自回归离散掩码扩散模型上,核心涉及轨迹感知与字典序奖励(具体机制待核实)。
  • 数据工程:使用 100 万小时多语言语料,其中中文 43.4%、英文 43.1%、日韩合计 13.6%;另精选约 10 万小时高质量子集做退火训练;第三阶段加入带精细标注的表达性数据,包括 [laughs][sighs][gasps][coughs] 等行内非语言发音标签(NVV)。
  • 工程落地:借助 vLLM-Omni 实现显存解耦和流式 Chunk 递交;针对特殊符号、数字等构建文本正则化前端模块。

主要结果或产业意义

  • 文章称,Luna-TTS 在 Seed-TTS-Eval 中语音质量四项指标全拿第一,并在 CV3-Eval 野外复杂环境下展现纠错与抗噪能力;在首包延迟和实时率两项效率指标上同样第一。
  • 文章给出实测数据:在 2 张 H20 GPU 上开启并行 CFG 部署时,首包延迟约 41.6 毫秒,实时率 RTF 低至 0.024,即生成 1 秒语音约需 24 毫秒,超过 40 倍实时速度(待核实)。
  • 团队方面:创始人兼董事长钱彦旻为上海交通大学教授、38 岁入选教育部长江学者,获吴文俊人工智能自然科学一等奖;CEO 梅杰曾任 Aircourse/爱课 COO,称 3 年将年营收做到 5 亿元以上;研发团队近 50 人,博士占比 50%(待核实)。
  • 产品体系分为三层:模型 API、创作者和开发者平台、语音 Agent 平台;文章称已在物流调度、互联网保险、酒旅 SaaS 等场景落地,数家客户累计完成超 100 万次真实业务对话。
  • 产业意义:文章测算到 2030 年,语音+视觉+协作三层能力将撑起 2660 亿至 7400 亿美元市场;VUI Labs 被类比为“中国版 Thinking Machines Lab”。

为什么重要 / 与既有脉络的关系

  • 已有相关卡片主要涉及 AI 治理(NIST)、AI 算力研究(Epoch AI)和 LLM 基础设施中间层(OpenRouter);本条增量信息是语音赛道出现中国初创公司,以“扩散 TTS + 实时 Voice Agent”产品化路径进入竞争。
  • 如果榜单和性能数据可靠,意味着非自回归/扩散架构可能在语音合成上挑战主流自回归模型,同时把“低延迟全双工语音 Agent”作为真实落地场景。
  • 这也延续了 AI 基础设施和应用层快速产品化的趋势,但焦点从文本/模型路由扩展到“语音交互入口”。

局限与不确定性

  • 本卡片内容主要来自新智元报道,属于媒体/厂商口径,榜单排名、性能数据、市场测算均未独立验证。
  • “全球第一”“碾压谷歌”“中国版 Thinking Machines”等表述带有宣传色彩。
  • 论文链接为 arXiv:2608.11593,demo 页面为 https://vuilabs-ai.github.io/luna-tts,其可访问性和具体评测条件待核实。
  • 团队背景、商业化规模、客户对话量等细节均来自文章,待核实。

可用于图书/PPT/简报的角度

  • 语音交互的下一阶段:从“听得清”到“有呼吸、有情绪、可实时打断”。
  • TTS 架构之争:自回归逐 Token 生成 vs 非自回归扩散生成。
  • Voice Agent 可能成为“AI Teammate”的入口。
  • 中国 AI 创业公司如何以“顶尖科学家 + 商业操盘手 + 垂直场景”组合冲击全球榜单。

原始材料

  • 英文标题:待核实(原文仅有中文标题《全球第一,碾压谷歌!中国版Thinking Machines诞生,语音赛道变天了》)
  • 英文关键词:Voice AI; TTS; Diffusion Model; VUI Labs; Luna-TTS; China AI
  • 原始来源:新智元(AIERA 收录),2026-08-15
  • URL:https://aiera.com.cn/2026/08/15/other/admin/109207/%e5%85%a8%e7%90%83%e7%ac%ac%e4%b8%80%ef%bc%8c%e7%a2%be%e5%8e%8b%e8%b0%b7%e6%ad%8c%ef%bc%81%e4%b8%ad%e5%9b%bd%e7%89%88thinking-machines%e8%af%9e%e7%94%9f%ef%bc%8c%e8%af%ad%e9%9f%b3%e8%b5%9b%e9%81%93