AI消息速览

WordVoice:基于LLM的TTS中显式与解耦的多维词级控制

事件日期 2026-07-07 · 学术前沿 · 已接受

事件日期2026-07-07
信息日期2026-07-07
入库日期2026-07-08
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:WordVoice:基于LLM的TTS中显式与解耦的多维词级控制

一句话结论

WordVoice 通过构建大规模双语标注数据集 WordVoice-5A 并提出显式“声学规划”机制,首次实现了在基于大语言模型(LLM)的文本到语音(TTS)系统中对词级时长、边界、能量、音高、语调五个维度的精细、解耦控制,同时保持了零样本合成的稳定性。

事件概述或研究问题

  • 现状:现有 LLM 驱动的 TTS 系统虽然自然度极高,但依赖隐式端到端生成范式,只能实现粗粒度控制,无法在需要精确风格干预和时间对齐的场景(如有声书旁白、视频配音)中对词级声学属性进行显式操控。
  • 核心瓶颈:缺乏精细标注的数据集,以及将多维控制信号整合到离散自回归生成架构中的设计挑战。

方法/产品要点

  1. 数据集 WordVoice-5A:4,700 小时的中英双语数据集,包含时长、边界、能量、音高和语调五维词级标注,通过严格的语言学引导流水线构建。
  2. 模型框架 WordVoice
    • 在 LLM 内部引入 bound‑token 机制,形成显式的“声学规划”过程,实现自适应多任务韵律规划和灵活的人工干预。
    • 在 token‑to‑waveform 阶段增加 细粒度声学调制模块,弥合高度压缩的离散 token 与连续波形之间的分辨率差距,严格对齐词级属性。
  3. 实验验证:在多个声学维度上实现了优越的解耦控制,同时保持了有竞争力的零样本合成稳定性。

主要结果或产业意义

  • 结果:大量实验证明 WordVoice 在五个声学维度上均能实现精确、解耦的操控,且零样本合成质量与现有最佳方法相当。
  • 产业意义:为有声书、视频配音等需要词级控制的应用提供了可行的技术路径;代码和音频样例已公开:(https://xxh333.github.io/wordvoice-demo/)。

为什么重要

  • 首次在 LLM‑TTS 中实现了显式、解耦的多维词级控制,突破了隐式生成范式的“黑箱”限制。
  • 提供了大规模高质量标注数据集,解决了该领域的核心数据瓶颈。
  • 所提出的 bound‑token 机制和声学调制模块具有通用性,可启发后续可控语音合成研究。

局限与不确定性

  • 论文未详细说明在多说话人、多语种混合等复杂场景下的表现。
  • 5A 维度是否涵盖所有语言学相关属性(如发声类型、共振峰)待核实。
  • 4,700 小时数据集的具体语言比例、数据来源及标注质量评估细节待进一步确认。

可用于图书/PPT/简报的角度

  • 技术角度:LLM + 显式声学规划:如何用 bound‑token 让 TTS “说哪改哪”。
  • 应用角度:从有声书到视频配音——词级控制如何提升内容创作效率。
  • 数据角度:4,700 小时双语精细标注数据的构建经验与启示。
  • 对比角度:隐式 vs 显式控制:LLM‑TTS 可控性从“整体调”到“逐词调”的跃迁。

原始材料

  • 英文标题:WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS
  • 英文关键词:LLM, TTS, word-level control, acoustic planning, bound-token, fine-grained modulation, WordVoice-5A
  • 来源:arXiv: 2607.06461v1, URL: https://arxiv.org/abs/2607.06461v1