AI消息速览

AURORA-LM:面向连续潜空间扩散语言建模的自编码统一表示

事件日期 2026-08-03 · 学术前沿 · 已接受

事件日期2026-08-03
信息日期2026-08-03
入库日期2026-08-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:AURORA-LM:面向连续潜空间扩散语言建模的自编码统一表示

英文标题:AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
英文关键词:Continuous-Latent Diffusion Language Model; Flow Matching; Block-causal Diffusion Transformer; Query-based Encoder-Decoder; Self-trajectory Consistency
原始来源:arXiv:2608.02602v1 [cs.CL] https://arxiv.org/abs/2608.02602v1

一句话结论

AURORA-LM 提出了一种连续潜空间扩散语言模型:不把文本表示压缩到易建模的低维空间,而是保留高容量、可解码的文本潜变量,并让扩散模型直接学习其分布,在 OpenWebText 自由生成和 XSum 摘要任务上超过了评测中的所有连续/扩散语言模型。

事件概述或研究问题

语言建模仍依赖离散 token,而图像、视频、音频已在连续潜空间中建模。已有连续语言模型要么沿用非为联合生成与解码设计的嵌入空间,要么压缩自编码潜变量以简化扩散过程,牺牲 token 级保真度。AURORA-LM 的目标是既不简化表示,也不牺牲保真度,而是让扩散模型适应高容量文本潜变量。

方法/产品要点

  • 将“可解码文本表示的构建”与“分布的建模”分离:先用 Query-based Encoder-Decoder 把文本组织成高容量、前缀对齐的潜变量序列。
  • 用 Block-causal Diffusion Transformer 通过流匹配(flow matching)学习该潜变量分布:从左到右逐块生成,每个块内的位置并行去噪。
  • 由于该潜变量对扩散模型更难建模,AURORA-LM 只限制带噪输入路径,保留完整干净潜变量的预测目标,从而容纳全宽度潜变量而不降低面向解码器的容量。
  • 根据潜变量宽度校准噪声水平分布,并引入自轨迹一致性(self-trajectory consistency),连接训练时独立采样的噪声与推理时的迭代去噪。

主要结果或产业意义

  • 在 OpenWebText 自由生成和 XSum 摘要上,AURORA-LM 在评测过的连续/扩散语言模型中表现最强。
  • 扩展到 10 亿参数、总计算量约 1500 EFLOPs,进一步带来增益,并在匹配的评估协议下超越了更大的公开 latent-diffusion 语言模型。
  • 所有实验在 Ascend NPU 上进行。

为什么重要

这项工作针对语言生成中的“离散 token 例外”问题,提出了一种不牺牲文本表示容量的连续潜空间扩散方案,可能为语言模型的高频/连续化生成提供新路径。与已有相关卡片中的生成式表示学习(如 VideoRAE 将视频基础模型转化为生成友好的潜表示)相比,AURORA-LM 将类似思路带入语言模态:不是去压缩表示以迁就生成模型,而是设计生成模型来学习高保真文本潜分布。这是对“连续潜空间语言建模”方向的增量贡献。

局限与不确定性

  • 摘要未给出与离散 token 模型(如标准 LLM)的对比结果,也未明确基线模型列表、数据集规模、评估协议细节,需待核实。
  • “最强性能”的适用范围仅限于“评测过的 continuous 和 diffusion-based language models”,不是对所有语言模型的绝对结论。
  • 关于 Query-based Encoder-Decoder、Block-causal Diffusion Transformer 的具体结构、训练策略、自轨迹一致性的实现方式,摘要未展开,需待核实原始论文。
  • 计算量 1500 EFLOPs 的具体定义、参数量与训练数据的关系,需待核实。

可用于图书/PPT/简报的角度

  • 核心比喻:以前为了让扩散模型处理文本,把“文字”压扁;AURORA-LM 则反过来,把扩散模型训练得更强,去直接学习高保真文本表示。
  • 叙事线:图像/视频/音频都已进入连续潜空间,为什么语言还停留在离散 token?AURORA-LM 给出的答案是“分离表示与分布建模”。
  • 关键数字:1B 参数、约 1500 EFLOPs 计算量;OpenWebText / XSum 任务上超越同类连续/扩散语言模型;所有实验在 Ascend NPU 上完成。

原始材料

  • 页面标题:AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
  • arXiv ID:2608.02602v1
  • 作者:Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si
  • 提交/更新:2026-08-03
  • 类别:cs.CL
  • URL:https://arxiv.org/abs/2608.02602v1