AI消息速览

MODUS:仅解码器的任意到任意多模态建模

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MODUS:仅解码器的任意到任意多模态建模

一句话结论

MODUS 是首个仅解码器的任意到任意(any-to-any)多模态模型,对称处理所有模态,无需特定模态头或损失函数,在多个基准上达到与专业模型和多任务基线相当的竞争力。

事件概述 / 研究问题

任意到任意模型能在一个网络内从任意模态组合预测任意其他模态,已用于多模态视觉与视觉-语言模型,并逐步扩展到生态学、天文学等科学领域。现有任意到任意模型通常从零训练,使用编码器-解码器或扩散架构,这限制了性能且无法利用强大的预训练解码器模型作为先验。本文探索仅解码器的任意到任意多模态建模,试图解决上述局限。

方法 / 产品要点

  • 架构对称性:所有模态被对称对待,支持任意模态作为输入和输出,无需模态特定的头部、损失函数或任务管道。
  • 生成灵活性:支持链式生成(通过中间模态逐步生成)和跨模态自验证(用另一生成模态对自身输出进行评分)。
  • 单模型通用性:单一模型即可覆盖多种模态的输入输出任务。

主要结果 / 产业意义

MODUS 展现出开箱即用的强大性能,在多个基准测试上与专有模型和多任务基线(如 specialist 和 multitask baselines)竞争,且仅使用单个模型。所有材料已开源(https://modus-multimodal.epfl.ch/)。

为什么重要

这是首次将仅解码器架构应用于任意到任意多模态建模,使得模型能直接利用已有的强预训练解码器(如大语言模型)作为先验,显著简化了训练流程和架构设计。同时,对称的多模态处理方式为链式生成和跨模态自校验等新应用提供了基础,有望推动多模态基础模型的标准化。

局限与不确定性

  • 待核实:摘要未提及模型在哪些具体模态或数据集上进行了评测,也未说明与现有模型相比的计算开销或效率差异。
  • 待核实:模型是否在所有模态组合下均保持性能稳定,以及是否存在模态不平衡或数据稀缺时的退化问题。

可用于图书 / PPT / 简报的角度

  1. 对称多模态建模:强调 MODUS 打破了传统模态分治的壁垒,所有模态在同一架构中平等流动,适合介绍下一代多模态基础模型的设计理念。
  2. 链式生成与自校验:以生物学(如图→文本→声音)或故障诊断(多传感器信号链式推理)为示例,展示中间模态作为“翻译桥梁”的价值。
  3. 预训练模型复用:对比从零训练的范式,说明如何借助已有的解码器模型显著降低数据与算力需求。

原始材料

  • 英文标题:MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
  • 英文关键词:any-to-any models, decoder-only, multimodal, foundation model
  • 原始来源:arXiv:2607.25948v1,URL: https://arxiv.org/abs/2607.25948v1