AI消息速览

UEmbed——统一稀疏与稠密的多模态嵌入模型

事件日期 2026-08-03 · 学术前沿 · 已接受

事件日期2026-08-03
信息日期2026-08-03
入库日期2026-08-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:UEmbed——统一稀疏与稠密的多模态嵌入模型

一句话结论

UEmbed 是一种仅解码器(decoder-only)多模态嵌入模型,通过向输入追加 N 个可学习特殊 token,并在一次因果前向传播中同时生成稀疏词项权重与稠密向量,从而在一个模型内统一稀疏检索与稠密检索,并扩展到多模态输入;UEmbed-9B 在 MMEB-v2 上达到 71.8(dense)和 71.0(sparse)。

事件概述或研究问题

稀疏检索是现代搜索系统的基础,从网页搜索到检索增强生成(RAG)都依赖它。已有的 Learned Sparse Retrieval(LSR)方法试图超越精确词法匹配、获得更丰富的语义,但 LSR 仍主要受限于编码器式双向架构,并且在多模态场景中的扩展还依赖大量辅助跨模态模块。UEmbed 的目标是解决这两个局限:让稀疏检索不再绑定编码器架构,同时让文本与多模态输入共享统一的稀疏/稠密表示。

方法/产品要点

  • 采用仅解码器(decoder-only)架构的多模态嵌入模型,而非传统的双向编码器架构。
  • 在输入后追加 N 个可学习的特殊 token,并将词汇表划分为 N 个不相交子集。
  • 每个特殊 token 的因果隐藏状态预测其负责子集上的稀疏权重;将所有子集拼接起来,得到完整的稀疏向量。
  • 同一次前向传播中同时产出稀疏表示和稠密表示,不需要分别训练两套模型。
  • 基于公开数据训练,发布 2B、4B、9B 三种规模(具体训练数据构成、N 的取值待核实)。

主要结果或产业意义

  • UEmbed-9B 在 MMEB-v2 上达到 71.8(dense)和 71.0(sparse),优于在公开数据上训练的多模态嵌入模型(例如 RzenEmbed)。
  • 在 BEIR 上与强稠密/稀疏检索基线相比保持竞争力(具体数值与评测设置待核实)。
  • 展示了有效性、效率和智能体(agentic)应用三个方面的实用价值(具体场景与基准待核实)。
  • 产业意义上,一个模型同时提供两种互补的检索信号,并支持多模态输入,可能简化多模态搜索、RAG 和多模态智能体的检索链路。

为什么重要

  • 它把 LSR 从编码器式双向架构推进到仅解码器架构,并延伸至多模态输入,形成一种新的建模范式。
  • 统一稠密与稀疏嵌入,可能减少同时维护两套嵌入模型、两套索引和两套检索服务的成本。
  • 与“用单一模型统一多种表示/任务”的近期趋势一致;本条目的增量信息在于“检索表示层”的统一:一个模型同时覆盖 sparse、dense 和 multimodal。

局限与不确定性

  • 摘要未说明 N 的具体数值、特殊 token 初始化方式、稀疏性控制方法、损失函数等细节,待核实。
  • 训练数据只提及“公开数据”,具体数据集构成、清洗流程和授权情况待核实。
  • MMEB-v2 与 BEIR 上的具体任务设置、评测协议、对比基线版本待核实。
  • 与 RzenEmbed 的比较细节以及“agentic applications”的具体评测结果待核实。
  • 模型权重是否开源、使用许可以及推理资源需求待核实。

与既有脉络的关系

已有相关卡片分别涉及 3D 理解与生成统一(ELSA3D)、视觉任务统一为多模态生成(SenseNova-Vision)以及任务特定多模态问答智能体(QANTA 2026)。UEmbed 的独特增量在于:它统一的对象是信息检索中的两种表示形式——稀疏词项权重与稠密语义向量,并把这些表示扩展到多模态输入,而不是统一下游视觉任务本身。

可用于图书/PPT/简报的角度

  • 从“搜索系统为什么常常同时需要稠密向量索引和稀疏词项索引”切入,引出两种检索信号的优势与互补性。
  • 用 UEmbed 展示一种“一个模型、一次前向、两种表示”的设计思路,适合讲解多模态 RAG 的检索环节。
  • 可用来讲述检索表示学习的演进:从词法匹配到 LSR,再到仅解码器多模态统一模型。
  • 讨论多模态搜索系统是否可以通过该类模型降低架构复杂度、减少重复计算。

英文关键词

Learned Sparse Retrieval; Multimodal Embedding; Decoder-only; Dense Retrieval; Sparse Retrieval; RAG

原始材料

  • 英文标题:UEmbed: Unified Sparse and Dense Multimodal Embeddings
  • 作者:Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu
  • arXiv ID:2608.02583v1
  • 分类:cs.CV(含 cs.AI, cs.CL, cs.IR)
  • arXiv 页面显示提交/更新时间:2026-08-03T17:54:11Z
  • URL:https://arxiv.org/abs/2608.02583v1