AI消息速览

SceneBind:跨视觉、音频与语言的“什么”和“在哪里”绑定

事件日期 2026-07-16 · 学术前沿 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-17
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:SceneBind:跨视觉、音频与语言的“什么”和“在哪里”绑定

英文标题: SceneBind: Binding What and Where Across Vision, Audio and Language

英文关键词: omni-modal representation; semantic-spatial; cross-modal retrieval; audio-visual localization; scene understanding

一句话结论

SceneBind 提出了一种统一的全模态场景表示,在实例级语义(“有什么”)基础上加入了显式的3D空间结构(“在哪里”),并在跨模态场景检索和音频-视觉定位任务上达到当前最优。

事件概述或研究问题

现有的全模态编码器擅长识别场景中的物体类别(实例级语义),但缺乏对物体空间位置和3D结构的显式建模。SceneBind 的目标是让模型同时理解“场景中有什么”和“它们在哪里”,并支持跨视觉、音频、语言三种模态的场景检索与物体定位。

方法/产品要点

  • 语义-空间实体表示:每个场景表示为一个全局语义嵌入加上一组以物体为中心的语义-空间槽(slots),每个槽同时编码物体语义、3D空间属性和不确定性。
  • SceneBind Matching:一种结合全局场景相似度和物体级对齐的匹配方案,支持跨模态场景检索和物体级定位(object grounding)。
  • 训练数据与协议:收集了一个新的真实世界双耳音频-视觉数据集,带有结构化的语义和空间标注,并设计了对齐语义和空间信号的多模态训练流程。
  • 兼容性:与大规模预训练语义编码器兼容,仅需少量额外token即可添加轻量级空间建模。

主要结果或产业意义

  • 在场景检索和空间检索任务上达到当前最优(state-of-the-art)。
  • 在音频-视觉定位等下游任务上展现出强大的零样本迁移能力。
  • 为需要同时理解语义与空间信息的应用场景(如机器人导航、增强现实、智能监控)提供了统一的基础模型框架。

为什么重要

现有全模态研究多聚焦于语义对齐,而 SceneBind 首次在视觉-音频-语言三种模态中系统性地融合了3D空间结构,填补了“在哪里”这一关键维度的空白。其轻量级设计也降低了实际部署成本。

局限与不确定性

  • 数据集来源为真实世界双耳音频-视觉数据,但具体规模、场景多样性及标注质量待核实。
  • 仅测试了检索与定位任务,在复杂交互或动态场景下的泛化能力待核实。
  • 空间建模的3D精度(如绝对坐标或相对方位)的具体实现细节待核实。

可用于图书/PPT/简报的角度

  • 多模态AI的新范式:从“认出物体”到“知道物体在哪”。
  • 跨模态搜索的未来:用声音或文字描述找到对应场景中的物体位置。
  • 对比已有视觉-语言模型(见已有相关卡片),SceneBind 专注于空间理解这一当前MLLM仍薄弱的环节(如“十年间视觉语言模型”卡片指出空间依赖错误尚未消除),因此是其增量改进方向。

原始材料

  • 论文标题:SceneBind: Binding What and Where Across Vision, Audio and Language
  • arXiv ID:2607.15265v1
  • 作者:Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman
  • 发布时间:2026-07-16
  • 摘要来源:https://arxiv.org/abs/2607.15265v1
  • PDF:https://arxiv.org/pdf/2607.15265v1