AI消息速览

关系感知的开放词汇3D场景理解

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:关系感知的开放词汇3D场景理解

英文标题: Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

英文关键词: open-vocabulary 3D scene understanding, 3D scene graph, relationship-aware, RelGraphOV, vision-language reasoning, adaptive gated dual-stream GAT

一句话结论: 本文提出RelGraphOV框架,通过构建3D场景图并引入关系感知的双流图注意力网络,在不依赖人工关系标注的情况下显著提升了开放词汇3D场景理解性能。

事件概述/研究问题: 开放词汇3D场景理解旨在超越预定义类别,利用视觉-语言模型对3D场景进行分割。现有方法通过将语言对齐的2D特征提升到3D空间,但通常依赖与上下文无关的语义表示,忽视了物体间关系对场景理解的上下文修正作用。本文研究如何利用3D场景图中的物体关系来增强开放词汇的3D场景理解。

方法/产品要点:

  1. 关系场景图构建: 从多视角观测中,利用视觉-语言推理自动推断物体关系,并修剪几何上不合理的连接,无需人工关系标注。
  2. 自适应门控双流上下文GAT: 将密集几何特征与语义CLIP嵌入分离,进行边引导的消息传递,并自适应融合互补语义,避免特征干扰。
  3. 层次对比目标: 促进实例级一致性和类别级区分性。

主要结果或产业意义: 在ScanNetV2、ScanNet200、ScanNet++和Replica数据集上的实验证明了该方法的强大性能和泛化能力。该方法可应用于机器人导航、AR/VR场景理解、智能建筑管理等领域。

为什么重要: 首次在开放词汇3D场景理解中系统性地引入物体关系信息,并通过无标注的视觉-语言推理自动构建场景图,解决了以往方法上下文缺失的问题,具有更自然的场景理解和更好的泛化潜力。

局限与不确定性: 材料中未明确提及局限性;可能的局限包括:对视觉-语言模型的推理能力依赖较高、计算开销、场景图构建的准确性受多视角观测质量影响等,需进一步阅读全文确认。

可用于图书/PPT/简报的角度:

  • 展示如何将2D视觉-语言模型的语义先验与3D几何结构融合,用于场景理解。
  • 讲解场景图(Scene Graph)在3D AI中的最新应用。
  • 对比传统封闭集3D分割与开放词汇方法的演进。

原始材料:

  • arXiv论文: https://arxiv.org/abs/2607.05348v1
  • PDF: https://arxiv.org/pdf/2607.05348v1
  • 项目页面: https://cxavireh.github.io/relgraphov-projectpage