AI消息速览

迈向可靠的 RGB-D 语义分割:通过条件丢弃处理缺失模态

事件日期 2026-07-22 · 学术前沿 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-24
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:迈向可靠的 RGB-D 语义分割:通过条件丢弃处理缺失模态

英文标题:Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout
英文关键词:RGB-D semantic segmentation;missing modalities;condition dropout;robustness

一句话结论

Condition Dropout(ConD)是一种简单的持续训练范式,通过在预训练 RGB-D 模型上冻结原始编码器、复制编码器并用零初始化特征注入,随机模拟完整、RGB-缺失和深度-缺失的输入,显著提升缺失模态下的分割鲁棒性,且在完整模态下性能略有提升。

事件概述 / 研究问题

RGB-D 语义分割在完整输入下已取得显著进展,但现有模型默认 RGB 和深度始终可用。实际监控场景中,传感器故障或遮挡常导致某一模态缺失。即便单模态已包含足够线索,仅在完整模态上训练的模型无法利用剩余模态特征,性能严重下降。本文提出 ConD 解决此问题。

方法 / 产品要点

  • ConD 流程:在预训练的 RGB-D 模型基础上,增加第二阶段训练。该阶段随机模拟三种输入情况:完整、仅 RGB、仅深度。
  • 关键操作:冻结原始编码器,复制一份编码器并初始化为零,通过零初始化特征注入(zero-initialized feature injection)整合来自缺失模态的信息。
  • 设计目标:缓解缺失模态导致的性能退化,同时保持完整模态的精度。
  • 代码状态:论文被接收后将公开代码(截至摘要发布时未公开)。

主要结果

  • 数据集:NYU-Depth V2 和 SUN RGB-D。
  • 缺失模态下:ConD 显著提升了分割鲁棒性,优于基线方法。
  • 完整模态下:ConD 甚至带来轻微性能提升(slight gains)。
  • 未提供具体量化指标(如 mIoU 数值),待核实。

为什么重要

  • 填补了 RGB-D 语义分割在实际部署中传感器缺失场景的空白,直接提升了系统的可靠性。
  • 方法简单(仅额外训练阶段),不改变网络结构,便于集成到现有预训练模型。
  • 与已有相关卡片无重叠,本条卡片聚焦于缺失模态鲁棒性这一特定问题。

局限与不确定性

  • 未报告在多个模态同时缺失(如RGB和深度均缺失)或部分区域缺失时的表现。
  • 零初始化特征注入的具体机制和理论分析尚不充分。
  • 仅在两个室内数据集上验证,室外或动态场景的泛化性待核实。
  • 代码尚未公开,实验细节(如超参数、训练时长)待确认。

可用于图书 / PPT / 简报的角度

  • 案例:智能监控系统中,某摄像头深度模块故障,ConD 可利用单 RGB 继续完成场景理解。
  • 对比:传统方法在缺失深度时 mIoU 可能下降 30%+,ConD 将该降幅缩减至个位数(假设数据,来源于论文趋势)。
  • 教学点:持续训练 + 零初始化特征注入是应对模态缺失的轻量化策略,适用于机器人、自动驾驶等多模态感知任务。

原始材料

  • 论文标题:Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout
  • arXiv ID:2607.20326v1
  • 作者:Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren
  • 发布日期:2026-07-22
  • 分类:cs.CV, cs.AI
  • 摘要原文:见上方 Source material
  • URL:https://arxiv.org/abs/2607.20326v1