知识卡片:迈向可靠的 RGB-D 语义分割:通过条件丢弃处理缺失模态
英文标题:Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout
英文关键词:RGB-D semantic segmentation;missing modalities;condition dropout;robustness
一句话结论
Condition Dropout(ConD)是一种简单的持续训练范式,通过在预训练 RGB-D 模型上冻结原始编码器、复制编码器并用零初始化特征注入,随机模拟完整、RGB-缺失和深度-缺失的输入,显著提升缺失模态下的分割鲁棒性,且在完整模态下性能略有提升。
事件概述 / 研究问题
RGB-D 语义分割在完整输入下已取得显著进展,但现有模型默认 RGB 和深度始终可用。实际监控场景中,传感器故障或遮挡常导致某一模态缺失。即便单模态已包含足够线索,仅在完整模态上训练的模型无法利用剩余模态特征,性能严重下降。本文提出 ConD 解决此问题。
方法 / 产品要点
- ConD 流程:在预训练的 RGB-D 模型基础上,增加第二阶段训练。该阶段随机模拟三种输入情况:完整、仅 RGB、仅深度。
- 关键操作:冻结原始编码器,复制一份编码器并初始化为零,通过零初始化特征注入(zero-initialized feature injection)整合来自缺失模态的信息。
- 设计目标:缓解缺失模态导致的性能退化,同时保持完整模态的精度。
- 代码状态:论文被接收后将公开代码(截至摘要发布时未公开)。
主要结果
- 数据集:NYU-Depth V2 和 SUN RGB-D。
- 缺失模态下:ConD 显著提升了分割鲁棒性,优于基线方法。
- 完整模态下:ConD 甚至带来轻微性能提升(slight gains)。
- 未提供具体量化指标(如 mIoU 数值),待核实。
为什么重要
- 填补了 RGB-D 语义分割在实际部署中传感器缺失场景的空白,直接提升了系统的可靠性。
- 方法简单(仅额外训练阶段),不改变网络结构,便于集成到现有预训练模型。
- 与已有相关卡片无重叠,本条卡片聚焦于缺失模态鲁棒性这一特定问题。
局限与不确定性
- 未报告在多个模态同时缺失(如RGB和深度均缺失)或部分区域缺失时的表现。
- 零初始化特征注入的具体机制和理论分析尚不充分。
- 仅在两个室内数据集上验证,室外或动态场景的泛化性待核实。
- 代码尚未公开,实验细节(如超参数、训练时长)待确认。
可用于图书 / PPT / 简报的角度
- 案例:智能监控系统中,某摄像头深度模块故障,ConD 可利用单 RGB 继续完成场景理解。
- 对比:传统方法在缺失深度时 mIoU 可能下降 30%+,ConD 将该降幅缩减至个位数(假设数据,来源于论文趋势)。
- 教学点:持续训练 + 零初始化特征注入是应对模态缺失的轻量化策略,适用于机器人、自动驾驶等多模态感知任务。
原始材料
- 论文标题:Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout
- arXiv ID:2607.20326v1
- 作者:Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren
- 发布日期:2026-07-22
- 分类:cs.CV, cs.AI
- 摘要原文:见上方 Source material
- URL:https://arxiv.org/abs/2607.20326v1