知识卡片:时空条件去噪Transformer用于模态缺失的RGBT跟踪——SCDT
一句话结论
本文提出时空条件去噪Transformer(SCDT),通过联合长短时时间上下文作为条件,利用噪声调制适应机制,在单一框架内统一处理模态缺失与完整数据的RGBT跟踪,并在三个公开基准上取得最优结果。
事件概述或研究问题
RGBT跟踪中,可见光(RGB)与热红外(T)模态经常出现缺失,导致多模态特征表示不完整且不稳定,严重降低跟踪性能。现有方法通常从可用模态恢复缺失模态,但在挑战性场景下生成质量不佳;同时,现有方法在处理模态缺失与完整数据时灵活性有限。本文针对上述两个局限提出统一解决方案。
方法/产品要点
- 框架名称:Spatio-temporal Conditional Denoising Transformer (SCDT)
- 核心思路:将空间线索与时间上下文集成到条件去噪框架中,自适应地对缺失模态进行信息重建,并对弱模态进行特征增强。
- 短时时间线索:利用近期历史帧捕获细粒度时间相关性。
- 长时时间线索:编码模态演化(如模态可用性的变化模式)以捕获全局上下文。
- 联合条件机制:长短时时间上下文共同作为条件,逐步引导可用模态的噪声特征学习可靠且时间一致的多模态表示。
- 噪声调制适应机制:根据模态可用性动态调整模型行为,无需改变架构或参数,即可在模态缺失与完整场景下统一进行特征学习。
主要结果或产业意义
- 在三个公开RGBT跟踪基准数据集上,SCDT一致优于现有最先进方法。
- 代码已开源(arXiv摘要页面提供链接)。
- 意义:为实际部署中传感器故障、遮挡等导致模态缺失的场景提供更鲁棒的跟踪方案,可应用于无人机、安防监控、自动驾驶等领域。
为什么重要
- 首次将条件去噪扩散思想引入模态缺失RGBT跟踪,同时处理信息重建与特征增强。
- 噪声调制适应机制使得单一模型无需切换即可适应不同模态可用情况,降低了部署复杂度。
- 与已有卡片中的UAV-DualCog(评估MLLM推理能力)不同,本卡片聚焦于底层多模态跟踪鲁棒性;与自动驾驶时序规划卡片无直接重复,本工作提供的是视觉跟踪层面的技术。
局限与不确定性
- 原文仅提供摘要,详细实验设置(如缺失模态类型、比例、基准具体名称)待核实。
- 长时时间线索的“模态演化”编码具体实现方式未详述,需阅读全文确认。
- 噪声调制适应机制的参数量与计算开销未提及,实际部署效率待核实。
- 在极端光照、热源干扰等复杂场景下的表现未在摘要中明确量化。
可用于图书/PPT/简报的角度
- 智能安防中传感器故障时的连续跟踪:展示SCDT如何利用历史帧恢复缺失模态。
- 多模态融合前沿动态:条件去噪在视觉跟踪中的新应用。
- 模型适应性与鲁棒性设计:单一框架统一处理缺失与完整数据的工程启示。
原始材料
- 标题:Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking
- 作者:Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo
- 发布:2026-07-27,arXiv:2607.24701v1 (cs.CV)
- 摘要原文及代码链接:https://arxiv.org/abs/2607.24701v1
- 英文关键词:RGBT tracking, modality-missing, denoising transformer, spatio-temporal conditional, noise-modulated adaptation