知识卡片:SAM-MT:实时交互式多目标视频分割
英文标题:SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
英文关键词:Video Object Segmentation, Multi-Target, Real-Time, SAM2, Decoupled Masked Attention, Sparse Memory
一句话结论
SAM-MT 基于 SAM2 改造,通过将延迟与目标数量解耦,实现了与单目标基线相当的多目标实时视频分割(10 个目标时 >36 FPS),同时保持 SAM2 的鲁棒分割性能。
事件概述 / 研究问题
现代视频对象分割(VOS)在单目标场景中表现优异,但扩展到多目标时,通常将单目标处理流程复制到每个对象,导致帧率(FPS)随目标数增加而下降,延迟无界增长。本文提出 SAM-MT,将 Segment Anything 2(SAM2)转化为交互式实时多目标分割框架。
方法 / 产品要点
- 显式查询:使用明确的查询表示不同个体目标,并与共享的全局上下文并行处理。
- 解耦掩码注意力(Decoupled Masked Attention):保持各目标身份独立,防止跨目标干扰。
- 稀疏内存(Sparse Memory):实现稳定的时序演化。
- 专门策略:设计遮挡处理和重叠预防机制。
主要结果 / 产业意义
- 成功解耦延迟与目标数量:处理 10 个目标时帧率超过 36 FPS(与单目标基线相当)。
- 保持 SAM2 原有的视频分割鲁棒性。
- 意义:为实时视频编辑、自动驾驶、监控等需要多目标跟踪与分割的应用提供了实用方案。
为什么重要
传统多目标分割方案因重复处理导致性能瓶颈,SAM-MT 首次在 SAM2 框架上实现多目标实时交互,显著提升效率,对实际部署具有重要价值。
局限与不确定性
- 摘要未提及在复杂场景(如密集遮挡、快速运动)下的量化表现。
- 对 SAM2 原始模型的改动是否会影响其在特定下游任务的泛化性,待核实。
- 计算资源需求(如 GPU 内存占用)未明确说明。
可用于图书 / PPT / 简报的角度
- 技术突破:展示从单目标到多目标实时分割的核心挑战与 SAM-MT 的解决方案。
- 性能对比:用 FPS 与延迟随目标数变化的图表直观说明解耦效果。
- 应用场景:结合视频剪辑、机器人交互等案例,强调实时性的实际收益。
原始材料
- arXiv ID: 2607.08688v1
- URL: https://arxiv.org/abs/2607.08688v1
- 标题: SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
- 作者: Ruiqi Shen, Chang Liu, Henghui Ding
- 发布时间: 2026-07-09
- 类别: cs.CV