AI消息速览

SAM-MT:实时交互式多目标视频分割

事件日期 2026-07-09 · 学术前沿 · 已接受

事件日期2026-07-09
信息日期2026-07-09
入库日期2026-07-11
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:SAM-MT:实时交互式多目标视频分割

英文标题:SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
英文关键词:Video Object Segmentation, Multi-Target, Real-Time, SAM2, Decoupled Masked Attention, Sparse Memory

一句话结论

SAM-MT 基于 SAM2 改造,通过将延迟与目标数量解耦,实现了与单目标基线相当的多目标实时视频分割(10 个目标时 >36 FPS),同时保持 SAM2 的鲁棒分割性能。

事件概述 / 研究问题

现代视频对象分割(VOS)在单目标场景中表现优异,但扩展到多目标时,通常将单目标处理流程复制到每个对象,导致帧率(FPS)随目标数增加而下降,延迟无界增长。本文提出 SAM-MT,将 Segment Anything 2(SAM2)转化为交互式实时多目标分割框架。

方法 / 产品要点

  • 显式查询:使用明确的查询表示不同个体目标,并与共享的全局上下文并行处理。
  • 解耦掩码注意力(Decoupled Masked Attention):保持各目标身份独立,防止跨目标干扰。
  • 稀疏内存(Sparse Memory):实现稳定的时序演化。
  • 专门策略:设计遮挡处理和重叠预防机制。

主要结果 / 产业意义

  • 成功解耦延迟与目标数量:处理 10 个目标时帧率超过 36 FPS(与单目标基线相当)。
  • 保持 SAM2 原有的视频分割鲁棒性。
  • 意义:为实时视频编辑、自动驾驶、监控等需要多目标跟踪与分割的应用提供了实用方案。

为什么重要

传统多目标分割方案因重复处理导致性能瓶颈,SAM-MT 首次在 SAM2 框架上实现多目标实时交互,显著提升效率,对实际部署具有重要价值。

局限与不确定性

  • 摘要未提及在复杂场景(如密集遮挡、快速运动)下的量化表现。
  • 对 SAM2 原始模型的改动是否会影响其在特定下游任务的泛化性,待核实。
  • 计算资源需求(如 GPU 内存占用)未明确说明。

可用于图书 / PPT / 简报的角度

  • 技术突破:展示从单目标到多目标实时分割的核心挑战与 SAM-MT 的解决方案。
  • 性能对比:用 FPS 与延迟随目标数变化的图表直观说明解耦效果。
  • 应用场景:结合视频剪辑、机器人交互等案例,强调实时性的实际收益。

原始材料

  • arXiv ID: 2607.08688v1
  • URL: https://arxiv.org/abs/2607.08688v1
  • 标题: SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
  • 作者: Ruiqi Shen, Chang Liu, Henghui Ding
  • 发布时间: 2026-07-09
  • 类别: cs.CV