AI消息速览

PercepCap:结构化时空感知的视频字幕生成器

事件日期 2026-07-22 · 学术前沿 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-23
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PercepCap:结构化时空感知的视频字幕生成器

一句话结论

PercepCap 通过先显式生成包含对象轨迹与时间事件的时空感知轨迹,再基于该轨迹生成最终字幕,从而提升视频字幕的时空理解准确性和模型可解释性。

事件概述或研究问题

  • 视频字幕生成需要对物体位置(空间)和事件发生时间(时间)进行细粒度感知。
  • 现有多模态大语言模型(MLLM)通常直接根据视频输入生成字幕,不暴露描述背后的感知证据,导致时空感知错误仅出现在最终输出中,难以直接定位底层感知错误。
  • 为此提出 PercepCap,一种感知感知的视频字幕框架,在生成最终字幕前显式输出感知证据。

方法/产品要点

  • Perceive–Describe 生成链:模型首先生成结构化的时空感知轨迹(包括对象轨迹和时序事件),然后基于该感知证据生成最终字幕。
  • 两阶段训练策略
    1. Perceive-then-Describe 监督微调(SFT):将模型从仅生成字幕调整为遵循“感知→描述”链。
    2. 感知锚定强化学习(Perception-Grounded RL):对感知链和最终字幕的联合奖励进行优化,同时提升感知轨迹和字幕质量。
  • 字幕锚定感知数据构建(Caption-Anchored Perception Data Construction):先生成仅包含字幕的描述,提取其中提及的对象和事件,然后在视频中通过边界框和时间戳将其锚定,得到与字幕对齐的感知数据,为 SFT 和 RL 提供可靠的训练真值。

主要结果或产业意义

  • 在直接字幕评估和字幕到问题回答(caption-to-QA)评估中,PercepCap 一致优于 Qwen3-VL 基线,展示了领先的字幕质量。
  • 具体量化指标待核实。
  • 产业意义:在视频内容理解、智能监控、辅助视障者等领域可提供更可靠且可解释的字幕生成方案。

为什么重要

  • 解决了现有 MLLM 字幕生成中感知错误不可见、难以诊断的根本问题。
  • 通过显式化感知证据,使模型推理过程透明,便于调试和信任建立。
  • 提出的两阶段训练与数据构建方法为因果式视频字幕生成提供了新范式。

局限与不确定性

  • 材料未提供在更长视频、复杂场景下的性能评估结果,待核实。
  • 未提及与除 Qwen3-VL 之外的其他模型(如 GPT-4V、LLaVA-NeXT)的直接比较,待核实。
  • 感知链的生成是否显著增加推理成本及端到端延迟,待核实。

可用于图书/PPT/简报的角度

  • 可解释人工智能:通过结构化感知链展示视频字幕生成中“感知”与“描述”的解耦,适用于讲解可解释多模态模型的设计原则。
  • 视频理解技术演进:对比“端到端黑盒”与“显式推理”两种路线的优劣,作为案例说明如何提升模型在时空定位上的可靠性。
  • 数据构建技巧:展示如何利用字幕文本自动生成对齐的感知标注(对象框和时间戳),降低人工标注成本。

原始材料

  • 英文标题:PercepCap: Video Captioner with Structured Spatio-Temporal Perception
  • 英文关键词:PercepCap, video captioning, spatio-temporal perception, perceive-describe chain, two-stage training, reinforcement learning, caption-anchored data construction
  • 原始来源:arXiv:2607.20389v1, 2026-07-22, https://arxiv.org/abs/2607.20389v1