SBS(Seeing Before Synthesizing)提出“先看后合成”的新范式:先用视觉语言模型(VLM)观察事件间隙的帧级内容,再在真正发生语义转换的位置合成辅助指导,从而在弱监督密集视频描述中同时提升事件定位与描述性能。
弱监督密集视频描述(Weakly-Supervised Dense Video Captioning)的任务是:仅凭每段未修剪视频对应的一组有序事件级字幕,定位并描述视频中的多个事件。近期方法会用大语言模型(LLM)合成“过渡字幕”来提供额外的视觉-语言对齐信号,但这些字幕缺乏视觉基础,并且被固定分配到每个事件间隙的固定位置和时长上。SBS 针对这一局限,…