AI消息速览

超越检索:流式视频理解中的渐进式潜在记忆演化(LatentStream)

事件日期 2026-09-03 · 学术前沿 · 待审核

事件日期2026-09-03
信息日期2026-09-03
入库日期2026-09-05
通道学术前沿
状态待审核
来源arXiv 论文

知识卡片:超越检索:流式视频理解中的渐进式潜在记忆演化(LatentStream)

英文标题:Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
英文关键词(据摘要整理):Streaming Video Understanding; Multimodal Large Language Models; Latent Working Memory; Retrieve-and-Internalize; Store-and-Retrieve

一句话结论

LatentStream 提出一种面向流式视频理解的“渐进式潜在工作记忆”框架,将记忆处理范式从“先存储、再检索外部证据”(store-and-retrieve)转变为“检索后将证据内化为固定长度潜在记忆”(retrieve-and-internalize)。论文摘要称其已在既有在线与离线视频基准上取得新的 SOTA,但具体性能数值待核实。

事件概述/研究问题

流式视频理解要求多模态大语言模型在严格因果性和有限记忆预算下持续处理连续视觉输入,并响应用户查询。

现有方法通常把历史观测压缩到外部记忆库,再按用户查询检索相关证据作为额外视觉上下文。论文指出,这种“存储—检索”范式的问题在于:历史证据始终停留在外部视觉上下文,没有被内化为一种紧凑、可不断演化的潜在记忆,因而难以持续引导模型进行流式推理。

LatentStream 的出发点是让历史信息进入模型内部的潜在记忆,而不是每次查询都依赖外部记忆库返回的上下文。

方法/产品要点

摘要给出三个协同组件:

  1. 查询无关的分层流式记忆(Query-agnostic Hierarchical Streaming Memory)
    在固定记忆预算下,利用 Jenks-guided 自适应整合,把视觉历史组织成短时、中时、长时三个层级。

  2. 分层潜在记忆演化(Hierarchical Latent Memory Evolution)
    查询到达后,为若干组潜在记忆 token 配置逐步扩大的“记忆感受野”,使它们从对应范围内迭代检索历史证据,并把证据内化为紧凑、固定长度的潜在记忆。

  3. 渐进式置信引导的潜在记忆优化(Progressive Confidence-guided Latent Memory Optimization)
    基于分组预测熵构造分层递进奖励,联合优化潜在记忆 token 与检索到的证据,鼓励模型在流式推理中逐步产生更自信的预测。

上述组件的具体输入输出形式、token 数量、记忆预算大小、训练目标细节等,摘要中未披露,待核实。

主要结果或产业意义

摘要称,大量实验表明 LatentStream 在现有在线与离线视频基准上取得了新的 state-of-the-art 结果。但来源材料中没有给出:

  • 具体评测基准名称;
  • 比较的基线模型;
  • 提升幅度;
  • 记忆预算、计算开销或延迟指标。

因此“新 SOTA”目前只能看作作者结论,具体证据待核实。产业意义上,该工作提供了一条“把历史沉淀进模型内部,而不是每次翻外部记忆库”的路线,可能有助于降低对长视频外部检索或超长上下文的依赖,但工程价值仍需后续数据验证。

为什么重要 / 与既有脉络的关系

  • 与 GenEvA 相比:GenEvA 侧重长视频理解中在“选帧/压缩”后做查询相关的跨帧潜在证据聚合;LatentStream 则面向流式视频推理,强调历史证据不应只作为外部检索上下文,而应被内化为固定长度的潜在记忆。
  • 与 ShallowStream 相比:ShallowStream 关注流式视频理解的架构分层与推理延迟优化;LatentStream 关注记忆范式本身,提出“检索并内化”来代替“存储后检索”。
  • 本条增量信息:现有卡片没有明确强调“内化”这一层。LatentStream 的核心增量是让记忆从外部视觉上下文走向内部潜在记忆,并以固定预算维持多层级历史。

局限与不确定性

  • 本文仅依据 arXiv 摘要生成,尚未获取全文实验细节。
  • “在线/离线视频基准”未在摘要中展开,具体任务类型、视频来源、问答形式待核实。
  • “潜在记忆 token”的可解释性、初始化方式、跨批次累积方式,以及如何与 LLM 主干层融合,待核实。
  • 是否开源代码、模型或提供 demo,来源材料中未说明,待核实。

可用于图书/PPT/简报的角度

  • 用“把历史装进脑子里,而不是每次都翻档案柜”概括 LatentStream 的记忆范式转变。
  • 画一张流程图:三层视觉历史(短/中/长)→ 分组潜在记忆 token 迭代检索 → 固定长度潜在记忆 → 流式问答。
  • 对比三种近期路线:GenEvA 的“帧后潜在聚合”、ShallowStream 的“浅层建索引/深层作答”、LatentStream 的“检索并内化”。
  • 提醒读者:看到“SOTA”应当追问是在哪些基准、与谁对比、记忆预算和监督信号分别是什么。

原始材料

  • 英文标题:Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
  • 作者:Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan
  • arXiv ID:2609.04131v1
  • 分类:cs.CV
  • Published:2026-09-03T17:28:14Z
  • Updated:2026-09-03T17:28:14Z
  • 原始来源:https://arxiv.org/abs/2609.04131v1
  • PDF URL:https://arxiv.org/pdf/2609.04131v1