知识卡片:LeVJEPA:无需启发式策略的高效可扩展视频预训练
一句话结论
LeVJEPA 是首个在 LeJEPA 无坍塌目标下训练的视频编码器,完全去除 EMA 目标编码器、stop-gradient 和容量受限预测器等常见启发式部件,仅保留“编码器 + 投影器”结构,并用 SIGReg 正则化以可证明的方式防止表征坍塌,从而在显著降低视频预训练计算成本的同时,匹配或超越现有方法。
事件概述或研究问题
视频包含物理世界的时间结构,但从视频中学习表征的计算成本一直很高。现有自监督视频预训练方法要么依赖架构不对称(如指数滑动平均目标编码器、stop-gradient、容量受限预测器)来避免表征坍塌,要么通过像素空间重建掩码内容来规避该问题。LeVJEPA 研究的是:能否在没有这些启发式设计的情况下,仍然高效、可扩展地训练视频编码器。
方法/产品要点
- 采用 LeJEPA 框架的无坍塌学习目标,仅用单一编码器,通过全局视图与局部视图之间的不变性损失进行训练。
- 使用 SIGReg 正则化,该正则化提供可证明的防坍塌保证。
- 整体架构简化为一个编码器和一个投影器,目标函数只有一个超参数。
- 支持均匀随机 token 丢弃,使预训练计算成本由编码器实际观察到的 token 数决定;这种丢弃不仅降低计算量,还能提升下游精度。
- 由于两个分支之间不需要不对称设计,编码器可以采用块因果注意力训练,时间顺序成为编码器自身的属性,且没有可测量的精度损失。
主要结果或产业意义
在相同 epoch、相同数据条件下,LeVJEPA 在 ViT-S/B/L 上以 5.6 到 20.8 倍更少的预训练计算量匹配或超越 V-JEPA 2。在匹配总 FLOPs 时,LeVJEPA 在 ImageNet-1K 上比最强视频基线高 7.6 点,同时在运动中心基准上保持竞争力。与计算匹配的、在相同视频帧上训练的 DINOv2 相比,LeVJEPA 在表观中心评估上接近图像预训练编码器,但运动中心准确率几乎翻倍。这表明一旦计算开销被移除,视频可以成为通用视觉预训练的可行且在某些方面更优的数据来源。
为什么重要
LeVJEPA 表明,视频预训练不一定需要复杂的非对称机制或像素重建。通过理论上有保证的正则化,可以将目标简化为单一超参数,同时实现数量级的计算节省,并保持甚至提升下游性能。该工作为视频作为通用视觉表征训练基底提供了新的证据,并可能降低视频预训练的实际应用门槛。
局限与不确定性
- 现有材料未提供具体训练数据规模、模型参数量、训练时长等实现细节,待核实。
- 论文是否经过同行评审或正式发表,待核实。
- 与更大规模模型、更多基准的比较结果尚未看到,待核实。
- 对于极端长视频、多模态场景等泛化情况,现有材料未涉及,待核实。
可用于图书/PPT/简报的角度
- 以“视频预训练可以更简单”为切入点,展示用数学上可证明的正则化替代工程上的启发式部件,如何带来数量级计算节省。
- 可制作对比图:传统方法依赖多个组件,而 LeVJEPA 仅需编码器 + 投影器 + 一个超参数。
- 突出“视频 vs 图像”作为预训练数据源的再思考:视频的时间结构可能比静态图像更有价值。
英文标题与关键词
- 英文标题:LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics
- 英文关键词:LeVJEPA; efficient video pretraining; collapse-free objective; SIGReg; V-JEPA 2; self-supervised learning
原始材料
- URL: https://arxiv.org/abs/2608.27395v1
- 来源类型:学术论文预印本(arXiv)
- 说明:未能抓取论文正文,以上内容仅基于已知元数据中的摘要(Candidate summary)生成;摘要中未提及的信息均标注为“待核实”。