AI消息速览

OpenCoF:通过视频生成学习推理

事件日期 2026-07-09 · 学术前沿 · 已接受

事件日期2026-07-09
信息日期2026-07-09
入库日期2026-07-10
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:OpenCoF:通过视频生成学习推理

一句话结论

OpenCoF 通过构建专门的推理视频数据集(OpenCoF-17K)并微调视频生成模型(Wan-CoF),证明了多样化的时序监督能显著提升模型在视频推理任务上的表现,同时引入视觉和文本推理令牌可进一步组织中间推理状态。

事件概述或研究问题

大型模型需要具备理解逻辑后果的推理能力。现有视频生成模型主要训练于通用视频语料,缺乏针对“帧链式推理”(Chain-of-Frame, CoF)的多样化监督和专用设计。为此,论文提出 OpenCoF 框架,旨在研究如何通过视频生成来实现推理。

方法/产品要点

  • 框架组成:OpenCoF-17K 推理视频数据集(覆盖 11 个任务族) + Wan-CoF(在 Wan2.2-I2V-A14B 基础上微调的视频模型)。
  • 推理机制:利用视频中时序相连的帧进行推理,称为 Chain-of-Frame(CoF),区别于传统的 Chain-of-Thought(CoT)。
  • 高级设计:为模型配备视觉推理令牌和文本推理令牌,分别捕获低层视觉线索与高层语义先验,用于空间和时序推理。
  • 开源:数据集、模型和代码均已公开。

主要结果或产业意义

  • 在四个视频推理基准上,Wan-CoF 相比基线 Wan2.2-I2V-A14B 取得了可观提升。
  • 通过性能对比和注意力分析,揭示了推理令牌在不同模型深度、去噪步数、空间和时间维度上的贡献。
  • 结果表明:更强的视频推理既需要广泛的时序监督,也需要显式的中间推理状态组织机制。

为什么重要

这项工作开辟了通过视频生成进行推理的新路径,为未来面向推理的视频生成研究提供了数据、模型和设计思路。其开源性质有助于社区快速复现和扩展。

局限与不确定性

  • 仅在一个基线模型(Wan2.2-I2V-A14B)上进行了微调,其他架构的泛化性待核实。
  • 推理令牌的机制在小规模实验和特定基准上的效果,是否完全推广到真实复杂场景尚需验证。
  • 数据集 OpenCoF-17K 的规模(17K 视频)和任务覆盖范围可能仍然有限。

可用于图书/PPT/简报的角度

  • 对比 Chain-of-Thought 与 Chain-of-Frame 两种推理路径的差异。
  • 展示视频生成模型如何从单纯的内容生成转向推理工具。
  • 强调数据多样性(11 任务族)和模型架构改进(推理令牌)对推理能力的提升作用。

原始材料

  • URL:https://arxiv.org/abs/2607.08763v1
  • 英文标题:OpenCoF: Learning to Reason Through Video Generation
  • 英文关键词:video generation, reasoning, Chain-of-Frame, foundation-model, temporal supervision