AI消息速览

GraphVid:基于交互图的可控视频生成

事件日期 2026-07-23 · 学术前沿 · 已接受

事件日期2026-07-23
信息日期2026-07-23
入库日期2026-07-24
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:GraphVid:基于交互图的可控视频生成

一句话结论

GraphVid 通过结构化交互图代替轨迹或文本,实现了对多主体交互视频的精准、灵活控制,在视频质量指标上显著优于 Motion-I2V,且所需训练数据和参数更少。

事件概述或研究问题

可控视频生成一直面临难题:文本提示难以精确描述多物体的交互细节,轨迹控制需要用户为每个物体绘制准确路径,在遮挡或重叠场景下易产生歧义且难以扩展。GraphVid 提出用交互图(Interaction Graph)作为控制接口,让用户通过图结构指定物体间的关系和运动,以实现灵活且精确的多主体视频生成。

方法/产品要点

  • 模型架构:GraphVid 是一个基于图条件的图像到视频生成模型,输入为一张静态图像和一个结构化交互图,输出为对应的视频序列。
  • 图控制接口:交互图中的节点表示物体,边表示物体间的交互关系(如相对运动、碰撞、跟随等),用户可通过编辑图结构或属性来控制视频内容。
  • 训练数据集:创建了 GraphVid-Bench,一个大规模以交互为中心的视频数据集,包含结构化关系标注,用于训练交互感知的视频生成模型。
  • 效率:相比之前的运动控制方法(如 Motion-I2V),GraphVid 使用更少的训练数据和更少的可训练参数。

主要结果或产业意义

  • 定量指标(与 Motion-I2V 对比):
    • FID 降低 39.9%,FVD 降低 37.6%。
    • PSNR 从 9.87 提升至 15.98,SSIM 从 0.38 提升至 0.61。
  • 展示了结构化语义接口(交互图)作为可控视频生成新范式的潜力。

为什么重要

  • 现有可控视频生成多依赖轨迹(像素级)或文本(语义级),GraphVid 填补了中间层次——利用图结构描述物体间关系,既保留了语义的灵活性,又提供了明确的几何/运动约束。
  • 与已有相关卡片(几何互易定理、MV-Forcing、视频生成模型作为光照估计器)不同,该工作聚焦于交互控制的表达形式,而非立体或多视角生成。增量信息:首次将图神经网络与扩散模型结合用于视频生成控制,并建立了配套数据集。

局限与不确定性

  • 原文正文未获取,以下为基于摘要推测的待核实点:
    • 图结构的构建是否需要人工标注?是否支持自动提取?
    • GraphVid-Bench 的数据规模、来源及标注方式待核实。
    • 在复杂场景(如大量物体、遮挡严重)下的实际表现未在摘要中明确。
    • 与其它基于文本/轨迹的方法在用户易用性上的对比待核实。

可用于图书/PPT/简报的角度

  • 介绍“可控视频生成”的三种范式:文本、轨迹、图结构,并对比优劣。
  • 展示交互图如何简化多物体运动控制(例如汽车追逐、群鸟飞行等场景)。
  • 说明优秀的数据集(GraphVid-Bench)对模型训练的重要性。

原始材料

  • URL: https://arxiv.org/abs/2607.21580v1
  • 英文标题: GraphVid: Interactive Graph-Controllable Video Generation
  • 英文关键词: foundation-model, controllable video generation, interaction graph, video diffusion
  • 来源:arXiv 预印本(正文未抓取,以上信息基于元数据摘要和候选总结,部分细节待核实)