AI消息速览

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

英文标题:JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

英文关键词(根据摘要提取):JoyAI-Video-Edit; Autoregressive Diffusion; Real-Time Video Editing; Open-Ended Video Editing; SA-DMD

一句话结论

JoyAI-Video-Edit 是一个 16B 参数的自回归扩散视频编辑框架,可在不访问未来帧、无需预设视频时长的情况下,以单张 NVIDIA B200 GPU 实现约 30 FPS 的端到端 720p 实时视频编辑,并在自动与人工评测中优于现有流式编辑器、与强离线系统表现相当。

事件概述或研究问题

实时视频编辑需要低延迟的因果生成和有界的计算资源,同时要保留源视频的保真度并维持长时间的时间一致性。JoyAI-Video-Edit 面向的是“开放式”视频编辑:模型不需要看到未来帧,也不需要预先知道视频总时长,从而支持流式、不定长的编辑需求。

方法/产品要点

  • 采用 16B 参数的自回归扩散框架,按块进行因果生成。
  • 结合分块自回归适配,使模型适用于无预定时长的视频输入。
  • Source-Anchored Distribution Matching Distillation(SA-DMD):用于降低训练与推理之间的不匹配,并在两步生成中保持源视频保真度。
  • Long-Horizon Autoregressive Distillation:用于缓解长时间自回归生成中累积的时间漂移。
  • 代码已开源:https://github.com/jd-opensource/JoyAI-Video-Edit

主要结果或产业意义

  • 自动评估和人工评估显示,JoyAI-Video-Edit 明显优于现有流式编辑器,并与强离线系统保持竞争力;具体评测基准、指标和数值在现有材料中未列出,待核实。
  • 完整系统在单张 NVIDIA B200 GPU 上实现端到端 720p 视频编辑约 30 FPS,表明高分辨率实时视频编辑在单卡上具备可行性。
  • 对直播、短视频制作等低延迟视频编辑场景具有潜在产业价值。

为什么重要

与已有卡片涉及的 SAM-MT(视频目标分割)、X-Lens(单目深度估计)、FlowMimic(视频编辑训练数据生成)不同,JoyAI-Video-Edit 直接面向“实时开放式视频编辑”这一生成任务。它展示了自回归扩散模型在流式视频编辑中的可行路径,并通过蒸馏技术将 16B 参数模型压缩到可实时推理的水平,增量价值在于将实时视频编辑的尺度推向了单卡 720p@30FPS。

局限与不确定性

  • 从现有材料仅能确认方法框架和性能量级;详细的模型结构、分块大小、训练数据、评测数据集、基线列表、人工评估规模等尚未披露,待核实。
  • “约 30 FPS”的具体测速条件(视频长度、分辨率、是否包含编解码、B200 配置等)未说明,待核实。
  • 与强离线系统相比的具体差距、失败案例和计算资源峰值未在摘要中提供,待核实。
  • 对不同编辑指令类型、源视频风格和长时间稳定性的边界效果未知,待核实。

可用于图书/PPT/简报的角度

  • 实时视频编辑面临的核心挑战:低延迟、因果生成、时间一致性的权衡。
  • 自回归扩散模型在视频生成与编辑中的最新应用。
  • 多阶段蒸馏如何帮助大模型实现实时单卡推理。
  • 视频编辑从离线处理走向流式实时化的产品潜力。

原始材料

  • 英文标题:JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
  • arXiv ID:2608.03974v1
  • 作者:Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan
  • 发布时间:2026-08-04T17:40:48Z
  • 更新日期:2026-08-04T17:40:48Z
  • 分类:cs.CV
  • 摘要 URL:https://arxiv.org/abs/2608.03974v1
  • PDF URL:https://arxiv.org/pdf/2608.03974v1
  • 代码:https://github.com/jd-opensource/JoyAI-Video-Edit