知识卡片:阿里Wan3.0视频模型开启公测,单次可生成30秒
英文标题:Alibaba Wan3.0 Video Model Enters Public Beta, Generating 30 Seconds per Clip
英文关键词:generative model; video generation; Alibaba; Wan3.0
一句话结论
阿里发布新一代视频生成模型 Wan3.0 并开启公测,单次可生成 30 秒视频,支持连续运镜、一镜到底等复杂镜头语言与智能时长,并首次支持文档输入,主打真实感与一致性。
事件概述
据腾讯研究院 AI 速递(20260807)消息,阿里发布新一代视频生成模型 Wan3.0 并开启公测。该模型单次可生成 30 秒视频,支持连续运镜、一镜到底等复杂镜头语言与智能时长;在文本、图片、音频、视频之外,首次支持 doc、xls、ppt、pdf、md 等文档输入,可生成教学课件、产品演示等内容。官方平台已开放公测。
方法/产品要点
- 单次生成 30 秒视频,支持连续运镜、一镜到底等复杂镜头语言与智能时长。
- 输入模态扩展:在文本、图片、音频、视频之外,首次支持 doc、xls、ppt、pdf、md 等文档输入。
- 可基于文档输入生成教学课件、产品演示等内容。
- 主打真实感与一致性:人像千人千面、微表情自然,并稳定保持角色、道具、场景与风格。
- 已在官方平台开启公测。
主要结果或产业意义
- Wan3.0 公测意味着视频生成模型在生成时长、镜头语言控制和跨模态文档输入方面进一步落地。
- 文档输入能力使视频生成不再局限于“文本/图片生成视频”,而是向课件、产品演示等办公与教育场景延伸,可能改变相关内容生产方式。
- 角色、道具、场景与风格的一致性,是视频生成走向商用化的重要卖点。
为什么重要
- 长视频生成(30 秒)与复杂镜头语言(一镜到底、连续运镜)是视频生成模型从“单镜头片段”走向“可叙事内容”的关键一步。
- 真实感与一致性是视频生成在影视、广告、教育等领域被采用的核心门槛,Wan3.0 将其作为主打方向。
- 多文档输入预示着视频生成与大模型办公生态的融合趋势,可能拓展 AIGC 的应用边界。
局限与不确定性
- 本卡片信息来源于腾讯研究院 AI 速递的新闻摘要,未提供 Wan3.0 的技术报告、评估基准或第三方测评数据。
- “智能时长”的具体实现机制、文档输入的深度(如是否直接生成课件文件或仅作内容参考)待核实。
- “真实感与一致性”是否在所有场景下均能达到宣传效果,需通过实际公测验证。
- 单次生成 30 秒视频的分辨率、帧率、复杂程度等限制未在材料中说明。
可用于图书/PPT/简报的角度
- 作为 AI 视频生成模型产业动态的案例,说明多模态生成模型的能力演进。
- 在 PPT 中突出视频生成的“时长变长 + 镜头语言 + 多模态输入 + 一致性”几个关键趋势。
- 与办公、教育场景结合,展示 AI 从“生成视频”到“生成可演示内容”的跨界应用。
- 作为国内大模型厂商在视频生成赛道竞争的样本,可与同类型产品进行横向对比。
原始材料
- 来源:腾讯研究院AI速递 20260807(搜狐号)
- URL: https://m.sohu.com/a/1059717925_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=5