知识卡片:谷歌Gemini Omni 1.1 Flash登顶AI视频生成榜单
- 一句话结论:谷歌更新Gemini Omni 1.1 Flash,在Arena文生视频榜单登顶,并新增场景延展、首尾帧、360p草稿、4K放大、视频参考等功能,试图把AI视频从“抽卡”式生成推向“可导演”的工作流。
事件概述
- 据新智元2026年8月30日报道,谷歌发布Gemini Omni 1.1 Flash更新。
- 官方宣称该模型在Arena文生视频排名全球第一,图生视频全球第二(得分1488)。
- 最关键的上下文能力变化:视频续拍时可回看此前最多10秒画面,而此前Veo只有1秒;以10秒为一段,累计最长可续拍至40秒。
方法/产品要点
- 场景延展:模型可基于前10秒画面继续生成,支持多段续拍,累计最长40秒。
- 首尾帧:用户指定起始帧和结束帧,由模型生成中间连续运动,适合复杂运镜、转场、无缝循环。
- 360p草稿:比720p最多快60%,成本约为三分之一,用于低成本试错,选中后再升到4K。
- 4K放大:成片可升级至1080p或4K。
- 视频参考:最多3秒参考视频可混合图片、文字输入,将动作、运镜、节奏带入新镜头。
- 价格(按秒计费):360p为0.03美元/秒,720p为0.10美元/秒,1080p为0.15美元/秒,4K为0.30美元/秒。报道称发布当天起全球开放。
主要结果或产业意义
- 报道展示了多个“导演级”案例:三次续拍从人物特写拉到巨大悬浮图书馆;指定“移动变焦”(dolly-zoom)、机械急推、时间冻结环绕等电影镜头;人物对白可多段延续;甚至出现角色打破“第四面墙”与观众对话。
- 已有应用开始承接这些能力:Transition Studio用于首尾帧转场;看房应用可在房间之间推拉环绕,且不凭空增加不存在家具。
- Figma Weave创意总监Itay Schiff评价称,这一步让团队从“生成视频”走到“真正地导演视频”。
为什么重要
- 过去一年AI视频竞争焦点是画质与物理真实感,本次更新把竞争焦点转向“可控性”和“指挥能力”。
- 10秒上下文解决了AI视频“金鱼记忆”问题,让角色、光线、场景在多段续拍中保持一致成为可能。
- 360p草稿+4K放大的分层定价,把试错环节单独降价,降低了高质量成片的制作成本。
- 与已有AI视频基础模型卡片(如LingBot-Video)相比,本条增量信息是:谷歌把视频生成从“抽卡”转向“导演式”流水线,强调创作者控制而非世界模拟。
局限与不确定性
- 榜单排名、功能效果均来自谷歌官方发布及媒体报道,第三方独立验证与实测数据待核实。
- Arena榜单的具体评测方法、覆盖范围和统计时间待核实。
- “图生视频全球第二,1488分”等数字以原文报道为准,不同榜单或版本可能变化。
- 实际生成质量、稳定性、速度、上下文一致性以及开放地区/用户范围,需以谷歌官方文档为准。
- 材料未提供Gemini Omni 1.1 Flash的技术细节、参数量、训练数据等,均待核实。
可用于图书/PPT/简报的角度
- 从“生成视频”到“导演视频”:AI视频控制能力的分水岭。
- 上下文长度为什么是关键:10秒能让AI记住角色、光线、站位和镜头运动。
- 分层成本设计:360p草稿试错、4K成片交付,如何改变AI视频制作经济账。
- 首尾帧、视频参考、场景延展如何组合成一套“导演流水线”。
与既有脉络的关系
- 本条与已有相关卡片(蚂蚁灵波具身视觉模型、LingBot-Video、此芯科技)各自独立,无明显内容重复。
- 可视为AI视频生成在“创作可控性/工作流”方向上的最新进展,与面向具身智能的视频模拟形成不同分支。
原始材料
- 原文标题:刚刚,谷歌新模型全球登顶!(新智元)
- 英文标题(按内容翻译,原文未提供英文标题):Google's Gemini Omni 1.1 Flash Tops AI Video Arena
- 英文关键词:Gemini Omni 1.1 Flash, AI video generation, Arena, scene extension, first/last frame, 360p draft, 4K upscaling, video reference
- 来源 URL:https://aiera.com.cn/2026/08/30/other/admin/111352/%e5%88%9a%e5%88%9a%ef%bc%8c%e8%b0%b7%e6%ad%8c%e6%96%b0%e6%a8%a1%e5%9e%8b%e5%85%a8%e7%90%83%e7%99%bb%e9%a1%b6%ef%bc%81
- 原始来源日期:2026年8月30日