知识卡片:MiniMax发布全模态模型H3,统一理解生成音视频并将开源
一句话结论
MiniMax发布通用全模态生成模型H3,支持文本、图像、视频、声音的统一理解,可输出原生双声道音视频;最高支持15秒2K分辨率,2K每秒价格不到主流模型三分之一,并将在未来几天开放模型权重。
事件概述
2026年8月3日腾讯研究院AI速递披露,MiniMax发布通用全模态生成模型H3。该模型强调“任务统一泛化”,试图打破模态与功能边界,覆盖文本、图像、视频、声音的理解与生成,并面向广告、电商、游戏等商业场景。
方法/产品要点
- 全模态统一理解:支持文本、图像、视频、声音的联合输入理解。
- 原生双声道生成:可输出模型直接生成的双声道音视频,而非后期配音合成。
- 视频规格:最高支持15秒、2K分辨率。
- 定价策略:2K分辨率每秒价格不到主流模型的三分之一。
- 开源计划:未来几天将开放模型权重。
主要结果或产业意义
- H3以单一模型统一“理解”和“生成”,可能减少以往多模态任务中串联多个模型的成本与复杂度。
- 低价与开源权重相结合,可能对AI视频生成市场的定价和生态竞争产生直接冲击。
- 在广告、电商、游戏等场景中,原生双声道音视频输出可缩短内容制作流程。
为什么重要
当前视频生成领域多聚焦于“文本/图像到视频”的单项生成能力,H3强调全模态统一理解与生成,并将“原生双声道”作为产品特性,意味着音视频同步生成而非后期配音。相较于已有的材料发现、机器人、3D生成等卡片内容,本条是生成式大模型在视频/多模态赛道上的新进展,增量信息集中在统一全模态架构、低价2K视频生成和即将开源权重三点。
局限与不确定性
- 材料为速递条目,未提供H3的模型架构、参数量、训练数据、评测基准等细节。
- “2K每秒价格不到主流模型三分之一”中的“主流模型”具体指哪些模型、如何计价,待核实。
- “未来几天将开放模型权重”尚未兑现,具体开源协议、是否可商用待核实。
- 原生双声道音视频的实际质量、多模态理解上限及商业落地效果,有待第三方评测验证。
- 材料未说明该模型是否支持中文、上下文长度、推理速度等信息。
可用于图书/PPT/简报的角度
- 全模态统一模型成为端到端生成新方向:一个模型同时理解文本、图像、视频、声音并输出双声道音视频。
- 视频生成进入“价格战+开源”阶段:MiniMax以低于主流模型三分之一的价格和开放权重策略切入市场。
- 商业应用示例:广告素材、电商展示、游戏过场内容等可借助统一模型直接生成带原生声音的视频。
原始材料
- 英文标题:MiniMax Releases Full-Modal Model H3, Unifying Understanding and Generation of Audio/Video, to Be Open-Sourced(非官方译名,待核实)
- 英文关键词:MiniMax; H3; full-modal model; multimodal generation; video generation; open-source
- 原始来源:腾讯研究院AI速递 20260803
- URL:https://m.sohu.com/a/1057954093_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4