AI消息速览

MiniMax发布全模态模型H3,统一理解生成音视频并将开源

事件日期 2026-08-03 · 产业观察 · 已接受

事件日期2026-08-03
信息日期2026-08-03
入库日期2026-08-03
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:MiniMax发布全模态模型H3,统一理解生成音视频并将开源

一句话结论

MiniMax发布通用全模态生成模型H3,支持文本、图像、视频、声音的统一理解,可输出原生双声道音视频;最高支持15秒2K分辨率,2K每秒价格不到主流模型三分之一,并将在未来几天开放模型权重。

事件概述

2026年8月3日腾讯研究院AI速递披露,MiniMax发布通用全模态生成模型H3。该模型强调“任务统一泛化”,试图打破模态与功能边界,覆盖文本、图像、视频、声音的理解与生成,并面向广告、电商、游戏等商业场景。

方法/产品要点

  • 全模态统一理解:支持文本、图像、视频、声音的联合输入理解。
  • 原生双声道生成:可输出模型直接生成的双声道音视频,而非后期配音合成。
  • 视频规格:最高支持15秒、2K分辨率。
  • 定价策略:2K分辨率每秒价格不到主流模型的三分之一。
  • 开源计划:未来几天将开放模型权重。

主要结果或产业意义

  • H3以单一模型统一“理解”和“生成”,可能减少以往多模态任务中串联多个模型的成本与复杂度。
  • 低价与开源权重相结合,可能对AI视频生成市场的定价和生态竞争产生直接冲击。
  • 在广告、电商、游戏等场景中,原生双声道音视频输出可缩短内容制作流程。

为什么重要

当前视频生成领域多聚焦于“文本/图像到视频”的单项生成能力,H3强调全模态统一理解与生成,并将“原生双声道”作为产品特性,意味着音视频同步生成而非后期配音。相较于已有的材料发现、机器人、3D生成等卡片内容,本条是生成式大模型在视频/多模态赛道上的新进展,增量信息集中在统一全模态架构、低价2K视频生成和即将开源权重三点。

局限与不确定性

  • 材料为速递条目,未提供H3的模型架构、参数量、训练数据、评测基准等细节。
  • “2K每秒价格不到主流模型三分之一”中的“主流模型”具体指哪些模型、如何计价,待核实。
  • “未来几天将开放模型权重”尚未兑现,具体开源协议、是否可商用待核实。
  • 原生双声道音视频的实际质量、多模态理解上限及商业落地效果,有待第三方评测验证。
  • 材料未说明该模型是否支持中文、上下文长度、推理速度等信息。

可用于图书/PPT/简报的角度

  • 全模态统一模型成为端到端生成新方向:一个模型同时理解文本、图像、视频、声音并输出双声道音视频。
  • 视频生成进入“价格战+开源”阶段:MiniMax以低于主流模型三分之一的价格和开放权重策略切入市场。
  • 商业应用示例:广告素材、电商展示、游戏过场内容等可借助统一模型直接生成带原生声音的视频。

原始材料

  • 英文标题:MiniMax Releases Full-Modal Model H3, Unifying Understanding and Generation of Audio/Video, to Be Open-Sourced(非官方译名,待核实)
  • 英文关键词:MiniMax; H3; full-modal model; multimodal generation; video generation; open-source
  • 原始来源:腾讯研究院AI速递 20260803
  • URL:https://m.sohu.com/a/1057954093_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4