知识卡片:黑森林实验室发布多模态模型FLUX 3,Dev版将开源
一句话结论
Black Forest Labs 发布 FLUX 3,从专用图像模型进化为统一处理图像、视频、音频并具备动作预测能力的多模态模型,其视频生成能力在初评中显著领先多个竞品,且 Dev 版将开源。
事件概述
Black Forest Labs 于 2026 年 7 月 27 日左右发布 FLUX 3,这是其从图像生成模型向多模态模型的重大升级。新模型基于 Self-Flow 方法构建,可统一处理图像、视频、音频,并原生集成动作预测能力。公司估值达到 32.5 亿美元。
方法/产品要点
- 架构基础:基于 Self-Flow 方法构建,实现多模态统一处理(图像、视频、音频、动作预测)。
- 视频生成能力:单次可生成 720p 分辨率、最长 20 秒的视频,且输出时自带原生音频。
- 动作预测集成:原生支持动作预测,与机器人公司 mimic 合作开发了 FLUX-mimic。
- 开源计划:未来数月内分阶段开放,其中 FLUX 3 Dev 版本将开源。
主要结果或产业意义
- 初评偏好率:在对阵 Seedance 2.0 时领先 52%,对阵 Luma Ray 3.2 时高达 93%,表明视频生成质量受用户偏好显著。
- 估值:公司估值达 32.5 亿美元,反映了资本市场对多模态生成式 AI 方向的信心。
- 行业定位:从纯图像模型进化为统一多模态模型,尤其是在视频中集成原生音频和动作预测,拓展了生成式 AI 在影视、机器人等领域的应用边界。
为什么重要
- 该模型首次将图像、视频、音频与动作预测整合于单一框架,可能加速具身智能和内容创作工具的融合。
- Dev 版开源有助于推动社区研究和二次开发,降低多模态模型的使用门槛。
局限与不确定性
- 初评数据仅为偏好率对比,缺乏客观质量指标和大量第三方复现验证。
- 动作预测具体能力、与真实机器人系统的集成效果尚未披露详细技术细节。
- 开源范围(FLUX 3 Dev 的具体功能开放程度)待确认;最终商用版本的定价和授权方式待核实。
可用于图书/PPT/简报的角度
- 案例:生成式 AI 从“模型”向“平台”演进——FLUX 3 如何通过多模态统一和动作预测横跨内容创造与机器人领域。
- 对比:FLUX 3 相比 Luma Ray 3.2 的高偏好率(93%),可说明视频生成赛道竞争格局。
- 开源 vs 闭源:Black Forest Labs 选择开源 Dev 版本,与闭源巨头形成对比,可结合黄仁勋发公开信力挺开源的背景。
原始材料
- URL: https://m.sohu.com/a/1055048777_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=5
- 英文标题: Black Forest Labs releases multimodal model FLUX 3, Dev version to be open-sourced
- 英文关键词: FLUX 3; multimodal AI; video generation; Self-Flow; open source; Black Forest Labs
- 来源: 腾讯研究院AI速递 20260727(搜狐号)