知识卡片:月之暗面开源Kimi K3:2.8万亿参数多模态模型
- 英文标题: Kimi K3 Open-Sourced by Moonshot AI: 2.8 Trillion Parameter Multimodal Model
- 英文关键词: Kimi K3, open-source, multimodal, MoE, 2.8 trillion parameters, KDA attention, PerceptionBench
- 原始来源: https://m.sohu.com/a/1055942829_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
一句话结论
月之暗面开源了全球首个2.8万亿参数级多模态模型Kimi K3(激活1040亿参数),综合能力超越Opus 4.8和GPT-5.5,但官方承认仍落后于最强闭源模型;其核心架构采用KDA线性注意力+NoPE+跨层注意力残差+896专家MoE,训练效率较前代K2提升约2.5倍,配套的MoonEP并行方案与PerceptionBench基准均已开源。
事件概述
2026年7月(据腾讯研究院AI速递报道),月之暗面正式开源Kimi K3模型。这是继此前Kimi K2之后又一款大规模开源模型,总参数量达到2.8万亿,激活参数1040亿,支持百万token上下文窗口和原生视觉能力。后训练阶段采用SFT、分类强化学习与多教师蒸馏,并配套了自主开发的分布式并行方案MoonEP和评估基准PerceptionBench,这些组件均已开源。
方法/产品要点
- 总参数量:2.8万亿(激活1040亿)
- 上下文长度:支持百万token
- 模态支持:原生视觉(多模态)
- 架构创新:
- KDA线性注意力机制(结合NoPE,即无位置编码)
- 跨层注意力残差连接
- 896专家的混合专家(MoE)架构
- 训练效率:相比K2提升约2.5倍(待核实具体度量指标)
- 后训练技术:监督微调(SFT)、分类强化学习、多教师蒸馏
- 配套开源:MoonEP并行方案(优化MoE部署)、PerceptionBench评测基准
主要结果或产业意义
- 基准表现:综合能力超越Opus 4.8和GPT-5.5(两项均为闭源模型),但仍落后于“最强闭源模型”(材料未指名具体模型,待核实)。
- 开源策略:模型权重、并行方案、评测基准全部开源,延续月之暗面对开源社区的承诺。
- 产业意义:将3万亿参数级模型的开源门槛进一步降低,为学术研究和小型团队提供可复现的大规模训练与推理方案;KDA线性注意力架构对长上下文场景具有潜在工程优势。
为什么重要
本条知识卡片是对已有相关卡片“Kimi K3——全球首个开源2.8万亿参数多模态模型”的补充与更新。已有卡片侧重发布事件、竞技场排名与API价格对比,本条卡片额外提供了:
- 架构细节:KDA线性注意力+NoPE+跨层注意力残差+896专家MoE
- 训练效率量化:较K2提升约2.5倍(之前未提及)
- 后训练方法细节:SFT、分类强化学习、多教师蒸馏
- 配套开源组件:MoonEP并行方案和PerceptionBench评测基准
- 竞品超越对象:明确提到超越Opus 4.8和GPT-5.5,同时承认落后于最强闭源模型
这些信息有助于理解Kimi K3的技术路线和开源生态价值。
局限与不确定性
- 材料未提供具体评测榜单的名称和得分,只笼统称“综合能力超越Opus 4.8、GPT-5.5”,实际效果需参考第三方基准复现。
- “训练效率较K2提升约2.5倍”的具体衡量标准(如吞吐量、算力消耗、时间等)未说明,待核实。
- 承认仍落后于“最强闭源模型”,但未指明是哪个模型(可能是Claude Fable 5、GPT-6等),缺乏对比细节。
- 开源许可协议未明确(是否为商用友好许可),待核实。
可用于图书/PPT/简报的角度
- 技术突破:线性注意力+NoPE替代传统Transformer注意力,降低长序列计算复杂度;896专家MoE的稀疏激活策略。
- 开源生态:月之暗面如何通过“开源顶配模型+配套工具”吸引开发者,形成从训练到推理的一站式开源方案。
- 竞争格局:Kimi K3在开源模型与闭源模型之间的位置——性能超越部分闭源模型但未超越最强,体现开源模型追赶闭源模型的阶段性成果。
- 工程实践:MoonEP并行方案针对MoE分布式训练与推理的优化思路,可作为大规模模型部署案例。
原始材料
- 来源标题:腾讯研究院AI速递 20260729
- 相关段落(第五点):
五、月之暗面开源Kimi K3,2.8万亿参数多模态模型 1.月之暗面开源Kimi K3,总参数2.8万亿、激活1040亿,支持百万token上下文与原生视觉,综合能力超越Opus 4.8、GPT-5.5,仍落后于最强闭源模型; 2.架构采用KDA线性注意力结合NoPE、跨层注意力残差及896专家的MoE,训练效率较K2提升约2.5倍; 3.后训练经SFT、分类强化学习与多教师蒸馏,并配套MoonEP并行方案与PerceptionBench评测基准,均已开源。
- 全文URL:同上原始来源