知识卡片:Kimi K3:开放前沿智能
一句话结论
Kimi K3 是一个拥有 2.8T 总参数(104B 激活参数)的 MoE 大语言模型,在长时编码、智能体、知识、推理和视觉任务上达到前沿水平,但整体性能仍落后于最强闭源模型(Claude Fable 5、GPT-5.6 Sol);其权重已开源。
事件概述
Kimi K3 是 Moonshot AI 发布的新一代基础模型,采用混合专家架构(Mixture-of-Experts),包含 2.8T 总参数,每 token 激活约 104B 参数。模型原生支持视觉,上下文窗口达 100 万 token。核心创新包括 Kimi Delta Attention 和 Attention Residuals(改善序列长度和模型深度的信息流)、Stable LatentMoE(每 token 激活 896 个路由专家中的 16 个),以及改进的训练和数据配方。后训练阶段覆盖通用、智能体和编程领域的强化学习,支持多推理努力层级,实现组合泛化和稳健的长时执行。基础设施方面实现了算法-系统协同设计、完美平衡的专家并行训练、百万 token 智能体强化学习(含持久 rollout 和沙箱状态)以及部署创新。Kimi K3 权重已完整开源。
方法/产品要点
- 架构:2.8T 总参数,104B 激活参数的 MoE;每 token 激活 16/896 个路由专家。
- 注意力机制:Kimi Delta Attention + Attention Residuals,增强跨序列长度和模型深度的信息传递。
- 训练效率:相较于 Kimi K2,整体缩放效率提升约 2.5 倍。
- 后训练:覆盖通用、智能体和编程领域的强化学习;支持多种推理努力层级。
- 上下文窗口:100 万 token。
- 多模态:原生视觉能力。
主要结果或产业意义
- 在长时编码、智能体、知识、推理和视觉任务上达到前沿水平。
- 在测试套件中始终优于其他开放权重模型和大多数闭源模型(待核实具体对比模型列表)。
- 整体性能仍落后于最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol。
- 开源完整权重,有望推动前沿智能的部署和社区研究。
为什么重要
Kimi K3 是目前参数量最大的开源 MoE 模型之一,其 2.8T 总参数和 100 万 token 上下文窗口体现了开源模型在规模上的极致探索。通过在注意力机制、MoE 路由和训练基础设施上的系统性创新,它缩小了与顶级闭源模型的差距,同时为学术界和工业界提供了可复现的研究基座。相较于已有相关卡片(如知识蒸馏范式),Kimi K3 的增量信息在于展示了在 2.8T 规模下如何通过算法-系统协同设计实现高效训练与部署,以及开源社区首次获得如此量级的前沿模型权重。
局限与不确定性
- 未公开与 Claude Fable 5、GPT-5.6 Sol 之间的具体性能差距数值。
- 训练数据组成、计算预算、训练时长等细节未在摘要中提供。
- 视觉能力的原生集成方式及多模态基准表现待进一步验证。
- 100 万 token 上下文窗口的实际有效利用率(如长距离依赖保持)待核实。
可用于图书/PPT/简报的角度
- 开源大模型与闭源大模型的性能鸿沟正在缩小:以 Kimi K3 为例说明 MoE 和规模化训练的最新进展。
- “规模化”与“效率”的平衡:Kimi K3 通过注意力残差、Stable LatentMoE 等手段实现约 2.5 倍缩放效率提升。
- 算法-系统协同设计在大模型基础设施中的关键作用:从训练到部署的完整案例。
原始材料
- 论文标题:Kimi K3: Open Frontier Intelligence
- arXiv 链接:https://arxiv.org/abs/2607.24653v1
- 英文关键词:foundation-model, Mixture-of-Experts, Kimi K3, open-weight, long-context, agentic RL
- 原始来源:arXiv preprint (2607.24653v1)
- 英文标题:Kimi K3: Open Frontier Intelligence