知识卡片:高效推理服务MiniMax-M3:解锁100万Token上下文与多模态
一句话结论
Together AI通过KV-Block-Major稀疏注意力、分页MSA解码、优化索引评分内核及基于Rust的多模态预处理网关等工程优化,将MiniMax-M3推理吞吐量在不同并发级别上提升了81%–125%,并成为该模型的优选云推理平台。
事件概述/研究问题
MiniMax发布了新一代旗舰模型M3,具备100万Token上下文窗口、原生多模态(图像、视频)和稀疏注意力架构(MSA)。与上一代相比,M3在稀疏注意力计算、更大KV缓存管理、多模态处理等方面带来更高工程挑战。Together AI与MiniMax合作,致力于高效生产级推理服务。
方法/产品要点
- KV-Block-Major稀疏注意力:将计算顺序从“按查询循环”改为“按KV块循环”,减少HBM到SRAM的KV移动次数,提高算术强度。
- 分页MSA解码:构建基于选中块的页表,将KV组维度展平为批次维度,利用现有支持GQA的注意力内核,无需重写全稀疏内核,解码吞吐提升5%。
- 解码索引评分内核优化:使用AB-swapped HMMA布局,将128-token的KV块作为MMA的M维度,通过异步拷贝、HMMA点积和逐块归约,高效计算每个块的得分并选出Top-K块。
- 基于Rust的多模态预处理网关(SMG):在GPU之外完成图像/视频的下载、解码、帧采样、缩放、归一化、patch化,将预处理结果通过gRPC传给推理引擎,释放GPU资源。
主要结果或产业意义
- 在B200上、8并发、代理型业务流量(60K前缀缓存)下,吞吐量提升81%–125%。
- MSA相比前代架构,预填充阶段速度提升超9倍,解码阶段超15倍。
- Together AI将成为MiniMax M3开放权重后的开发者API端点,验证了其在长上下文、复杂多模态模型推理领域的工程能力。
为什么重要
M3在一个模型中融合了前沿编码性能、智能体工作流支持和原生多模态推理,同时经济高效地支持百万级上下文。Together AI的优化使这类模型能够从研究走向生产部署,解决了稀疏注意力、KV缓存管理、多模态预处理等实际系统难题。
局限与不确定性
- 稀疏注意力架构引入了更多小内核(如Top-K块选择、q-kv重映射),仍有内核融合优化空间(正在由Kernel Agent团队开发)。
- 未来计划实现K-index与KV缓存的CPU缓存卸载,按需加载KV缓存,但当前尚未部署。
- 文中性能数据基于特定硬件(B200)和业务流量模式(代理型、60K前缀缓存),其他场景下结果可能不同。
可用于图书/PPT/简报的角度
- 工程案例:如何通过系统级优化(计算顺序重组、内存访问模式改进、预处理卸载)服务超长上下文多模态模型。
- 关键启示:稀疏注意力虽降低理论计算复杂度,但工程上仍需解决索引、分页、多模态预处理等瓶颈。
- 适合为AI基础设施团队、大模型部署工程师、模型架构研究者提供参考。
原始材料
- 英文标题:Serving MiniMax-M3 for efficient inference: Unlocking 1M-Token Context and Multimodality Without Regrets
- 英文关键词:MiniMax-M3, sparse attention, 1M-token context, multimodality, inference optimization, Together AI, KV-Block-Major, paged attention, Rust multimodal gateway
- 来源:https://www.together.ai/blog/serving-minimax-m3-for-efficient-inference-unlocking-1m-token-context-and-multimodality-without-regrets