知识卡片:智谱开源GLM-5.3-Flash,定价为Opus 4.8的1/40
英文标题: GLM-5.3-Flash: Zhipu AI Open-Sources a Multimodal Model Priced at 1/40 of Opus 4.8
英文关键词: GLM-5.3-Flash; Zhipu AI; Open Source; Multimodal; Sparse and Linear Attention; Domestic AI Chips
原始来源: 腾讯研究院AI速递 20260827,https://m.sohu.com/a/1068024885_455313
一句话结论
智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,AA综合智能指数为57分,与Claude Opus 4.8持平;定价仅为GLM-5.3的1/10,限时低至Claude Opus 4.8的1/40,并首次部署在大规模国产芯片集群上。
事件概述
根据腾讯研究院AI速递20260827的报道,智谱上线并开源GLM-5.3-Flash(320B-A18B),定位为GLM-5系列首个原生多模态模型。报道同时给出该模型在AA综合智能指数上的得分为57分,并介绍了其架构、定价与国产芯片部署情况。
方法/产品要点
- 架构:总参数与GLM-4.5相当,但激活参数与层数近乎减半;是首个采用稀疏与线性注意力混合架构的开源前沿模型。
- 多模态:原生多模态,具备视觉编码能力,可自主观察渲染并迭代。
- 部署:服务首次跑在大规模国产芯片集群上,端到端性能较基线提升3倍,单token成本与英伟达GPU相当。
- 定价:仅为GLM-5.3定价的1/10,限时低至Claude Opus 4.8定价的1/40。
主要结果或产业意义
- AA综合智能指数57分,与Claude Opus 4.8持平,表明其在综合智能评测上达到闭源旗舰模型水平。
- 开源叠加限时低价(Opus 4.8的1/40),可能显著降低前沿模型的使用门槛。
- 模型服务在大规模国产芯片集群上跑通,且单token成本与英伟达GPU相当,对国产算力生态具有示范意义。
为什么重要
GLM-5.3-Flash将稀疏与线性注意力混合架构引入开源前沿模型,可能在保持智能水平的同时降低激活参数和层数,从而降低推理成本。以Opus 4.8的1/40价格提供接近旗舰的智能水平,可能加剧AI模型定价竞争。同时,国产芯片集群承载前沿模型服务,为AI算力供应链多元化提供了新选项。
局限与不确定性
- 原文未详细说明AA综合智能指数的评测机构、方法和维度,待核实。
- “端到端性能较基线提升3倍”中的“基线”未明确,待核实。
- “限时低至Opus 4.8的1/40”的具体价格与活动时限原文未列出,待核实。
- 模型命名中的“A18B”是否表示激活参数量为18B,原文未解释,待核实。
- “可自主观察渲染并迭代”的具体机制和适用场景未展开,待核实。
- “首次跑在大规模国产芯片集群上”中的“首次”所指范围(智谱首次/行业首次)未明确,待核实。
可用于图书/PPT/简报的角度
- 开源模型如何用架构创新打破“性能-成本”权衡?
- 前沿模型价格下探至闭源旗舰的1/40:AI定价权争夺的开端。
- 国产芯片集群从“能跑”到“跑前沿模型”:算力自主的里程碑?
- 从GLM-5.3-Flash看多模态模型的“原生”设计趋势。
与既有脉络的关系
本条与已有的NIST、Epoch AI、OpenRouter相关卡片没有直接延续,属于新增的AI模型层产业动态。其增量信息在于:智谱通过混合注意力架构和国产芯片部署,展示了开源模型在综合智能评分接近顶尖闭源模型的同时实现激进定价。
原始材料
- 标题:腾讯研究院AI速递 20260827
- URL:https://m.sohu.com/a/1068024885_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=3
- 抓取描述:2.该芯片从设计到流片仅用9个月,远快于行业18至24个月,借助Codex等AI生成kernel加速芯片设计全流程,计划2026年底以极小规模部署;2.定价仅为GLM-5.3的1/10、限时低至Opus …