知识卡片:唐杰预告GLM史诗级升级,IndexCache入选COLM
一句话结论
智谱首席科学家唐杰通过引用被COLM接收的IndexCache论文,暗示GLM将迎来“史诗级Plus”升级;IndexCache通过复用相邻层的top-k索引,可在30B模型上削减75%索引计算,首token速度提升1.82倍,该技术已在GLM-5.2的IndexShare中落地。
事件概述
2025年7月,智谱首席科学家唐杰回应外界关于GLM“史诗级Plus”升级的预告,其引用的IndexCache论文于2025年3月上线arXiv,7月被顶级会议COLM接收,引发业界对GLM新模型(推测为GLM-6或类似版本)的猜测。同时,智谱已落地1GW国产算力中心并收购AI Infra公司中科加禾,补全从芯片到模型的全链路能力。
方法/产品要点
- 核心观察:在长上下文推理中,大型语言模型相邻层的top-k索引存在70%至100%的重合。
- 技术方案:IndexCache仅让少数层(如首层或稀疏层)计算完整的索引(如注意力选中的top-k键值对),后续层直接复用前一层已计算的索引,从而避免重复计算。
- 性能收益:对于30B参数的模型,最多可砍掉75%的索引计算;首token生成速度提升1.82倍。
- 落地情况:该思路已在智谱GLM-5.2的IndexShare功能中实现。此外,智谱近期建成1GW国产算力中心,并收购AI Infra公司中科加禾(待核实具体收购金额与时间),形成芯片→训练→推理的闭环。
主要结果或产业意义
- IndexCache被COLM(计算语言学领域顶会)接收,表明学术界对该高效长上下文推理方案的认可。
- 技术已从论文走向产品(GLM-5.2 IndexShare),且智谱同步布局算力基础设施与底层软件栈,增强了国产大模型在长上下文场景下的实用性和竞争壁垒。
- 该方案直接降低了长上下文任务的推理延迟与计算成本,对需要处理超长文档、代码库或对话历史的应用(如法律、科研、企业知识库)具有实际价值。
为什么重要
- 与已有的大模型加速方案(如稀疏注意力、KV缓存压缩)不同,IndexCache利用层间索引高重合这一新颖观察,实现了“少计算、多复用”的极简优化,无需改变模型结构即可获得约2倍首token加速。
- 结合智谱在算力和Infra上的投入,表明智谱正从单一模型厂商向全栈AI基础设施服务商转型,对国内AI产业链自主可控有标杆意义。
局限与不确定性
- “史诗级Plus”的具体升级内容(如模型规模、新能力、发布时间)未从材料中确认,需等待智谱官方发布。
- IndexCache在更长序列(如>128K token)下的性能衰减边界尚不明确;论文仅提及30B模型测试,对其他规模模型的普适性需进一步验证。
- 1GW算力中心的实际投产时间、利用率及与中科加禾整合后的协同效果待核实。
可用于图书/PPT/简报的角度
- AI加速新思路:可放入“大模型推理优化”章节,与前序的FlashAttention、PagedAttention等技术对比,突出IndexCache“层间索引复用”的独特视角。
- 中国大模型全链路发展案例:作为智谱“模型+算力+Infra”一体化的典型案例,展示国产大模型如何应对算力瓶颈与推理成本问题。
- 顶会论文到产品落地:以IndexCache/IndexShare为例,说明学术前沿成果如何快速转化为可商用功能,适合“产学研结合”主题。
原始材料
- 来源:腾讯研究院AI速递 20260723,搜狐转载。URL: https://m.sohu.com/a/1053558570_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
- 英文标题:GLM Epic Upgrade Teased, IndexCache Accepted by COLM
- 英文关键词:GLM, IndexCache, COLM, Long-Context Inference, Zhihu