知识卡片:智谱唐杰谈Scaling:万亿参数是行业走过的弯路
一句话结论
唐杰认为,讨论模型规模不能只看参数量,还要结合训练数据、算力投向与运行条件;行业曾集中追逐万亿参数模型,事后看是“集体走过又折返的弯路”,后训练是当前提升空间最大的“旋钮”。
事件概述或研究问题
智谱首席科学家唐杰在X发文讨论Scaling Law(扩展定律),反思行业对模型参数规模的路径依赖。他指出,模型规模的讨论不能简化为参数数量,需要同时考察训练数据量、算力配置和实际运行条件。行业曾集中投入万亿参数模型,但事后看是“集体走过又折返的弯路”。
方法/产品要点
- Scaling Law的历史脉络:2020年Kaplan研究推动“参数优先”,2022年Chinchilla提出数据与参数应更均衡。
- 当前推理成本占比上升,最优方案转向“更小、训练更久”的路线。
- MoE(混合专家)模型需要区分总参数与激活参数,不能混为一谈。
- 智谱GLM-5.3仅用一个月扩大长程任务环境与强化学习,提升并非小幅;性能提升主要来自后训练,而非更换预训练基础模型。
主要结果或产业意义
- GLM-5.3以更小参数规模、更低调用成本实现同档智能,将“智能—成本”帕累托前沿大幅推进,降低前沿能力使用门槛。
- 唐杰的判断意味着行业正在从“参数军备竞赛”转向“训练策略/后训练优化”的效率竞争。
- 后训练是当前提升空间最大的旋钮;预训练等仍可继续扩展。
为什么重要
- 为“Scaling Law是否失效”的讨论提供更细致的视角:规模不是唯一变量,数据、算力、推理成本和后训练机制共同决定最终智能水平。
- 该观点与GLM-5.3的事实相互印证:基础模型沿用GLM-5.2,仅靠后训练在一个月内实现显著提升,说明大模型性能提升路径正在多元化。
- 与既有脉络的关系:在OpenRouter等基础设施快速产品化、Epoch AI关注算力扩展趋势之外,本条补充了模型侧“后训练优先级上升”和“万亿参数路径反思”的增量信息。
局限与不确定性
- 唐杰的表述来自社交媒体发文,非经同行评议的论文,具体实验细节、数据规模和比较基准未在材料中完整披露。
- “更小、训练更久”的最优方案是否普适,取决于推理成本占比、任务类型和硬件条件,材料未给出量化边界。
- GLM-5.3性能提升的具体评价指标、对比基线和参数量等细节,待核实,需以智谱官方发布为准。
可用于图书/PPT/简报的角度
- 用“万亿参数弯路”切入,对比Kaplan(2020)和Chinchilla(2022)的两次范式变化,解释Scaling Law的演进。
- 以后训练为关键词,说明大模型能力提升从“堆参数”转向“优化训练策略”。
- 结合GLM-5.3案例,展示“小参数、低调用成本、高智能”的产业趋势。
英文标题
原文未提供(待核实)
英文关键词
Scaling Law; GLM-5.3; trillion parameters; post-training; Chinchilla
原始材料
- 标题:腾讯研究院AI速递 20260820
- 来源:搜狐(m.sohu.com)
- URL:https://m.sohu.com/a/1065075978_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=8