AI消息速览

智谱唐杰谈Scaling:万亿参数是行业走过的弯路

事件日期 2026-08-20 · 产业观察 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-20
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:智谱唐杰谈Scaling:万亿参数是行业走过的弯路

一句话结论

唐杰认为,讨论模型规模不能只看参数量,还要结合训练数据、算力投向与运行条件;行业曾集中追逐万亿参数模型,事后看是“集体走过又折返的弯路”,后训练是当前提升空间最大的“旋钮”。

事件概述或研究问题

智谱首席科学家唐杰在X发文讨论Scaling Law(扩展定律),反思行业对模型参数规模的路径依赖。他指出,模型规模的讨论不能简化为参数数量,需要同时考察训练数据量、算力配置和实际运行条件。行业曾集中投入万亿参数模型,但事后看是“集体走过又折返的弯路”。

方法/产品要点

  • Scaling Law的历史脉络:2020年Kaplan研究推动“参数优先”,2022年Chinchilla提出数据与参数应更均衡。
  • 当前推理成本占比上升,最优方案转向“更小、训练更久”的路线。
  • MoE(混合专家)模型需要区分总参数与激活参数,不能混为一谈。
  • 智谱GLM-5.3仅用一个月扩大长程任务环境与强化学习,提升并非小幅;性能提升主要来自后训练,而非更换预训练基础模型。

主要结果或产业意义

  • GLM-5.3以更小参数规模、更低调用成本实现同档智能,将“智能—成本”帕累托前沿大幅推进,降低前沿能力使用门槛。
  • 唐杰的判断意味着行业正在从“参数军备竞赛”转向“训练策略/后训练优化”的效率竞争。
  • 后训练是当前提升空间最大的旋钮;预训练等仍可继续扩展。

为什么重要

  • 为“Scaling Law是否失效”的讨论提供更细致的视角:规模不是唯一变量,数据、算力、推理成本和后训练机制共同决定最终智能水平。
  • 该观点与GLM-5.3的事实相互印证:基础模型沿用GLM-5.2,仅靠后训练在一个月内实现显著提升,说明大模型性能提升路径正在多元化。
  • 与既有脉络的关系:在OpenRouter等基础设施快速产品化、Epoch AI关注算力扩展趋势之外,本条补充了模型侧“后训练优先级上升”和“万亿参数路径反思”的增量信息。

局限与不确定性

  • 唐杰的表述来自社交媒体发文,非经同行评议的论文,具体实验细节、数据规模和比较基准未在材料中完整披露。
  • “更小、训练更久”的最优方案是否普适,取决于推理成本占比、任务类型和硬件条件,材料未给出量化边界。
  • GLM-5.3性能提升的具体评价指标、对比基线和参数量等细节,待核实,需以智谱官方发布为准。

可用于图书/PPT/简报的角度

  • 用“万亿参数弯路”切入,对比Kaplan(2020)和Chinchilla(2022)的两次范式变化,解释Scaling Law的演进。
  • 以后训练为关键词,说明大模型能力提升从“堆参数”转向“优化训练策略”。
  • 结合GLM-5.3案例,展示“小参数、低调用成本、高智能”的产业趋势。

英文标题

原文未提供(待核实)

英文关键词

Scaling Law; GLM-5.3; trillion parameters; post-training; Chinchilla

原始材料

  • 标题:腾讯研究院AI速递 20260820
  • 来源:搜狐(m.sohu.com)
  • URL:https://m.sohu.com/a/1065075978_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=8