AI消息速览

强化学习之父萨顿:大模型上线后已停止学习

事件日期 2026-08-21 · 产业观察 · 已接受

事件日期2026-08-21
信息日期2026-08-21
入库日期2026-08-21
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:强化学习之父萨顿:大模型上线后已停止学习

  • 英文标题:Sutton: LLMs Have Stopped Learning After Deployment
  • 英文关键词:Sutton; Oak Lab; continual learning; catastrophic forgetting; synthetic data; real-world experience; embodied intelligence

一句话结论

强化学习奠基人萨顿(Sutton)认为,大模型一经上线权重便“焊死”、根本没有真正学习,最多只占智能的四分之一;他反对合成数据路线,主张让智能体在真实经验中持续学习,并希望在五到十年内打造功耗仅20瓦的“持续心智系统”。

事件概述或研究问题

据腾讯研究院AI速递整理,萨顿在创办Oak Lab后直言:大模型上线后权重固定、已停止学习,动物也从不靠监督学习成长。其核心研究问题是:智能系统应如何获得和更新知识?萨顿给出的方向是剔除人类环节,让agent直接在真实经验中持续学习。

方法/产品要点

  • Oak Lab:萨顿创办的实验室(具体定位与产品信息待核实)。
  • 对现状的批评:大模型“权重焊死”,部署后不能通过更新权重吸收新经验。
  • 对合成数据的批评:合成数据是“巨大错误”;现实世界无限复杂,任何模拟器都只是微缩近似。
  • 替代路线:让agent在真实世界经验中持续学习,而非依赖静态数据集或模拟环境。
  • 技术攻关:攻克灾难性遗忘,通过步长优化与“持续反向传播”实现持续学习。
  • 目标系统:五到十年内打造“边行动边进化、功耗仅20瓦”的持续心智系统。

主要结果或产业意义

  • 核心论断:大模型最多只占智能的四分之一;动物从不靠监督学习成长,AI也不应如此。
  • 产业意义:对大模型“预训练+上线固定”的现状提出根本性质疑,强化了持续学习、具身智能和真实世界数据的重要性,可能影响下一代AI架构与机器人自进化路线的设计。

为什么重要

萨顿是强化学习奠基人,其观点代表对当前主流“大模型+合成数据+静态部署”路线的深层反思。该论断提示:智能不止是语言能力,还需要在持续与环境交互中更新自身模型。与既有脉络的关系:本条不同于已有相关卡片中的具体产品/Agent能力更新,而是从强化学习传统出发,指出“上线即停止学习”这一结构性缺陷,增量信息在于把问题从“如何更好地完成指令”转向“如何让系统在部署后继续进化”。

局限与不确定性

  • 材料来自媒体速递摘要,萨顿观点的完整论证和语境未展开。
  • “大模型上线后已停止学习”主要指权重不再更新,但未讨论上下文学习、在线微调等是否算“学习”,边界问题待核实。
  • “步长优化”“持续反向传播”的具体实现细节、当前成熟度待核实。
  • “五到十年”和“20瓦功耗”属于萨顿的个人预测/目标,尚无公开验证。
  • Oak Lab的具体研究布局与产品形态待核实。

可用于图书/PPT/简报的角度

  • 路线之争:静态大模型 vs. 持续学习,AI的下一个主战场。
  • 从“更大算力”到“持续在线”:20瓦持续心智系统的启示。
  • 合成数据是“巨大错误”?一位强化学习奠基人的反主流观点。
  • “上线即死”与“边活边学”:迈向持续心智的关键技术挑战。

原始材料

  • 腾讯研究院AI速递 20260821 —《强化学习之父萨顿:大模型上线后已停止学习》
  • URL: https://m.sohu.com/a/1065537360_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=7
  • Parent digest: 腾讯研究院AI速递 20260821