知识卡片:强化学习之父萨顿:大模型上线后已停止学习
- 英文标题:Sutton: LLMs Have Stopped Learning After Deployment
- 英文关键词:Sutton; Oak Lab; continual learning; catastrophic forgetting; synthetic data; real-world experience; embodied intelligence
一句话结论
强化学习奠基人萨顿(Sutton)认为,大模型一经上线权重便“焊死”、根本没有真正学习,最多只占智能的四分之一;他反对合成数据路线,主张让智能体在真实经验中持续学习,并希望在五到十年内打造功耗仅20瓦的“持续心智系统”。
事件概述或研究问题
据腾讯研究院AI速递整理,萨顿在创办Oak Lab后直言:大模型上线后权重固定、已停止学习,动物也从不靠监督学习成长。其核心研究问题是:智能系统应如何获得和更新知识?萨顿给出的方向是剔除人类环节,让agent直接在真实经验中持续学习。
方法/产品要点
- Oak Lab:萨顿创办的实验室(具体定位与产品信息待核实)。
- 对现状的批评:大模型“权重焊死”,部署后不能通过更新权重吸收新经验。
- 对合成数据的批评:合成数据是“巨大错误”;现实世界无限复杂,任何模拟器都只是微缩近似。
- 替代路线:让agent在真实世界经验中持续学习,而非依赖静态数据集或模拟环境。
- 技术攻关:攻克灾难性遗忘,通过步长优化与“持续反向传播”实现持续学习。
- 目标系统:五到十年内打造“边行动边进化、功耗仅20瓦”的持续心智系统。
主要结果或产业意义
- 核心论断:大模型最多只占智能的四分之一;动物从不靠监督学习成长,AI也不应如此。
- 产业意义:对大模型“预训练+上线固定”的现状提出根本性质疑,强化了持续学习、具身智能和真实世界数据的重要性,可能影响下一代AI架构与机器人自进化路线的设计。
为什么重要
萨顿是强化学习奠基人,其观点代表对当前主流“大模型+合成数据+静态部署”路线的深层反思。该论断提示:智能不止是语言能力,还需要在持续与环境交互中更新自身模型。与既有脉络的关系:本条不同于已有相关卡片中的具体产品/Agent能力更新,而是从强化学习传统出发,指出“上线即停止学习”这一结构性缺陷,增量信息在于把问题从“如何更好地完成指令”转向“如何让系统在部署后继续进化”。
局限与不确定性
- 材料来自媒体速递摘要,萨顿观点的完整论证和语境未展开。
- “大模型上线后已停止学习”主要指权重不再更新,但未讨论上下文学习、在线微调等是否算“学习”,边界问题待核实。
- “步长优化”“持续反向传播”的具体实现细节、当前成熟度待核实。
- “五到十年”和“20瓦功耗”属于萨顿的个人预测/目标,尚无公开验证。
- Oak Lab的具体研究布局与产品形态待核实。
可用于图书/PPT/简报的角度
- 路线之争:静态大模型 vs. 持续学习,AI的下一个主战场。
- 从“更大算力”到“持续在线”:20瓦持续心智系统的启示。
- 合成数据是“巨大错误”?一位强化学习奠基人的反主流观点。
- “上线即死”与“边活边学”:迈向持续心智的关键技术挑战。
原始材料
- 腾讯研究院AI速递 20260821 —《强化学习之父萨顿:大模型上线后已停止学习》
- URL: https://m.sohu.com/a/1065537360_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=7
- Parent digest: 腾讯研究院AI速递 20260821