知识卡片:强化学习之父Sutton创业成立Oak Lab,另辟LLM路线
英文标题: Reinforcement Learning Pioneer Richard Sutton Founds Oak Lab, Pursuing an Alternative LLM Path
英文关键词: Richard Sutton, Oak Lab, continual learning, intelligent agent, bitter lesson
一句话结论
68岁“强化学习之父”、图灵奖得主Richard Sutton与Khurram Javed离开Keen Technologies,在加拿大创立Oak Lab,主张智能体必须通过试错从自身经验持续学习、实时进化,批评当前大语言模型仅学习人类文本而非经验,部署后即停止学习。
事件概述
2026年7月,Richard Sutton与Khurram Javed共同创立Oak Lab,公司总部位于加拿大。Sutton认为大语言模型(LLM)的核心缺陷在于:它学习的只是人类积累的文本,而非通过与环境交互获得的经验;模型部署后便停止学习,未能真正践行他提出的《苦涩的教训》(The Bitter Lesson)——即智能必须依靠搜索和试错产生新发现。Oak Lab的技术路线源于此前“阿尔伯塔计划”(Alberta Plan),核心是OaK架构,旨在构建能够持续从自身经验中进化的Agent。
方法/产品要点
- OaK架构:从“阿尔伯塔计划”演化而来,核心目标是让智能体在部署后仍能通过与环境交互持续学习、实时进化。
- 与主流LLM路线形成对比:Sutton认为当前LLM路线(预训练+微调+冻结)是静态的,无法像人类一样从后续经验中获取新知识。
- 尚未解决的核心挑战:Sutton本人坦言,灾难性遗忘(catastrophic forgetting)和可塑性丧失(loss of plasticity)仍在OaK架构中存在,尚未找到彻底解决方案。
主要结果或产业意义
- 路线反思:作为强化学习领域的奠基人,Sutton以创业行动公开挑战当前以规模扩展为核心的LLM范式,促使业界重新审视“学习”的定义——是记忆文本还是从行动中试错。
- 领域分化:Sutton的学生David Silver也已另起炉灶,同样押注强化学习路线,表明该方向正在形成独立的研究阵营。
为什么重要
本条信息是对上一轮“强化学习能否超越LLM”讨论的实质性进展。此前业界主要关注Google DeepMind的SIMA 2等Agent产品(见已有相关卡片),而Sutton此次创业直接指向了Agent的核心学习机制,即在无人类标注数据的情况下,能否让智能体通过环境反馈不断成长。这比单纯的“能力整合”(如SIMA 2)更底层、更根本。
局限与不确定性
- 技术瓶颈未突破:灾难性遗忘与可塑性丧失是持续学习领域的长期难题,Sutton团队尚未公布具体解决方案。
- 商业化前景不明:Oak Lab刚刚成立,未发布具体产品或性能评测,也未披露融资信息。
- 与已有Agent产品的可比性:待核实OaK架构是否能在实际任务(如代码、机器人操控)中达到或超越当前LLM-based Agent的表现。
可用于图书/PPT/简报的角度
- 批判角度:作为“苦涩的教训”提出者,Sutton如何用自己创办的公司“打脸”今天的大语言模型,适合在AI发展史或技术批判章节中引用。
- 未来预测:超级智能是否一定要靠试错?Sutton的路线与Scaling Law路线哪条更可能通向AGI?可作为辩论题目。
- 人物群像:图灵奖得主在65岁后创业,与Hinton离开谷歌、LeCun留守Meta的对比,适合科技人物专题。
与既有脉络的关系
本卡片主要补充Sutton创业细节及技术立场,不重复SIMA 2或π0.7中关于“通用Agent”能力已有事实。增量信息为:Sutton对LLM路线“部署即停止学习”的尖锐批评,以及OaK架构与持续学习困境的明确承认。
原始材料
- URL: https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=5
- Parent digest: 腾讯研究院AI速递 20260715
- Parent URL: https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334