69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体
69岁正是“创”的年纪!
强化学习奠基人、2024年图灵奖得主
Richard Sutton
Oak Lab

Richard Sutton绝对称得上现代强化学习的开山鼻祖。他本科在斯坦福攻读心理学,博士师从强化学习先驱
Andrew Barto
Da vid Silver
Doina Precup
Michael Bowling
Khurram Ja ved

从推文来看,Sutton这次单干的原因很直接:他认为当前的深度学习方法薄弱、低效,需要的不是修修补补,而是全新的基础思想与彻底重构。在他看来,现有AI路线已经很难支撑通用智能的进一步突破。而Oak Lab的终极目标是:
搭建万亿参数规模,可以实时学习、实时规划,整机功耗仅20瓦的智能体。
和卡神分手
和卡神分手
要理解Sutton为什么走,得先说清楚他从哪儿走的。
Keen Technologies的创始人John Carmack,是《毁灭战士》和《雷神之锤》的缔造者、Oculus前CTO,程序员圈子里公认的传奇“卡神”。2022年他从Meta离职后全力投入AI创业,方向也是强化学习。

2023年9月,Sutton选择加入Keen,起因是谷歌DeepMind关闭了他在加拿大与Edmonton共建的实验室。当时两人联手,堪称梦幻组合:一个是底层系统工程的传奇,一个是强化学习理论的奠基者,计划在2030年前打造出具备“AGI生命迹象”的原型系统。现在,合作不到三年,Sutton选择抽身离开。但他在推文里特意把第一句话留给了Carmack:
关于John Carmack和Keen Technologies,我怎么夸都不为过。
言下之意就是:走不是因为Carmack不好,而是大家对怎么走到终点这件事产生了分歧。在Sutton眼中,当下深度学习那套发展路线行不通——模型不需要无休止地迭代微调,整个行业亟需范式层面的碘伏与重建。
Oak Lab要做什么
Oak Lab要做什么
Sutton这次创业押注的核心,可以概括为一句话:
智能来自运行时持续产生的经验。
现在主流大模型的工作模式,基本是耗费数月、投入巨额成本,依托海量文本数据完成离线预训练;训练结束后模型参数基本固定,随后上线使用。但即便每天和亿万用户对话,绝大部分交流内容也无法转化为自身的新能力。模型只能复用训练阶段学到的知识,或是在对话上下文里短暂记住信息,却没法像人类和动物一样,在持续感知外界的过程中更新自我。
Oak Lab要打造的智能体不一样。它要一边感知周遭环境、做出对应行动,再依据结果调整自身行为。只要产生新经历,学习过程就同步进行,不用间隔很久再集中训练。就像Sutton自己说的:
AI运行的每时每刻,都应当是学习的过程。

目前,Oak Lab已经公布了自己的核心研究路线,围绕一套名叫
OaK
举个例子,机器人第一次去厨房接水,整套流程包含辨认房间、躲避障碍物、拿起水杯、打开水龙头等一连串动作。传统AI会把全部步骤当作单次决策任务;OaK架构则会让智能体从实操中拆解出“走到厨房”“拿起杯子”“接水”等高层级技能。后续遇到相似目标时,智能体直接调取已有技能,再结合当下环境灵活调整方案。这种沿着时间维度精简过往经历的方式叫作时间抽象,让AI像人类一样,把一连串零散动作沉淀成成熟技能,依靠技能组合完成更复杂的任务。

除此之外,OaK架构还有一个和当下深度学习截然不同的设计目标:
学习阶段既不储存历史数据,也不会回放过往经验。
当然,目前这还只是构想。Oak Lab背后还有一块理论基石,来自Sutton和Ja ved共同提出的
大世界假说
从“苦涩的教训”走到创业
从“苦涩的教训”走到创业
熟悉Sutton的人,对上面这套观点应该不会感到意外。2019年,他写下了AI领域广为流传的短文
《苦涩的教训》(The Bitter Lesson)
能够随计算规模扩展的通用学习与搜索方法,长期来看终将胜过依赖人类手工知识的系统。

到了大模型时代,这条路线似乎得到了极强的验证——更大模型、更多数据、更强算力,推动AI能力一路飙升。但Sutton对今天的主流深度学习依然不满意。在他看来,当前系统仍高度依赖人类生产、筛选并整理过的数据。模型学习的内容,主要是人类过去已经写下、拍下或标注过的东西。真正的智能体,需要通过自身行动产生新经验,并利用这些经验追求长期目标。
这也解释了他为何从“苦涩的教训”进一步走向了“经验时代”。2025年,他与AlphaGo核心人物Da vid Silver联合提出,AI将逐步从依赖人类数据转向依靠智能体与环境互动产生的经验。Oak Lab,正是这套研究主张的一次创业化落地。
四十年前,Sutton在博士论文里写下“temporal credit assignment in reinforcement learning”的时候,强化学习还是一门冷板凳学问。四十年后,整个世界都在追逐大模型的商业化浪潮,他仍然在追问同一个问题——智能到底是怎么来的?
One More Thing
One More Thing
老爷子创业后的第一站,是
上海WAIC

-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |