首页 > 教程攻略 > ai资讯 >李沐重返母校上海交大,从LLM聊到个人生涯,这里是演讲全文

李沐重返母校上海交大,从LLM聊到个人生涯,这里是演讲全文

来源:互联网 时间:2026-08-24 14:18:45

昨天,李沐回到母校上海交大,做了一场干货满满的分享,主题涵盖LLM的技术现状、未来趋势,以及他个人在不同阶段的职业选择与感悟。以下是机器之心根据B站用户@考拉klkl上传的视频整理的内容(感谢这位同学的录制)。

先说几个核心判断:语言模型目前整体水平可以打到80-85分,音频模型70-80分,视频生成还只有50分左右。至于应用层面,AI离真正变革世界,至少还需要5年时间。

回到演讲本身。李沐开场时说,自己多年没回学校,这次回国想见见本科导师,结果被要求做个报告。本来想只讲语言模型,但考虑到听众背景多样,于是加入了一些个人经历和选择的感悟。

第一部分是技术向的——关于语言模型的现状与未来预测。

语言模型可以拆成三块:算力、数据和算法。本质上,就是把数据通过算力和算法压进模型里,让模型在面对新数据时,能在原有数据中找到相似的东西,然后修改后输出。这就像炼丹——把材料放进丹炉,用丹方炼出来。数据就是找材料,是个体力活;算力是火候,设备越好炼得越好;算法是丹方,每年都在进步,细节把控极重要,就像徒手发射火箭,动手调一调,没调好就炸了。

这一波语言模型和上一波深度学习模型有个大区别:以前是“炼一个丹治一个病”,现在希望炼出来的东西有灵魂,能解决很多问题。这是技术一代代向前推进的结果。

那么,硬件、数据和算法未来几年会发生什么?这里面其实有规律可循,不是跳跃性的。

算力层面:大模型不是特别有性价比的东西

带宽:让芯片靠得更近一些

硬件方面,带宽最重要也最难。现代模型训练很难一台机器搞定所有事,要做分布式训练,瓶颈通常就在带宽。目前一根光纤承载400Gigabits,下一代翻倍到800Gigabits。半年前英伟达发布的GB200系统(已推迟出货),可以把72块卡压缩到一个机架位里。这用到了水冷工艺——水冷可以带走更多热量,算力更密,芯片压得更扁,芯片之间直接用光纤以光速互通。光速看上去很快,但实际上一米距离的延迟,在分布式训练里已经不可接受了。设计机房时,光纤长度差一米就会带来可见的性能影响。

英伟达GB200把GPU放一起,通讯变得更好。可以理解成:以前做多核把单核封装到芯片里,现在多核不够就做多卡,多卡以前分散在房间里,现在要尽量放一起。芯片尺寸早就做不上去了(台积电等面临工艺难题),所以尽量让这些东西靠近些。GPU和CPU之间的PCIe也在翻倍,但会慢一些。

内存:制约模型尺寸的一大瓶颈

内存比算力更重要。模型要压进几百GB的数据,运行时中间变量也很大,需要大内存。现在一个芯片能封装近192GB内存,下一代带宽更高。但这已经被视为瓶颈——芯片面积有限,划给算力和内存后放不下更多。未来几年,一个芯片可能200GB内存就到头了,除非工艺有突破。这意味着模型大小会被限制在一定尺寸,再大效率会极低。内存大小是模型上限的制约,而不是算力。在这一块,英伟达甚至不如AMD和Google的TPU。

算力:长期来看会越来越便宜

搞定带宽和内存后,再看算力。机器学习的好处是可以用4位浮点数,硬件变小,带宽利用率也变低。最近几代优化都来自浮点数精度的降低。但模型做更大时,资源问题就来了——供电。做数据中心时,造电厂的成本可能比付电费还低。一个芯片要耗一千瓦,一千块芯片就是一兆瓦,整个校园都未必用那么多。

算力价格方面,理论上充分竞争市场里,算力翻倍价格不变。但近年英伟达垄断导致价格下不来。短期算力翻倍,价格可能有1.4倍提升;长期竞争激烈后,摩尔定律会发挥作用——算力翻倍,价格不一定变。所以长期看算力会越来越便宜。其他芯片做推理还行,做训练要等几年,英伟达仍处垄断地位。

所以,摩尔定律仍会发挥作用:训练成本会两倍两倍地变便宜。今天训练一个模型,一年后价值减半。大模型不是特别有性价比的东西。想清楚长期能带来什么价值,才能保值。

模型:从语言到多模态

语言模型:100B到500B参数会是主流

每次预训练,无论是OpenAI还是别的模型,基本用10T到50T token。这个数据量差不多了,不会再往更大发展。人类历史数据比这多,但质量上10T到50T就够了。更多数据不一定带来更好提升,清洗后可能回到这个值。模型大小就是100B到500B参数。一线模型大约500B,超过500B不是训练不动,而是做serving很难。谷歌历史上没让500B以上模型上过线,OpenAI也没有(MoE不算,算成稠密模型的话)。所以未来一阵子,受限于内存和数据尺寸,100B到500B会是主流。可以做更大,但用MoE的话,有效大小可能也就500B。

语音模型:延迟更低、信息更丰富

GPT-4o出来后,大家对语音模型兴趣浓厚。以前是ASR转文本,再进语言模型出文本,最后TTS输出语音。现在让原始语音信号直接进去再出来。好处有两点:一是语音包含情绪、语调、方言、背景音乐等大量信息,传统技术做不了,新语音技术能利用文本语言模型的能力发掘这些信息。输出时也能根据输入个性化变换语调情绪。二是延迟更短。以前要1秒,现在可以做到300毫秒,300毫秒最大的好处是可以打断,交互更像真人。还有一个好处是可以通过语言模型对输出做很多控制,比如用文本定制声音。

音乐模型:不是技术问题,而是商业问题

国内音乐生成在商业上做得挺好。技术其实比语音麻烦,但更核心的是版权问题。大公司买版权,小公司光脚不怕穿鞋,直接上。市面上已经很好了,抖音快歌虽然爆款难,但非专业人士听不出问题。音乐是一种表达,任何感觉都可以通过音乐表达。未来很多人会用音乐表达想法和情感,影响力会特别大。这不是技术问题,而是商业问题。

图像模型:生成的图越来越有神韵

图像是AIGC领域做得最早、效果最好的。现在已经能生成100万以上像素的图片。以前文生图风格很假,现在跟真的很接近,还缺一点点灵魂,但这一块说不定很快就有了。

视频模型:尚属早期

Sora出来后大家非常关注视频模型。这还算早期,通用的视频生成非常贵,因为视频数据特别难弄。训练成本可能低于数据处理成本,所以没有特别好的开源模型。生成一张图片容易,但生成一连串连贯的图片并保持一致性很难。

多模态模型:整合不同模态信息

多模态的发展趋势是整合不同类型的信息,尤其是文本,因为文本信息丰富且易获取。可以利用文本上学到的技能泛化到图片、视频、声音。好处有两个:借助强大文本模型进行泛化;通过文本来定制和控制其他模态的输出,比如用简单文本指令控制图片、视频、声音的生成,不再需要专业编程技能。未来用自然语言做交互是常态。

总结:语言模型80-85分,音频70-80分,视频约50分。人机交互会改变。以前点菜是刷刷刷和点点点,能不说就不说。ChatGPT出来后,大家愿意输入长文字去满足细节需求。但输入长文字不如说话方便,语音技术正在进步,未来可能会接受对方用长语音描述事情。这不是简单的“开窗”指令,而是复杂任务。用户习惯改变需要时间。这次技术革命还没出现杀手级应用(killer APP)。回想手机杀手级应用是短视频,五年前很难想象刷几秒视频。这次杀手级APP是什么?上一波顶级AI公司(Character.AI、Inflection、Adept)基本被卖了,只剩Perplexity搜索。等技术成熟,不习惯慢慢过去,杀手级应用会涌现。

应用:AI离变革世界还有很多年

AI本质是辅助人类,提供无限人力资源。应用分三类:

第一类是文科白领——用自然语言跟人、跟世界打交道,包括写文章等。个人助理、客服、文本处理、游戏、舆论、教育领域做得比较好。一个文科白领一小时能完成的事,模型能完成百分之八九十。

第二类是工科白领。AI想取代程序员还早。以前编程要自己找代码示例,现在模型可以自动检索相关代码片段,改改变量名,但它不是真的在写代码。人类一小时能写很多复杂代码,模型还没有取代工科白领一小时干的事,更难的任务更不行。

第三类是蓝领阶级,反而最难。唯一做得好的是自动驾驶——路况相对封闭稳定,十年不变,开车相对简单。虽然无人驾驶还没完全解决,但进步很大。路上车多,每辆车有传感器,采集大量数据优化算法(比如特斯拉)。正常蓝领要做端盘子、运货等事,AI跟物理世界打交道很难。机器人进房间要理解有什么东西,这需要大量数据,但房间内没有传感器,无法采集数据;不可能放很多机器人进去。这是一个鸡生蛋蛋生鸡的问题。除非有技术突破,否则需要很多年。

简单总结:对于文科白领,AI已能完成简单任务,复杂任务需要继续努力。工科白领简单任务还需努力,复杂任务困难。蓝领除了无人驾驶和特定场景(工厂),AI连简单任务都做不了,复杂任务更难。但蓝领是主要劳动力,技术对世界做出巨大变革需要很多年。未来10年、20年,大家都有机会参与。

对应用而言,只要采集到足够多数据,就可以自动化。一个行业能采集很多数据,就能自动化。反过来,如果让模型完成一项任务,先考虑怎么采集很多数据。传统企业会先积累数据,几年后才开始。这是发展规律,急不来。

创业一年半,李沐感悟

从这一年半的创业经历中学到一些更细节的东西。

预训练是工程问题,后训练才是技术问题

第一点:之前大家觉得预训练很重要,比如训练几百B参数的模型。现在看起来,预训练是工程问题,后训练才是技术问题。两年前预训练还是技术问题,现在变成工程问题了。后训练中,高质量数据和改进的算法能极大提升模型效果。高质量数据一定是结构化的,与应用场景高度相关,保证多样性和实用性。算法方面,OpenAI提出了RLHF,但看着有点牵强。这套技术几年内变化很大,但哪个算法好说不出来——每个人用的数据不一样,算法适用场景不同。论文里效果很好,自己用却不行,因为数据不同,目标函数对结构化问题的假设不匹配。没办法规避,就得做研发。

如图,用llama 3 70B微调了一个角色扮演模型(老师、销售等),在base基础上做后训练,微调了V1、V2,V2在角色扮演上优于其他模型。作为创业公司,资金有限。LLAMA团队标注数据花了5000万美金,但数据效果并没多好,Meta也没花太多时间在算法上。做语言模型研究,可以不做预训练,只做后面部分,因为前面变成工程问题,需要很多卡和人力,后面才是算法创新。门槛仍较高,8B和70B情况不同,8B上调的很多在70B上不成立。

垂直模型也需要通用知识

第二个要讲的是垂直模型。为什么要做垂直模型?因为通用模型还是指数问题,通用模型不一定能完成特定任务。比如让OpenAI模型角色扮演,迭代好几代都不行,因为通用维度需要各方面提升,满足要求需要指数级数据和巨大模型。所以要做垂直模型,这是一年前公认的。但花了很多时间发现,这也是伪命题——没有真正的垂直模型,就算很垂直的领域,通用能力也不能差。要在某学科拿第一,别的科目也不能差。

评估很难,但很重要

评估特别难。模型在实际场景中的应用很复杂,简单评估无法衡量好坏。过去一年多大家不停刷新榜单,但实际用起来觉得模型不行,因为评估没到位,没把复杂场景评估进去。很多时候,评估是最重要的事,先做好评估再做别的事。自然语言与模型交互有二义性,很难评价正确性、逻辑性和风格。不想让人评估(昂贵),但用模型评估会有偏差。一个好的评估能解决50%的问题——评估解决了,就能进行优化;评估解决了,就拥有了一些数据。

数据决定模型上限

数据决定了模型上限,算法决定下限。目前离AGI还很远,AGI能做自主学习,目前的模型是填鸭式。Claude 3.5做得不错,不太大的模型却在各种榜单上优于GPT-4,使用体验也不错。交流后发现,他们花很大力气做数据,用了很多年。所以想让模型在某方面特别出色,先准备好相关数据。大家还是用了70-80%时间在数据上。

算力

买GPU、自建机房不会比租GPU便宜太多,因为大头被英伟达吃掉——利润90%。一块卡成本3000美元,卖3万美元,不管谁去买都不打折,是奢侈品。下图为三年费用占比,GPU cost占50%,剩下的再拼意义不大。

自己在Amazon干了7年半出来创业,但不用Amazon服务,太贵。都从小公司买来,他们当年用来挖比特币。自己运营贵一点,是体力活——GPU每天都坏,机房放多伦多,三个人三班倒,坏了就跑过去修。云赚得不多,有20%利润,所以这块差不多。但自建的好处是节省CPU算力、存储和网络带宽,这些方面自建很便宜,云却很贵,因为过去十年没有太大技术变革。比如存一年数据成本等于把硬件买回来,容量还能变10倍。数据量增长很大时,自建有意义。

语言模型本质上还是机器学习模型,换了个架构,只是更大了,带来很多困难。它还是吃数据,评估很重要,很多之前经验能用过来。不一定要神化新技术。困难在于它是之前的100倍大,模型变大就会很难。预训练现在变成因为大导致很多工程问题,算法上探索还不够,需要清楚如何改进算法。

李沐的打卡式人生

如果对AI没那么感兴趣,接下来讲讲从上海交通大学毕业后都干了啥。

真的干了很多乱七八糟的事情,过着“打卡式人生”。论文都是打卡式发。在上海交大待了近七年,香港科技大学两年,CMU五年,伯克利和斯坦福各六个月。也进过大公司:百度两年,Amazon七年。这是第二个创业公司。

这种转来转去是什么体验?去大公司、读PhD和创业,目标都不同。从基本目标看:去大公司为了升职加薪;读PhD要保证毕业;创业要推出产品,要么上市要么卖掉。

要考虑干什么事。在大公司,要解决问题。想清楚在公司干什么,公司今年准备干什么,最好一致。干的事是自己喜欢但不是公司追求的,会难受。创业公司面临用户付不付钱、投资人付不付钱。虽然都是解决问题,但问题类型不同。想解决什么问题,就会选择做什么事。还有驱动力,即最小动机。去大公司不能只想着家里没矿找个班上,动机得高一点。创业动机要更高,不然熬不下来。

打工人:晚上不用做噩梦,但逐渐成为螺丝钉

打工人的好处:在相对简单环境学习各种从业知识,比如技术落地、产品设计、运营管理。干完被安排的任务后,晚上睡觉不用太担心,不会做噩梦。相对稳定的收入和空余时间——买房、教育小孩、照顾父母都需要时间,打工人相对充裕,就算996还有一天休息(其他赛道是7x24)。

坏处是停留在打工人或职业经理人思维。公司从上层把复杂世界抽象成简单任务,待得越久越觉得自己是螺丝钉。螺丝钉好处是找到螺母钉上去就行,不用管机器多复杂。但在简化世界待久了会腻,学得少,一直停留在打工人思维,无法站在更高层次思考。

PhD:要真心热爱研究,不然难以坚持

读PhD的好处:几年时间专心探索领域,没钱赚也没升职机会。完成后获得个人或小团队研发能力,能自己做出东西,也能带人。PhD有50%时间花在写作和演讲上,这种能力很重要。很多公司研发职位要求PhD。

坏处:很少有实验室能参与大项目研发。研究课题和导师风格挑人,需要适应。公司里还能部门间跳,读PhD更难。要真的热爱研究,不然坚持不下去。可以想:写文章是为了练习写作,等更大成果出来后,写作不能拉后腿。要有一个更远大的目标。

创业:有“生死一瞬间”的刺激,也有“三小时醒一次”的痛苦

创业好酷,有当海盗的乐趣。天天看市面上有什么,跟人聊机会,机会来了要不要all in。海盗太多,不all in机会就没了,all in也可能失败,生死一瞬间,刺激。创业是唯一合法“当海盗”的方式。还能直面复杂社会,没人帮你抽象,得自己理解社会后快速学习。越复杂的环境越锻炼抽象能力。创业是最好历经苦难的方法——创业后,做别的事都相对简单。

不好的地方是婴儿般睡眠,每三小时醒一次,怀疑自己是否快混不下去。问过很多人,包括张一鸣和世界首富级别的人。所有困难都在你头上,没人帮你顶。学校导师能顶,公司上级能顶(有时也背锅),创业所有困难压一人身上,逃避没用。得热爱创业方向,不一定热爱创业,但要热爱做的事情,不然坚持不下来。创业要求的动机比PhD更高,PhD比工作更高,核心原因是延迟享受。公司干完事有奖金;PhD研究一两年;创业可能五年才能得到正反馈。没有任何正反馈时,得热爱这个事情,给自己加码嗨起来。

强烈的动机,来自欲望和恐惧

要有强烈的动机。它要么来自深沉底层的欲望,要么来自很深的恐惧。用旁观者角度剖析自己:最不愿意回忆或分享的是什么?想一下背后的动机,是想要什么还是怕什么?欲望越底层越好——名、利、权,要直面自己的欲望和恐惧。恐惧可以是让人抑郁的、感受生死的恐惧。把欲望和恐惧转变成积极向上的动机,这一点很重要。逃避、放纵满足不了欲望,缓解不了恐惧。唯一克服办法是把它变成积极向上、符合社会价值的动机。

有了动机后,要想解决什么问题。问题可能就是动机本身。如果问题有学术价值,可以考虑读PhD;有商业价值,可以考虑创业;两种属性都不够强但有成长价值,先做打工人。比如:语言模型为什么能work?没人知道,很有学术价值。语言模型能否孵化出新应用?有商业价值。实在不行,思考在某个产品上如何落地。

一个持续提升自我的妙招

最后,分享一个持续提升自我的方法。用导师或上级的角度总结自己:每周干了哪些事?为什么目标没达成?可能是因为懒,那么直面懒的问题——找学习伙伴,每天在图书馆,互相监督。可能是因为蠢,有两种方案:换一个方向去擅长领域;或者绕不开就花别人两倍时间。无论懒还是蠢,都得对自己狠,最后拼的就是对自己有多狠。

形成习惯:定闹钟,每周一晚上花30分钟总结,每季度总结,翻看周记,看季度目标是否完成,下季度做什么。选择比努力更重要,但选择的前提是搞清楚目标是什么。每年或每五年想一想自己的动机。如果去年不开心、没成果,思考是不是没有强烈动机或时机不够。时机不到继续努力,动机不对就换方向。每五年想一想动机是什么?要干什么?但这有个bug——什么地方都逛了一圈,活成了“打卡式人生”。

这是一个最好的时代,新技术带来很多新机会。就算没有新一代技术,现有技术对未来几年影响都非常大。这不是我一个人的看法,很多世界500强CEO也这么认为,内部数据验证了这一点。所以不管是读本科、硕士、PhD还是刚工作,都能享受到未来几年技术带来的变革。同时,这也是一个最坏的时代,付出的努力要比上一代更多。上一代吃到时代红利,这代还有红利,但需要更多努力。

相关阅读:《李沐:创业一年,人间三年》