今年世界模型开始考真题了
查了一下这次WAIC的数据:1100多家企业,300多款产品全球首发。全场最热的词,毫无悬念——世界模型。
01
热度有多高?做机器人的在发,做AI影视的在办论坛,连做农业的都搞出来一个植物生长世界模型。7月19号,昆仑万维专场,直接喊出今年是世界模型的元年。你可能会和很多人一样,第一反应是:新技术嘛,今年刚冒出来。真不是。
往回数三年:2024年初,谷歌DeepMind发了Genie,AI破天荒地学会了从视频里自己理解什么叫“动作”。2025年8月,Genie 3做到实时交互,你可以在一个AI现场生成的世界里走来走去。2025年11月,李飞飞的World Labs把世界模型做成了商业产品。三年,四级跳,每一级都有人喊过“重大突破”。
翻看发布材料会发现,昆仑万维自己早就进场了——Matrix-Game 做到第三代,而且这个系列在圈里的待遇,有点特殊。第二代开源后,DiT 作者、纽约大学助理教授谢赛宁团队拿它当底座,做出了全球第一个多人视频世界模型 Solaris;第三代,NVIDIA 跟浙大联合发布的 Light Interaction,同样是基于它研发的。更有意思的是另一件事:NVIDIA 的 SANA-WM、Adobe 的 RELIC,这些国际大厂自己发世界模型的时候,把 Matrix-Game 拿去当了对比基准。什么意思?别人考试,拿你当分数线。
开源模型混到这个地位,说明什么?去年就能用了。东西早就能用,元年却从今年算起。那么,最关键的差别在哪?
是考卷。机器人领域有一张所有模型都要考的卷子,叫LIBERO。给机器人一堆标准任务,看完成率。这张卷子考了三年,今年考出来的结果有点尴尬:十几家主流模型,分数全挤在96分到99分之间,头部几家互差不到一分,人人接近满分。相当于高考全省前十名的总分差,还没有一道选择题大。这卷子还能排出名次吗?能,但排出来的名次,连出卷人自己都不信了。
人人接近满分的卷子,说明卷子废了,测不下去了。你排第几,取决于你把谁放进对手名单;换一批对手,第一名换一个人。这两年发布会上那句“刷新SOTA”越来越不值钱。根子就在这里:大家刷同一张接近满分的卷子。
世界模型的另一半,也一样。视频生成比什么?画面稳不稳、场景真不真。这些东西有个共同点:全靠人眼。评委看屏幕打分,观众看演示鼓掌;人眼,是这三年唯一的考官,而这位考官,快被哄满意了。
这就是2026年的处境:旧卷子考不出差距,旧考官快被哄到顶了。一项技术走到这一步,只剩两条路——要么继续在旧卷子上争小数点,要么,换一张不考情面的卷子。所以,看今年世界模型,别数谁发的东西多。这届WAIC,把三张新卷子一次摆上台面的,是昆仑万维。
02
新卷子第一张,是一台得了零分的机器人。
主角叫 Riemann-1.0。昆仑万维子公司黎曼动力成立后交的第一份作业:一个机器人的“通用大脑”。先说这个零分怎么来的。黎曼的技术材料里有一组对照实验:不做预训练,从零训一版模型,装到一台双臂机器人上,做四类家务。叠衣服、收餐具、整理桌面、堆积木。成功率,0%。不是动都不动,是手伸出去了,东西碰到了,动作做对了大概两成。但四件事,一件都没做完。这就是新卷子的性质。
仿真里那套模型能考 95 分,因为仿真给“过程分”:手伸对了,给一点;方向偏了,扣一点。物理世界不给。

图解:
为什么仿真里的好学生,一到真机就交白卷?因为仿真是个好脾气的考官:光线永远均匀,桌子永远不晃,衣服的褶皱都是算出来的。真实世界不惯着,布料会滑,光会反,你夹起衣角的那一下,力道差一点,后面全盘皆输。这中间的落差有个行话,叫“从仿真到现实的鸿沟”。机器人这一行,多少团队倒在这条沟里。衣服叠好了就是叠好了,没叠好就是没叠好,没有“差一点”这个分数档。你看,旧卷子上小数点后两位的荣耀,到这里,一次性清零。
那从 0 分到 85 分,中间隔着什么?23.2 万个小时的录像。黎曼给这个大脑喂的训练数据里,86% 是人类第一视角的日常视频。人怎么叠衣服、怎么收桌子、怎么把笔插进笔筒。说白了,这个机器人大脑是看人类过日子长大的。剩下那一小半,才是机器人自己的操作数据。
看录像学来的本事,到底能不能落到机器人手上?19号这天,昆仑交了卷。官方公布的真机评测里,四类家务,Riemann-1.0 平均成功率 85%,比最强的开源对手高出 15 个百分点。还有一个更大的考场:RoboCasa-365。你不知道是啥,没关系,记住它是最接近真实家务的一张考卷就行。365 类厨房长流程任务,从拿食材到洗碗,一套动作做完才算分。它考了 62.6%,第二名 54.2%。注意这两组数的形状——是拉开身位的领先。新卷子刚换上,区分度就回来了。
还有两个数,比分数更能说明问题。第一个:整套大脑跑在一张 RTX 4090 上,对,就是你打游戏那张显卡。一个机器人“通用大脑”的硬件门槛,一万多块钱。第二个:评测里有一项,让它把魔方放进收纳盒。训练里从来没教过魔方,也没教过这个盒子。十次,十次成功。没教过的事它也会,这才是那 23 万小时录像真正换来的东西:见过世面的。
这张新卷子有个代价:很贵,贵到逼着每个来考试的,都得拿别的东西去换。屏幕里的那个模型,刚交了一笔学费。
03
另一笔学费是什么呢?答案是:速度。
这个模型叫 Matrix-3.5,前面提过那个被谢赛宁团队当底座的 Matrix-Game 系列,最新一代。它的发布材料里有一个数,放在任何一场发布会上都像印刷错误:上一代每秒 40 帧,这一代每秒 20 帧。慢了,整整一半。
这个行业发布会的语法只有一种:“更快了”——帧数翻倍、延迟减半、响应提升,观众一听就懂,评委一看就给分。你找不出第二家主动说“我们变慢了”的公司。所以,这个数只有一种解释:它拿这一半的速度,换了一个它认为更值钱的东西。换的是记性和算力轻量化。
以前的 AI 生成世界有个毛病,像金鱼。你往前走,楼是楼、树是树;转个身再回头,楼没了,原地换了栋新的。它把自己一秒钟前造的东西,忘了。世界模型喊了三年“构建虚拟世界”,卡就卡在这里:想让世界记得住自己。Matrix-3.5 干的事,说白了,就一句话:把 AI 看过的每一块画面,标上三维坐标,存进档案。你转回头,它是去档案里把原来那栋调出来。转身,楼还在;走出去一分钟再回来,楼还在原处,窗户还是那几扇。这一分钟的“还在”,就是那 20 帧买回来的东西。
得说清楚:慢一半,是多卡变单卡,选了以后再拼命往回追。为了不让 20 帧继续掉成 10 帧,工程上把生成步数从几十步压到 3 步,解码器砍掉四分之三的体积。先选记性,再把速度一点点捞回来,最后停在 20 帧这个两头都还能用的位置。这是一笔算得清清楚楚的账。
顺便说一句“转身楼还在”这道题的行情:此前全球做得最好的是谷歌 Genie 3,闭源,只能看演示。Matrix 这套,开源。你发现没有,这个选择跟机器人是同一个动作。机器人把评分交给物理世界,屏幕外考了一张不考情面的卷子。Matrix-3.5 放弃“更快”换“记得住”,屏幕里主动挑了一道更难的题。快,讨好眼睛;记得住,讨好把这个世界当真的人。
屏幕外考了一张,屏幕里考了一张。还剩最后一个考场,它永远不会有标准答案。
04
比如:音乐。音乐请不出去。一首歌好不好听,宇宙里没有任何一条定律能裁决。这道题的考官永远是人的耳朵。你换不掉。那在换不掉考官的考场里,“元年”两个字怎么立?昆仑这场论坛发的第三个模型,AI 音乐 Mureka,给了一个答案:换不掉考官,就对考官交实底。
它的技术材料里有一个数,很少在发布材料里见到这么不讨喜的数:让新模型生成一百首歌,请专业评审同口径打分。能听、能用、没跑题,三关全过的,二十八首。这一轮评测里的综合可用率,28%。这数好看吗?不好看。你先别替它可惜。想想自己,你用 AI 生过图吗?写过文案吗?十次里,能一个字不改直接拿去用的,有几次?对,就这感觉。28% 这个数,跟每个用过 AI 的人的手感,是对得上的。
而且你倒过来想:一家公司敢把 28% 印出来,说明它心里有另一本账。这 28% 是三关全过的成品率,卡“直接能用”的标准。放宽一关,只算“能听”,这个数立刻高出一大截。它不放宽。因为它清楚,用户手里的体感是藏不住的:你报 90%,用户用三次就戳穿了;你报 28%,用户用三次,反而觉得你没骗他。而“对得上”这三个字,在今年的发布会季里,比任何一个漂亮数字都稀缺。满场都是 99% 和“遥遥领先”,你有多久没见过一家公司,把自己不到三成的良品率印在发布材料上了?
不止这一个数,同一份材料还认了另一笔账:为了让歌听起来“更有人味、更少 AI 味”,编曲的丰满度做了让步,这一项在同轮测试里,不是最高。这个取舍,论坛现场刚好来了个人证。圆桌上,黄晓明说起自己录新歌的经历:作曲是人写的,唱 demo 的全是 AI。他第一反应是“怎么唱得这么好听,我要是能唱到这个程度就好了”。结果制作人给他泼了盆冷水:就因为他是 AI,太完美了,好到完全没有呼吸,没有人味。一个唱了几十年歌的人,被 AI 的“太好”扎了一下。太完美,恰恰是 AI 味的来源;有呼吸、瑕疵,才是人味的来源。Mureka 把编曲的丰满度让出去,换“更少 AI 味”,赌的就是这个方向。

图释:
你看,短板,自己写出来的。这就是没有标准答案的考场里的考法:给不了物理世界那种铁面的分数,就给一个不掺水的分数。顺便说一句,黄晓明真用过。他让Mureka 照着杨宗纬的风格生成了一首抒情歌,他给出的评价是“Mureka确实也不错”,还特意补了一句:词还挺触动人心。
前两个考场,靠换考官立信;这个考场,靠对考官诚实立信。路不同,方向是同一个:让分数重新变得可信。至于 Mureka 这次发布本身,重点在于流水线。它把 AI 音乐从“生成一首歌”做成了“从一个念头一路做到 MV”。你给一句话,它出歌词、出人声、出角色、出成片。而且,台下坐着的爱奇艺高级副总裁,是这条流水线的客户。AI 音乐商业化走到哪一步,看谁来支持就够了。
三个考场,都交卷了。
回头看昆仑这场论坛说的“2026 是世界模型元年”。元年这个词,通常被理解成“这一年,我们做成了什么”。三张卷子放在一起看,意思恰恰相反:元年,是从这一年起,分数开始算数了。机器人的 85%,是物理世界给的分;那一分钟的“还在”,是三维坐标给的分;音乐的 28%,是对着人的耳朵报的实底。三个分数,没有一个需要发布会的掌声来撑。旧卷子上的满分年年有,新卷子上的分数,今年是第一批。至于这批分数到年底能涨到哪?卷子刚发下去,别急着对答案。你就记住一件事:这一行,开始考真题了。
核心数据参考资料:
[1]黎曼动力Riemann-1.0技术报告、昆仑万维Matrix-3.5及Mureka V9.5/O3发布材料;Google DeepMind Genie系列公开论文、LIBERO与RoboCasa-365基准公开数据、WAIC 2026官方数据
