涨停潮来了!人工智能,关键转折!
先说几个核心判断:AI正在经历一次关键转向。过去两年,大家聊的是“生成”——生成文字、图片、视频、音乐。但从2026年开始,风向变了,核心命题变成了“理解”与“交互”。
7月21日,A股人工智能板块上涨,多股涨停,市场情绪显然被这波技术转向带动了。

随着AI技术快速发展,大家的期待已经不止于此。能理解、能交互、能干活的AI,正在成为产业新的追求。在2026世界人工智能大会上,物理AI、世界模型这些概念被反复提及。核心问题很明确:如何让AI理解真实世界的运行规律,在复杂环境中自主判断并执行任务?这已经成为当前具身智能产业发展的核心命题。
△参观者观看人形机器人协同上下料和料框搬运。(资料图,图片由CNSPHOTO提供)
核心命题转向理解与交互
物理AI,简单说就是能让机器人、自动驾驶车辆、智能空间和其他自主系统在真实物理世界中感知、理解、推理并执行复杂动作的AI。而世界模型,则是理解现实世界动态(包括物理和空间属性)的AI工具,它利用文本、图像、视频、声音和运动等输入数据,来预测接下来会发生什么。
它石智航创始人兼CEO陈亦伦给出了一个更技术化的定义:“具身智能领域世界模型的定义是能够高频联合预测动作与世界状态的人工智能模型。”他进一步解释,当前行业流行的VLA(视觉—语言—动作)模型只能输出机器人的下一步动作,而世界模型不仅要输出动作,还要预测动作引发的世界状态变化,以及判断变化结果是否符合预期。这完整覆盖了强化学习“状态—动作—奖励”三要素。
昆仑万维董事长兼CEO方汉则直接称2026年为“世界模型元年”。在他看来,这标志着AI从内容生成走向对物理世界的理解与交互的关键转折。方汉表示,过去两年,AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。从2026年开始,核心命题转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。世界模型,正是实现这一跨越的关键技术底座。
“具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。”方汉说。在他看来,这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力。
“谁能训练出在复杂场景中依然‘看得懂、做得对’的模型,谁就能拿到物理智能时代的入场券,这也是中国智能制造和机器人产业亟须的底层能力。”方汉的这句话,点出了产业竞争的底层逻辑。
物理场景对模型能力提出了更高的要求。大晓机器人董事长王晓刚直击行业痛点:“数字世界模型失误仅影响图文生成,而在物理场景下,智能体预判偏差将产生不可逆的真实损失。”这话听起来有点扎心,但确实是现实。
机器人更智能需要多少数据
机器人要在日常生活中灵活自如地完成任务,究竟需要多大规模的数据?这个问题很关键。
智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青认为,如果机器人能够在物理世界中“开箱即用”,完成日常任务,并跟随开放式自然语言指令行动,那么具身数据规模仍与语言模型预训练语料存在万倍以上差距。
“物理世界噪声更大、信息冗余更高,要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,需要亿小时级别的数据,才能让常见任务的基础成功率达到70%—80%。”姚卯青给出了一个大致的数据规模。
陈亦伦则补充了更具体的量化:“工业级自动驾驶系统训练需要约100万小时视频数据,而具身操作需要刻画更复杂的接触式物理规律,至少需要1000万小时合格数据。”这个差距,比想象中要大得多。
除了数据规模,世界模型的训练方向和核心目标同样值得关注。陈亦伦认为,世界模型训练的核心目标应当是动作预测而非状态预测。他以大语言模型的发展路径做了类比:大模型通过模仿互联网海量人类文本最终实现能力超越,具身智能也将走“大规模模仿人类、最终超越人类”的路径。
“人类在物理世界行动时,并不会刻意预测下一时刻的世界状态,而是基于视觉感知直觉输出动作,因此‘状态用于感知,动作才是模型需要预测的核心’,世界模型的突破关键在于积累海量‘状态—动作’配对数据。”陈亦伦说。
亮源新创创始人兼CEO、ChatGPT核心贡献者姜旭也持类似观点。他认为,世界模型最核心需要完成两项任务:一是预测世界的下一个状态;二是更重要的一项,即预测下一个动作。
“如果必须在两者之间做取舍,预测动作比预测状态更加重要。因为我们训练世界模型的最终目的,不是为了生成视频,而是为了控制机器人。”姜旭说,“希望通过架构创新和数据创新,更好地统一状态理解和动作预测两项能力。”
具身智能企业展开探索
围绕数据、模型与真实作业能力,具身智能企业已经展开系统性探索。
专注于触觉物理智能研发的千觉机器人,携完整“硬件—数据—模型”技术生态参展。千觉展出了核心技术底座VTLA视觉—触觉—语言—动作多模态模型,依托实时触觉反馈实现无预设轨迹自适应作业。在柔性物料长序列加工场景中,当纸板受外力移位、形变干扰时,机器人可通过触觉感知受力变化,自主调整施力力度与动作轨迹,连贯完成展平、折边、压实整套工序。这不再是实验室里的表演,而是迈向真实场景的关键一步。
大晓机器人发布了Kairos 3.1,这是一个融合生成智能、物理智能与认知智能的行动一体化世界模型。它构建了“理解—推演—执行—反思”全链路自进化智能闭环,标志着具身世界模型实现了从单一能力突破向产业落地的完整闭环。在洗衣等真实家庭场景中,机器人可精准识别部件空间关系,依托时空记忆与思维链拆解十余个操作步骤,自主规划从取衣、放衣到启动、整理的全链路方案;同时,机器人还具备任务状态追溯能力,实时核验每一步执行结果,在出现异常时可精准定位失败节点并重启对应步骤,实现自主闭环作业。
智元则构建了“预训练—后训练—持续学习”的三阶段训练架构,沿着VLA与WAM两条路线持续演进,并推动二者走向统一的世界推理动作大模型(WRAM,World Reasoning Action Model)。以此为基础,智元推出了自研GO-2基座模型、Act2Goal世界模型、GE-Sim 2.0,搭配SOP、Genie Evolver百台级分布式真机强化学习体系,从算法、仿真、真机训练层面打通了规模化迭代闭环。
姚卯青认为,物理智能要实现规模化,必须突破三道墙:一是数据墙,真实交互数据极其稀缺且获取成本高;二是表征墙,跨任务、跨场景、跨本体的统一物理表征尚未形成;三是闭环墙,真实试错代价昂贵、反馈缓慢,难以规模化。
“物理AI从‘能演示’走向‘能干活’,关键不在于单点模型能力大小,而在于能否形成可泛化、可优化、可进化的通用具身智能系统。”姚卯青的总结,点出了这个产业的真正挑战和未来方向。