魔法原子Magic-VLAK02攻克叠盒封胶长程任务,成功率超90%
WAIC现场,魔法原子直接让机器人干起了“叠箱封胶”的精细活儿——这可不是花架子表演,而是通用具身大模型在物理世界里的硬核实力展示。
7月17日,在2026世界人工智能大会(WAIC)上,魔法原子亮出了自研的通用具身大模型Magic-VLA K02的最新成果。现场直接上真机:叠盒封胶、整理柔性衣物、收纳行李箱……这些看起来对机器人都挺有挑战的长程任务,一个不落全演示了一遍。
现场搭载了Magic-VLA K02的机器人,已经不是那种只懂“按剧本走”的机械操作了。它能自主理解任务、拆分步骤、识别物体,还能连续执行动作。更关键的是,一旦环境状态变了,或者作业流程被打断,它能实时调整策略,自己把任务接上。
重点来了:叠盒封胶这套组合式长程任务,成功率直接干到了90%以上。
这个成果意味着什么?它不光验证了Magic-VLA K02在长时序规划、可变形物体操控、动态扰动恢复和多物体空间推理上的能力,更重要的是,它坐实了这套模型作为魔法原子机器人核心技术底座的价值。有了这个基础,不同的机器人形态——无论是机械臂还是移动操作机器人——就有了统一的智能基础,能更顺畅地进入真实岗位,实现能力迁移和规模化部署。
三类复杂场景,指向通用操作能力
这次WAIC现场,魔法原子没有挑简单的展示,而是选了三种物理属性和任务结构差异都很明显的场景,来集中验证Magic-VLA K02的通用操作能力。
先说叠盒与封胶。这俩活儿看着不起眼,但物流仓储、工业生产、电商零售这些场景里,它俩可是基础工序,也是具身智能领域公认的“硬骨头”。为什么?因为一个涉及刚性物体的精细操控,另一个则要搞定柔性物体的动态控制。这两项任务的自动化水平,直接决定了包装效率、作业标准化程度和人力成本。
现场是怎么做的?Magic-VLA K02能实时识别不同规格、尺寸和形态的箱体,然后自主调整机械臂的抓取点位、受力角度和叠放姿态。它还结合了空间感知、重心控制和力反馈,就算箱体位置偏移了、变形了,也能动态修正。
贴胶带环节就更讲究了。胶带这东西本身会形变,箱体表面状态也不一样。模型得根据这些实时变化,调整末端轨迹和贴合力度,降低空鼓、偏移、褶皱和断裂这些常见问题。
不过,真正有挑战性的还不是单个动作,而是叠盒封胶这个组合流程。它可不是“先叠盒再贴胶带”这么简单串起来就行,而是一个从任务规划、状态感知、连续执行到异常恢复的完整长程流程。Magic-VLA K02没有简单堆叠预设动作,而是把整个流程拆解成一系列有明确时序关系的原子任务。每执行一步,它都根据结果更新当前状态,再动态规划后续动作——从源头上就降低了多步骤操作中的误差累积。
举个例子,箱体位置突然偏移了、胶带状态变了,甚至任务流程被意外打断了,模型都能重新感知环境、评估任务进度、修正执行轨迹。整个过程不依赖人工干预,真机环境里自己就能把任务接上。
除了叠盒封胶,现场还演示了柔性衣物整理和行李箱收纳。
衣物整理指向的是高自由度柔性物体操控。衣服没有稳定的几何形态,轮廓、边角、局部状态都会受重力、接触和机械臂动作影响。Magic-VLA K02能根据实时视觉信息动态选择抓取位置,持续调整作用力度、动作角度和执行轨迹,一口气完成平铺、压边、对折、收角和规整。
现场还特意设置了打断环节:观众在操作过程中移动或打乱衣物。机器人没有机械地继续执行原有轨迹,而是重新识别衣物状态、判断任务偏差,然后基于最新环境信息恢复后续操作——这才是真正的“有脑子”。
行李箱收纳任务则更复杂,需要同时处理多个物体和有限空间之间的约束关系。机器人得识别箱内可用区域,理解衣物、盒装物品等不同对象的形态、尺寸和可堆叠关系,然后统筹规划摆放位置、操作顺序和空间利用方式。
这三类任务,分别涉及结构推理、柔性形变建模、长程任务恢复和多物体空间规划。现场呈现的,不是三套彼此独立的固定程序,而是同一模型框架在不同任务中的能力外化——这才是通用具身大模型该有的样子。
分层式双系统架构,支撑复杂任务连续执行
这三类任务能在同一套模型框架下完成,核心在于Magic-VLA K02面向长程任务构建的分层式双系统架构。
这套架构由高层“理解—生成统一模型”和低层动作生成系统协同组成,打通了任务理解、原子任务拆解、视觉目标生成、未来状态预测和连续动作执行的完整链路。
高层系统负责全局决策和任务规划。面对抽象的长程指令,模型能结合实时视觉信息进行语义理解和多步推理,把完整目标拆解成一系列可执行的原子任务。
以叠盒封胶为例
为了进一步约束动作方向,高层系统还会为基于任务结果的预测生成“关键结果图像”,明确每一步的视觉目标。这样一来,机器人不只知道自己“当前需要做什么”,还能获得“完成后应该呈现什么状态”的目标参照,任务成功率自然就上去了。
低层系统则负责把高层拆解的原子任务和视觉目标,转化为连续机器人动作。这套系统由VLM主干网络、动态专家模块和动作专家模块协同构成。
动态专家模块能提前推演当前动作可能引发的物体形态和场景变化。比如在衣物折叠过程中,模型不只看当前抓取位置,还要预测抓取和翻折后布料可能呈现的状态——避免出现“局部动作正确,整体结果跑偏”的情况。
动作专家模块则负责输出连续、平滑的动作序列,提升抓取、弯折、移动、贴合和放置这些相邻动作之间的衔接稳定性,减少机械抖动、动作突变和轨迹偏移。
通过高层规划和低层执行的协同,Magic-VLA K02能持续回答三个问题:当前需要完成什么?完成后应达到什么状态?具体如何执行动作?现场看到的连续操作、动态纠错和受扰恢复,都被纳入了这套长程任务闭环之中。
四项能力优势,增强长程任务落地表现
基于分层式双系统架构,Magic-VLA K02在推理部署层面,进一步构建了“感知—理解—决策—执行”的端到端闭环。在长程策略控制、技能组合泛化、跨机器人适配和工程部署稳定性这几个维度,都实现了进一步提升。
长程策略控制方面
这也是机器人在叠盒封胶流程中降低误差累积、在衣物被打乱后恢复任务的基础。
技能组合泛化方面
据测试,其场景适配吞吐量提升110%,整体任务泛化执行效率提升90%以上。
跨机器人适配方面
工程部署稳定性方面
从数据训练到真机部署,构建完整大模型训练闭环
WAIC现场呈现的任务连续性和扰动恢复能力,不只来自模型架构,也建立在Magic-VLA K02从数据训练到推理部署的完整技术体系之上。
高质量的机器人数据是具身大模型持续提升的重要基础。但真机数据普遍存在采集成本高、生产效率低、场景覆盖有限等问题,尤其难以覆盖长程任务中的大量中间状态、异常情况和失败样本。
针对这个瓶颈,Magic-VLA K02采用了“海量第一人称视角数据预训练+少量机器人示范数据跨形态动作对齐与后训练”的训练范式。模型先是从第一人称操作数据中学习人类的任务拆解逻辑、手物交互关系、视觉子目标和物体状态变化,再通过机器人示范数据,把相关认知和操作能力对齐到真实机器人动作空间。
训练过程分阶段完成:高层任务拆解与视觉目标生成、低层未来状态预测和连续动作生成,最后通过渐进式解冻与端到端联合微调,解决高层系统与低层模块之间的表征错位问题。经过联合训练后,模型能够围绕统一任务目标协同完成语义理解、步骤规划、状态预测和动作控制——在降低大规模真机数据依赖的同时,提升对未知场景、物体变化和复杂交互的适应能力。