泛化涌现!原力灵机三级火箭助推具身智能落地
2026年下半场,门槛已经清晰地摆在眼前:具身智能赛道,即将迎来第一次集中交卷。
要让具身智能真正实现泛化落地,国内公司缺的其实并不是硬件,不是场景,甚至也不是数据采集能力。真正卡住脖子的,是数据的碎片化——各家公司的硬件、算法、场景各自为战,缺少一个能把它们连接在一起的标准。没有这个标准,采集到的数据就无法跨任务、跨机型复用,数据收集的效率自然事倍功半。从10万小时到100万小时的“鲤鱼跃龙门”,也就成了天方夜谭。
那100万小时的“黄金数据”怎么来?单纯靠人力去“堆”显然不现实。不少公司寄希望于让机器人进入真实场景,靠“数据飞轮”自我驱动,但面前摆着三座大山:
第一
第二
第三
所以,要越过这三座大山,靠单一环节的优化远远不够。具身公司必须搭起一套“三级火箭”,用全栈的方式,实现系统性的能力升级。

什么样的具身模型,才最可能实现“泛化涌现”?
能在一个场景里通用,能在多个场景里泛化,甚至做到零样本或少样本的智能涌现——这是每一个具身模型落地应用的核心指标。
要实现面向开放世界的通用模型,就得有更大的数据规模、更先进的架构,以及更强的开放世界泛化能力。
2026年7月9日,原力灵机在北京举办了Action 2026开发者大会。会上,他们推出了自研的具身基础模型“DM0.5”,正式向“模型能力不足”这个核心痛点宣战。

这个4B参数规模的模型,背后是5万小时包含百余种动作的真机数据,加上10万小时的场景视频。这让DM0.5在三大核心任务(导航、抓取、全身控制)和六类机器人选型上都有数据支撑,能覆盖日常出现的主要场景。

DM0.5之所以被认为更有希望落地,核心在于它强大的泛化能力。检验泛化能力最硬核的指标,就是看零样本(Zero-shot)和少样本(Few-shot)的表现。今天不少公司Demo做得花团锦簇,但仔细一看,都是在给定任务上反复“排练”过的“表演”。现实世界没法被穷举,面对从未训练过的目标任务,模型必须能举一反三。
在这点上,DM0.5的表现相当能打。相比先前的DM0版本,零样本导航成功率提升了31%,少样本成功率提升了45%。这意味着,模型可以在没有专门训练的情况下,完成“看懂目标→做出动作→跨本体将语言与视觉统一成执行结果”的完整闭环。


有了更强的“举一反三”能力,模型要真正进入场景,模型精调(Fine-tuning)也是一门必修课。DM0.5的精调,不仅支持4090消费级显卡,成本还下降了60%,成功率反而提升了20%,最快18小时就能完成一个下游任务的部署。推理效率同样亮眼——在4090上响应速度仅90毫秒,在H100环境下更是达到50毫秒。
在面向真实工业和真实场景的RoboChallenge榜单上,面对30个复杂任务、4种异构机型的挑战,DM0.5的成功率达到43%,以54.42的总得分拔得头筹。此外,DM0.5在LIBERO的综合表现达到99.10%(Clean场景94.1%,Random场景94.4%),并在RoboTwin 2.0、R2R、RxR三个榜单上以很大优势领跑。通过更强的上下文工程,DM0.5还实现了长达60秒的原生记忆,有效对抗了传统具身模型“走一步忘一步”的尴尬。
举个典型的桌面清理场景:DM0.5驱动的机器人能记住物品的来处,精准地放回原位。在人类示范之后,它也能立刻对齐动作并跟随完成复杂任务,让人机交互变得更自然。
不仅如此,DM0.5还通过结合高阶大脑(系统2)和直觉反射(系统1),实现了更强的抗干扰能力,能应对相机扰动、人类动作干扰。而“多任务+多机型”的训练方式,让它能在不同本体上快速适配——双足、轮式、单臂、双臂、灵巧手都不在话下,覆盖导航、抓取、全身控制三大核心任务。
目前,DM0.5已经在GitHub上开放了最新仓库,在HuggingFace也上线了模型权重和最新博客。一周后,原力灵机还将正式向LeRobot社区提交核心代码,并面向全行业公开深度技术报告,用开源生态的方式,把更优秀的“具身大脑”推向市场。
如果说过去的具身范式是“执行固定指令、单次动作重复”,那么今天,在DM0.5的驱动下,具身智能正在向“理解意图、多维连续泛化、长时可靠运行”跃升。
当然,强大的模型只是“第一级火箭”。全栈的能力,才是补全落地拼图的关键。
为什么只有全栈,才能让通用具身更好地落地?
具身模型可以通过Scaling Law实现线性提升,但全栈能力,则是对每一家公司的“大考”。
只有模型显然不够。没有性能更好的本体、更好用的工具链、更好的多机器人协作系统,具身就永远成不了用户可用的生产力。
面对这场大考,原力灵机准备了全套方案。
先给“大脑”一个更强大的“身体”——他们推出了通用具身本体2.0-Apex。DM0.5能兼容多种形态的本体,2.0-Apex则干脆把机器人的诸多部件做了解耦设计,用户可以根据需要,在一分钟内对底盘、手臂、灵巧手、夹爪等部件进行热插拔,真正实现“十八般武艺”样样精通。
算力上,2.0-Apex的底层算法采用1kHz高频控制,让基础动作安全丝滑;端侧搭载Thor顶级芯片,让高频实时推理成为可能。针对复杂决策和逻辑规划,通过WiFi 7高速天线,它也能无缝连接云端大模型,让更高阶的智能无需等待。
其他方面,360°无死角感知(腕部相机+激光雷达)、毫米级末端定位的夹爪、1000小时以上的MTBF(平均无故障工作时间)、30秒不停机快速换电——这些都是原力灵机本体工程的“基础操作”,让本体更易量产,在工业、物流等真实复杂场景中承担高强度作业。

大脑和身体齐备了,开发者要把机器人用到实处,一套工程化、系统化、平台化的支持层也必不可少。原力灵机为此推出了开发者平台DexDev,打出了DFOL 2.0、DexOs和MaaS的“三板斧”。
今天的产业界对具身机器人总是“既要又要”——高成功率、高节拍、高鲁棒性缺一不可。DFOL 2.0,这套世界模型驱动的闭环强化学习框架,正是为此而生。
1.0版本的DFOL,已经让“具身原生应用的量产工作流”成为现实。到了2.0版本,原力灵机要做的是让世界模型成为更高保真的仿真器,直接把强化学习放进虚拟世界跑通。
为此,他们同步推出了通用具身世界模型DW0.5。与DM0.5一字之差,但DW0.5的仿真能力更强。在DFOL 2.0的闭环中,DM0.5提供初始动作块和基础策略,DW0.5则在线批量生成视觉轨迹预测(Rollout 1到Rollout N),还原未来世界状态。负责评估的“教练员”CFG-RL则根据轨迹进行通用任务的进度评估,将打分结果与奖励信号实时回传,更新模型权重,实现具身智能的自我演进。
一句话总结:DM0.5负责输出动作,DW0.5负责模拟,CFG-RL负责打分,打分结果再反馈给模型进行优化。
效果如何?DFOL 2.0把整体训练成本降低了40%,复杂真机任务(比如打气球、晾衣服、调酒)的成功率也显著提升。更重要的是,这套闭环强化学习链路,极大降低了真机训练数据的需求,顺便解决了硬件损坏和优化问题,让强化学习真正实现了规模化。
和DM0.5一样,DW0.5和DFOL 2.0也加入了原力灵机的开放生态。前者已经正式开源,后者也面向全球开发者开放使用。

要实现“一脑多形”,最理想的方式就是无论何种机型,都能一键接入。原力灵机的具身操作系统DexOS,正是为此设计。通过ECP(Embodied Control Platform)的多层级系统协作,开发者只用几行Python代码,就能完成机器人的连接、感知获取、模型推理与动作执行。
面向更大的开发者群体,原力灵机还发布了行业首个通用具身MaaS服务。不仅支持通用具身模型,也支持满足特定场景的定制模型。开发者可以登录一站式可视化数据及模型管理工作台,上传LeRobot v3格式的数据集,进行私有数据的联合训练,价格仅在1元/百万token左右。
有了本体和开发平台,原力灵机还不想止步。面向多机器人协作的关键场景,他们手搓了一套给具身智能设计的“Harness框架”——Ferrata(飞拉达)。
为什么需要这个?因为在真实、复杂的物理场景下,单一功能的机器人本体能力再强,也往往难以胜任所有工作。多个机器人一起协作,难免“打架”,这也成了大规模部署的重要卡点。
在DM0.5和Realtime-VLA的支持下,Ferrata设计了一套机器人分层作业的架构,把标准自动化、具身执行和人工接管的任务进行拆分,明确日常作业分工,并实现自动化的异常管理和物理容错。

这套架构,在降低客户部署成本的同时,还通过多机器人大规模部署的方式,建立了自己的数据飞轮,结构化记录实际生产中的高质量数据,持续反哺DM系列大模型的能力进化。
如何穿越具身技术与产业周期
回到开头提到的“三座大山”,原力灵机在Action 2026开发者大会上,都给出了清晰的解法:
· 模型能力限制落地效果?就用更大的数据、更优的架构做更好的泛化性能,给具身提供更强的智能动力;
· 集成开发太复杂?就给开发者提供更易用的一站式平台,提升机器人在具体场景里的表现;
· 全时连续作业效率低?就用多机器人协作的Harness框架,把模型送进产业场景,让客户用得“多快好省”。
说白了,一个产业从出生到落地,必然要经历一个“先炼丹,再造车”的路径。技术路径逐渐收敛后,标准化、规模化就成了必须突破的桎梏。
通用具身也不能例外。要让机器人真正走进工厂、走进家庭,靠的不只是某项前沿技术的突破,而是出于对物理世界的敬畏之心,把模型、系统、场景的每一步都拆解清楚,再把每一个原子都做到最优。
要做到这个地步,一家公司靠的不能只是一时的灵感,更要有近乎执拗的耐心与坚持。只有这样,才能穿越具身行业波谲云诡的周期,以先行者和实干者的身份,长久地留在行业中,见证未来的到来。