比李飞飞的T-Rex更进一步:戴盟给机器人装上了「物理交互脑」
"The dexterity of a hand is mostly about the brain, not the hand."

这是 “全球机器人灵巧操作之父” Matthew Mason 写在个人主页上的一句话:
灵巧操作在于脑,而不在手
Matthew Mason 为卡内基梅隆大学教授,他开创了研究机器人操作领域的研究,门下学生遍布全球机器人研究机构与行业巨头。图片来源:www.ri.cmu.edu
这句话正好解释了今天具身智能的关键问题:机器人正在拥有越来越复杂的手,但当机器人真正进入现实世界,
这双灵巧手却并不等于真正的灵巧操作。
问题或许从来都不只在 “手” 上。具身真正缺乏的,是一个懂物理、懂交互、能够驱动这双手的 “脑”。
8 月 10 日,戴盟机器人正式发布
全球首个触觉锚定世界模型 Daimon-TWM
物理交互脑
Daimon-TWM 技术与架构介绍
都知道触觉重要,为什么机器人还是 “摸” 不懂?
触觉是机器人操作能力的关键 —— 这在今年已经成为行业共识。例如不久前李飞飞署名的论文 T-Rex,证明了触觉可以提高机器人的操作能力。
这里的逻辑其实不难理解。拿起一个纸杯时,眼睛可以告诉我们杯子在哪里、是什么形状,却无法直接告诉我们该用多大的力。
视觉负责看见世界,触觉才负责与世界进行交互
那为什么触觉仍未大规模应用到具身模型?因为 “手感” 是出了名的说不清。
当我们描述拿起一个杯子的手感时,需要
涉及软硬、摩擦、形变、滑移等多个维度
真实世界更多是 “很软”“偏软”“较硬” 这种连续的程度区分
视觉相似的物品,模型必须学会通过触觉判别其物理属性
因此,戴盟首先解决的并不是 “让机器人怎么动”,而是
让机器人真正读懂触觉
Daimon-TWM 学习了覆盖上万种物体、跨不同材质的 1000 多万组物理交互数据,将原始触觉中的受力、形变、摩擦等复杂变化转化为模型可理解的统一物理语义。
更重要的是,它不满足于让模型 “猜答案”,而是训练模型
依据触觉完成 “感知 — 比较 — 结论” 的推理过程
Daimon-TWM 能够根据触觉推理物体的物理属性
换句话说,
机器人获得的不再只是简单的触觉模态输入,而是一套关于物理世界的常识。
Daimon-TWM 在物理认知多项核心指标上均取得最优成绩
这也揭示了一个容易被忽视的问题:通用大模型读过海量文字、看过无数图片,却从未真正 “摸” 过一个物体 —— 但
真实的物理智能,最终还要从一次次接触中生长出来。
从预测下一帧画面,到预测下一刻交互
如果说物理常识是地基,那 Daimon-TWM 真正的杀手锏,是
预测
在李飞飞的 T-Rex 中,触觉可以在接触发生后帮助模型及时纠偏。然而,
现实世界的物理交互没有 Ctrl+Z
应该在交互的动态过程中提前看到风险,通过预测进行最优规划
这正是 Daimon-TWM 更进一步的地方。当全行业都在用世界模型预测下一帧画面时,
戴盟把世界模型的能力迁移到了触觉
双齿轮装配任务中,预测触觉信号(上)与实测触觉信号(下)高度相似;图片来源:参考技术报告 [2]
借助统一的触觉表征、触觉思维链(T-CoT),以及一套由粗到细展开的未来触觉预测机制,
Daimon-TWM 可以围绕接触阶段、接触状态和潜在失败风险持续推演
只有在机器人真正接触到物体、接触信息开始密集涌现时,才动态调整各类表征的权重
在结果对比里,模型预测的触觉变化与实际测量值几乎完全重合。凭借 “未卜先知” 的能力,Daimon-TWM 完成了
双齿轮装配
想得更远,也要反应够快
现实中的物理交互可能会遇到各种扰动,变化往往发生得非常快,模型除了预判能力,还必
须能在瞬间接收反馈,及时调整动作
为此,Daimon-TWM 采用了 “
慢规划、快纠偏
Daimon-TWM 模型架构图
三大模块协同互作,
形成了从指尖感知到大脑推理,再返回脊髓控制的 “触觉神经系统”
理解当前接触 → 预测未来变化 → 规划下一步动作 → 实时感知结果 → 高频修正动作。
戴盟公布的消融实验证明了这是一套系统性优势,去掉任何一项都会导致成功率下滑。随模型发布的接触密集型操作 demo,更把这套能力翻译成了肉眼可见的画面。
消融实验:以 USB 插拔成功率验证 Daimon-TWM 的系统性优势
比如
USB 插入
模型必须立即抬起、调整角度,而不是 “硬怼”
必须及时停下,避免损坏接口。
插入 USB 时,模型能够根据实时触觉反馈调整位置和用力
擦拭花瓶同样如此
Daimon-TWM 必须一边预测接触状态的变化,一边通过高频控制持续修正动作
随机人为扰动,改变花瓶位置,模型根据顺势反馈和预测规划能力,迅速调整擦拭轨迹
这也解释了开头那组数据里最重要的部分:在接触密集型操作任务中,无扰动条件下,Daimon-TWM 的 64% 对 π0.5 的 26% 已经足够引人注目;
但有干扰时的 53% 对 6% 才是真正的分水岭
在调整(铅笔、试管)、擦拭(黑板、花瓶)、插入(USB、插头)、齿轮装配等多项任务中,Daimon-TWM 与 π0.5 成功率对比(cln:无扰动;ptb:有扰动)
边做、边判断、边恢复,这才是机器人走向真实世界的关键。
真正的物理智能,拼的不止是模型
Daimon-TWM 的能力并非仅仅来自模型结构,而是诞生于
戴盟长期构建的 Physical AI Infra
从触觉传感器,到数据采集网络、数据处理管线,再到物理交互能力评测基准,戴盟构建了一套
可持续生产高质量真实交互经验的物理智能基础设施。
其中,自研
多维高分辨率高频率视触觉传感器
超百万小时规模的含触觉多模态物理世界数据集 Daimon-Infinity
魔搭社区主页截图
链接:https://modelscope.cn/datasets/daimonrobotics/Daimon-Infinity
这套基础能力,源于戴盟贯穿学术研究与产业落地的 “触觉操作基因”:
戴盟创始人兼首席科学家
王煜
以触觉驱动具身模型的物理交互能力
另一位创始人兼 CEO 段江哗,是国内最早投身机器人操作研究的一批研究者之一,长期站在科研、创业和产业实践的第一线。负责模型研究的首席 AI 科学家原玮浩,则持续深耕具身智能与多模态大模型方向,曾担任阿里通义实验室多模态大模型研究专家,在大模型领域积累了相当扎实的经验,并已在 NeurIPS、ICLR、CVPR、ICRA 等人工智能顶级会议发表 40 余篇论文,其中包括多篇 Oral 和 Highlight。
给机器人装上 “物理交互脑”
回到 Mason 的那句话:“The dexterity of a hand is mostly about the brain, not the hand.”
Daimon-TWM 真正值得关注的,不只是某几项任务成功率的提高,而是它
以触觉锚定,全方位提升机器人的认知、预测、决策和控制能力
从 “看见再行动”,到 “接触后反应”,再到 “预测接触、主动调整”,机器人正在从执行预设动作,走向真正意义上的物理交互。
语言模型的奇迹,来自互联网上的万亿文本;而物理智能的奇迹,或许将来自每一次真实的触碰。
当
机器人具备真正懂得物理交互的 “物理交互脑”
相关技术报告:
https://arxiv.org/pdf/2605.27154
https://arxiv.org/pdf/2606.31723