触觉锚定世界模型:具身智能的物理交互脑如何突破灵巧操作瓶颈?

1 阅读

灵巧操作的本质:脑而非手

“The dexterity of a hand is mostly about the brain, not the hand.” 这句出自卡内基梅隆大学教授、全球机器人灵巧操作领域奠基人Matthew Mason之口的名言,精准地揭示了当前具身智能发展的核心矛盾。当机器人硬件日益精密,机械手拥有越来越多的自由度与传感器时,我们却发现,它们依然难以在真实世界中完成那些对人类而言轻而易举的动作——比如稳稳握住一个纸杯而不捏扁,或是将USB插头准确插入接口而不损坏。

图片

问题究竟出在哪里?答案或许并不在于那只“手”,而在于驱动它的“脑”。传统机器人依赖预设程序或视觉引导,但真实世界的物理交互充满不确定性:物体的材质、形变、摩擦力、滑移等细微变化,视觉无法捕捉,而触觉才是感知这些物理属性的关键通道。然而,长期以来,触觉在机器人模型中的应用却远远落后于视觉和语言,原因在于“手感”难以量化与建模。

图片

戴盟机器人于2025年8月发布的全球首个触觉锚定世界模型Daimon-TWM,正是对这一问题的直接回应。该模型以原生触觉为核心,构建了一个能够理解物理接触、预测交互动态、并实时调整动作的“物理交互脑”。在多项高难度接触密集型任务中,Daimon-TWM的平均成功率达到了64.0%,在扰动环境下更是比现有最优模型π0.5高出十倍。这不仅是技术指标的提升,更标志着机器人从“看见再行动”向“接触即理解”的范式转变。

图片

触觉为何难以被模型理解?

图片

触觉的重要性在业界已达成共识。例如,李飞飞团队近期发表的T-Rex论文就证明了触觉能显著提升机器人的操作能力。其逻辑并不复杂:拿起一个纸杯时,视觉能告诉我们杯子的位置和形状,却无法告知该用多大的力。杯壁是否形变?杯子是否滑动?手指施加的力是否足够?继续用力会不会捏扁杯子?这些问题的答案,只有通过触觉才能获得。视觉负责“看见”世界,而触觉负责“与世界交互”。

图片

然而,触觉数据却出了名的难以描述。当我们描述拿起一个杯子的手感时,涉及软硬、摩擦、形变、滑移等多个维度。以软硬为例,“软”和“硬”只是两个极端,真实世界更多是“很软”“偏软”“较硬”等连续的程度区分。这种细微差异难以用语言精确表达,照片也无法呈现,却直接决定了操作的成功率。例如,一个视觉上看似坚硬的塑料杯,实际可能因材质而偏软,若模型仅依赖视觉,就可能施加过大的力导致杯子变形。

戴盟机器人首先解决的正是“让机器人读懂触觉”这一基础问题。Daimon-TWM学习了覆盖上万种物体、跨不同材质的1000多万组物理交互数据,将原始触觉中的受力、形变、摩擦等复杂变化转化为模型可理解的统一物理语义。更重要的是,它训练模型依据触觉完成“感知—比较—结论”的推理过程。这种能力在视觉与触觉冲突时尤为关键:视觉可能将橡胶误判为塑料,或将带图案的光滑表面误判为粗糙纹理。只有真正理解触觉的模型,才能准确判断物理属性与状态,从而规划下一步操作。

图片

在物理认知的九项核心指标测试中,Daimon-TWM全部取得第一,综合得分达60.1分,领先触觉专用模型SToLa 12.6分,领先GPT-4o 24.7分。这揭示了一个常被忽视的事实:通用大模型虽然读过海量文字、看过无数图片,却从未真正“摸”过一个物体。而真实的物理智能,必须从一次次接触中生长出来。

图片

从预测画面到预测交互

图片

如果说物理常识是地基,那么Daimon-TWM真正的杀手锏在于“预测”。在李飞飞的T-Rex中,触觉能在接触发生后帮助模型及时纠偏。但现实世界的物理交互没有“撤销”键:齿轮怼歪了、杯壁捏裂了,就再也回不去了。真正灵巧的机器人不能等错误发生后再纠正,而应在交互的动态过程中提前预见风险,通过预测进行最优规划。

这正是Daimon-TWM超越现有模型之处。当全行业都在用世界模型预测下一帧画面时,戴盟将世界模型的能力迁移到了触觉领域:交互尚未发生,模型已提前推演出未来的动态变化。通过统一触觉表征、触觉思维链(T-CoT)以及由粗到细的未来触觉预测机制,Daimon-TWM能够围绕接触阶段、接触状态和潜在失败风险进行推演。更精妙的是,它并非让机器人始终盯着触觉,而是在接触变得密集时,动态调整各表征的权重,让触觉成为判断下一步动作的关键证据。

图片

在双齿轮装配任务中,模型预测的触觉变化与实际测量值几乎完全重合。这一高难度任务要求依次插入两个大小不同的齿轮,并让齿牙严丝合缝地咬合,对纯视觉模型而言几乎不可能完成。而Daimon-TWM凭借“未卜先知”的能力,成功完成了任务。

慢规划与快纠偏的协同

现实中的物理交互常伴随各种扰动,变化往往发生得极快。模型除了预判能力,还必须在瞬间接收反馈并调整动作。为此,Daimon-TWM采用了“慢规划、快纠偏”的分层机制:上层负责理解任务并预判整体策略,底层的触觉-动作控制器则以100Hz的高频伺服,根据实时触觉反馈进行毫秒级修正。

这一架构形成了从指尖感知到大脑推理,再返回脊髓控制的“触觉神经系统”,构成完整闭环:理解当前接触→预测未来变化→规划下一步动作→实时感知结果→高频修正动作。戴盟公布的消融实验证明,去掉任何一环都会导致成功率下滑,这体现了系统性优势。

以USB插入任务为例,视觉负责寻找大致位置,但真正插入时,必须依靠触觉判断是否对齐。如果一侧受力突然增强,意味着USB可能偏斜,模型必须立即抬起、调整角度,而不是“硬怼”。插到底后,模型感觉到USB与接口的接触,必须及时停下,避免损坏接口。整个过程包含“找到-插入-停止”,每一步都依赖触觉赋予的认知、预判和瞬时反应能力。

擦拭花瓶任务同样如此:海绵既要始终贴住凹凸的曲面,又不能施加过大的力。当花瓶位置突然改变,原本规划好的轨迹立即失效,Daimon-TWM必须一边预测接触状态的变化,一边通过高频控制持续修正动作,才能稳稳跟住不断变化的花瓶完成作业。

扰动环境下的分水岭

在接触密集型操作任务中,无扰动条件下,Daimon-TWM的成功率为64%,而π0.5仅为26%;但在有干扰时,Daimon-TWM仍能保持53%的成功率,而π0.5骤降至6%。这组数据揭示了真正的分水岭:机器人能否在充满意外的真实世界中随机应变,而非仅仅执行标准动作。

图片

在调整(铅笔、试管)、擦拭(黑板、花瓶)、插入(USB、插头)、齿轮装配等多项任务中,Daimon-TWM均展现出显著优势。这种“边做、边判断、边恢复”的能力,正是机器人走向真实世界的关键。

物理智能的基石:Physical AI Infra

Daimon-TWM的能力并非仅来自模型结构,而是诞生于戴盟长期构建的Physical AI Infra。从触觉传感器到数据采集网络、数据处理管线,再到物理交互能力评测基准,戴盟构建了一套可持续生产高质量真实交互经验的物理智能基础设施。

其中,自研的多维高分辨率高频率视触觉传感器,可完整获取切向力、法向力、摩擦、滑移、纹理等多项触觉模态,提供高质量全模态的触觉数据。超百万小时规模的含触觉多模态物理世界数据集Daimon-Infinity,则为模型提供了源源不断的训练燃料。今年4月,戴盟已在阿里魔搭社区开源部分数据,目前获得超440万次下载,位列魔搭社区物理世界数据集第一名。

图片

这套基础能力源于戴盟贯穿学术研究与产业落地的“触觉操作基因”。创始人兼首席科学家王煜,身为全球机器人操作领域权威,在斯坦福大学发布的“终身科学影响力排行榜”和“年度科学影响力排行榜”中均位列全球前1%。今年6月的ICRA大会上,王煜发表《Touch Physical AI》主题演讲,提出以触觉驱动具身模型的物理交互能力,获得行业广泛认可。另一位创始人兼CEO段江哗,作为国内最早一批机器人操作研究人员,长期活跃于科研、创业与产业实践一线。主导模型研究的首席AI科学家原玮浩,长期研究具身智能与多模态大模型,曾任阿里通义实验室多模态大模型研究专家,在NeurIPS、ICLR、CVPR、ICRA等顶级会议发表论文40余篇。

图片

给机器人装上“物理交互脑”

回到Mason的那句话:“The dexterity of a hand is mostly about the brain, not the hand.” Daimon-TWM真正值得关注的,不只是某几项任务成功率的提升,而是它以触觉锚定,全方位提升了机器人的认知、预测、决策和控制能力。从“看见再行动”,到“接触后反应”,再到“预测接触、主动调整”,机器人正在从执行预设动作,走向真正意义上的物理交互。

语言模型的奇迹来自互联网上的万亿文本,而物理智能的奇迹,或许将来自每一次真实的触碰。当机器人具备真正懂得物理交互的“物理交互脑”,具身智能的ChatGPT时刻,可能比我们想象的更近。