隐式触觉重塑具身智能:50万小时视频如何训练出首个触觉世界模型?

0 阅读

在具身智能(Embodied AI)的演进图谱中,视觉长期以来占据着绝对的主导地位。大多数世界模型(World Models)能够精准预测物体的位移、形变甚至光影变化,但在处理“接触”这一物理交互的核心环节时,往往显得力不从心。它们能看到手伸向杯子,却难以预测手指接触杯壁时的微小形变或打滑风险。直到BeingBeyond智在无界发布Being-H0.8,这一局面才被打破。作为首个基于人类视频数据的隐式触觉世界动作模型,Being-H0.8不仅将触觉纳入隐空间表示,更通过50万小时的高质量视频数据,构建了一套从“预测”到“执行”再到“反馈”的完整闭环。这不仅是算法层面的创新,更是数据工业化处理的典范。

要理解Being-H0.8的突破性,首先需要厘清传统世界模型在触觉感知上的盲区。现有的视觉主导模型大多以像素重建或状态预测为目标,它们擅长回答“物体接下来会去哪里”,却无法回答“接触发生时力量如何分布”。触觉传感器的数据形态极其异构:有的提供离散的二值接触信号,有的输出连续的压力矩阵,还有的仅记录指尖的相对距离。这种非标准化的数据格式,加上大规模人类视频数据中普遍缺失触觉标注的现状,使得训练具备触觉能力的具身模型成为一道难以跨越的鸿沟。Being-H0.8的解决方案并非简单地堆砌传感器数据,而是通过“隐式触觉”的概念,让模型在缺乏显式触觉标注的情况下,学会从视觉线索中推断接触与受力状态。

该模型的核心架构由四个紧密协作的模块组成:负责预测交互后果的混合Transformer(MoT)、兼顾推理效率与实时调整的慢—快动作专家、统一触觉输入的通用触觉编码器,以及对齐多类动作空间的TopoHand。其中,MoT模块不再试图在像素层面重建未来每一帧画面,而是聚焦于隐空间中与任务强相关的交互后果,如接触发生的位置、力度的变化趋势。这种“隐式预测”大幅降低了计算冗余,使模型能够将算力集中在关键的物理交互判断上。

在控制策略上,Being-H0.8采用了独特的“慢—快”双流架构。慢速流负责缓存视觉、语言和全局任务状态等高成本上下文,维持长期动作计划的连贯性;快速流则在动作执行过程中,实时读取最新的触觉反馈和机器人状态,仅对接下来的一小段动作进行重算。这种机制使得机器人能够在遭遇突发接触(如抓取物体时发生滑动)时,无需重新规划整个任务,只需微调末端执行器的姿态或力度即可纠正偏差。例如,在执行“夹取薯片”任务时,快速流能根据指尖压力的微小变化,瞬间调整夹持力度,既防止夹碎物体,又避免滑落。

支撑这一先进模型的是被业界誉为“国内规模最大”的人类操作视频数据池——UniHand-3.0。智在无界汇聚了超过50万小时的第一人称视频数据,这些数据覆盖了自然物体交互、长时程任务及丰富手部动作。然而,原始视频并非直接可用的燃料。团队构建了一套复杂的数据处理管线,首先剔除无效片段,将长视频切分为语义完整的短片段,并辅以细粒度语言描述。对于手部状态,团队利用MANO模型和HMR技术,从裸手视频中恢复出高精度的运动轨迹;对于机器人数据,则统一了URDF规范、关节约定及相机坐标系。

最具挑战性的一步,是从无触觉标注的人类视频中“无中生有”地恢复触觉信息。Being-H0.8提出了TactoHand方案,其核心思路是利用三维几何关系推断接触。通过在21个人—物交互数据源上训练的3010万帧数据,TactoHand能够预测手部778个顶点上的接触标注和邻近度标注。它不仅能判断“是否接触”,还能描述“从靠近到接触”的连续过程。更重要的是,TactoHand引入了时序信息,有效避免了单帧视觉中因视角重叠导致的误判。

为了弥补几何推断在物理细节上的不足,UniHand-3.0还融合了约55小时、540万同步帧的真实压力手套数据。这些真实传感器数据被投影到统一的MANO手部表面,为模型提供了压力、摩擦及材质反馈等关键物理信息。视觉推断负责覆盖海量的场景多样性,而真实触觉数据则提供了精确的物理Ground Truth,二者形成了完美的互补。

在数据统一阶段,通用触觉编码器(Universal Tactile Encoder)发挥了关键作用。它将不同来源、不同粒度的触觉信号映射为一个由粗到细的触觉金字塔,从整手接触到指尖压力,再到逐顶点状态。每个触觉Token不仅包含物理信息,还携带三维位置、拓扑结构及有效性标记。特别是“有效性标记”的设计,巧妙地区分了“无传感器信号”与“零压力读数”,避免了模型对缺失数据的错误学习。最后,TopoHand模块将人手、灵巧手和平行夹爪的动作空间对齐,使得不同本体上的相似语义动作能够进入相同的表示槽位,极大地提升了模型的泛化能力。

Being-H0.8的成功,标志着智在无界在具身智能路线上完成了从“验证可行性”到“规模化应用”,再到“高质量物理经验提取”的三次跨越。创始人卢宗青及其团队指出,未来的核心壁垒不再仅仅是拥有多少视频数据,而是能否将数据清洗、动作恢复、触觉标注、世界建模与控制链路完整打通。Being-H0.8在真实双臂机器人实验中完成的包中取物、毛笔写字、挤牙膏等高难度任务,证明了隐式触觉世界模型在复杂精细操作中的巨大潜力。

这一进展不仅为具身智能提供了新的技术范式,也为行业解决多模态数据融合难题提供了可借鉴的工程实践。随着触觉感知能力的增强,机器人将不再只是环境的“观察者”,而是能够深刻理解物理交互本质的“参与者”。未来,随着更大规模视频数据的积累和模型架构的进一步优化,隐式触觉世界模型有望在医疗手术辅助、精密装配及家庭服务机器人等领域发挥关键作用,推动具身智能从实验室走向更广泛的实际应用场景。