隐式触觉世界模型:50万小时数据如何赋能机器人精细操作
在具身智能的演进历程中,视觉始终是模型感知世界的主要窗口。然而,当机器人试图完成抓取易碎品、擦拭表面或书写等需要微操的任务时,纯视觉方案往往显得捉襟见肘。视觉只能告诉我们物体“在哪里”,却无法准确传达“有多紧”、“是否滑动”或“受力如何”。这种感知盲区,一直是限制机器人从工业流水线走向家庭复杂环境的核心瓶颈。近期,BeingBeyond(智在无界)发布的Being-H0.8模型,通过引入隐式触觉世界模型架构,试图从根本上解决这一难题。这一突破不仅在于算法的创新,更在于其背后庞大且高质量的数据工程体系。
Being-H0.8的核心创新点,在于它将触觉从动作执行后的“附加反馈”,提升为“预测-执行-反馈”闭环中的前置要素。传统的世界模型通常基于当前视觉帧预测下一帧的视觉变化,而Being-H0.8则在隐空间中引入了触觉维度的预测。模型在预训练阶段,便学会了根据当前画面预判即将发生的接触事件。在执行动作时,系统实时读取触觉传感器的最新状态,并据此动态调整后续动作序列。这种机制使得机器人具备了一种类似人类“触觉预判”的能力:在手指触碰物体的瞬间,大脑(模型)已经提前规划好了如何顺应受力进行微调,而非被动等待错误发生后再纠正。
实现这一架构的关键,在于底层模型的模块化设计。Being-H0.8由混合Transformer(MoT)、慢-快动作专家、通用触觉编码器和TopoHand四大核心组件构成。其中,MoT负责在隐空间中预测交互后果,如接触位置及状态变化;慢-快动作专家则解决了实时性与计算成本的矛盾。慢速流缓存高成本的视觉和语言上下文,维持整体任务规划;快速流则专注于读取最新的触觉反馈,仅重新生成下一小段动作。这种设计既保证了任务的全局一致性,又赋予了对突发接触变化的毫秒级响应能力。
然而,架构的创新只是硬币的一面,另一面则是支撑模型训练的海量数据。Being-H0.8的数据底座源自其长期积累的人类视频数据池,总量超过50万小时,被称为UniHand-3.0数据集。这不仅是国内规模最大的人类操作视频数据池,也是目前全球罕见的超大规模第一人称交互数据集。但面对如此庞大的数据量,如何将其转化为模型可用的监督信号,是一项巨大的工程挑战。原始视频中混杂着大量无效片段、视角抖动和重复内容,且绝大多数人类视频缺乏同步的触觉和精确手部动作标注。
为了解决数据清洗与重构问题,团队构建了一套精密的处理管线。首先,通过剔除无效片段并切分长视频,补充细粒度语言描述。其次,针对缺乏手部动作标注的人类视频,团队利用MANO模型统一手部状态表示,通过HMR(手部运动细化)技术恢复裸手运动轨迹,并辅以Caliball补齐相机参数,从而从二维视频中重建出三维手部运动信息。对于机器人数据,则通过规范化URDF和统一坐标系,确保动作数据的准确性与一致性。经过这一系列标准化处理,异构数据被转化为统一格式,为后续模型训练奠定了坚实基础。
触觉数据的缺失曾是具身模型训练的“阿喀琉斯之踵”。既然大多数人类视频没有触觉标注,如何获得触觉监督信号?Being-H0.8提出了一个极具创意的解决方案:TactoHand。该模块旨在从普通人类视频中恢复稠密的伪触觉监督。TactoHand并不依赖真实的触觉传感器,而是利用手与物体之间的三维几何关系来推断接触。在带有三维标注的数据集中,系统计算手部网格顶点与物体表面的距离及法向夹角,从而判断接触是否发生。在此基础上,TactoHand在MANO手部表面的778个顶点上预测两类信息:接触标注(是否碰到物体)和邻近度标注(手指靠近物体的连续过程)。该模型基于3010万帧数据训练,并引入时序信息以消除视角重叠带来的误判。通过这种方式,海量无触觉标注的视频被赋予了隐式的触觉信号。
仅靠视觉推断的接触信息显然不足以模拟真实的物理交互。为了弥补压力、摩擦、滑移等物理细节的缺失,UniHand-3.0引入了约55小时、540万帧的真实压力手套数据。这些真实传感器数据被投影到统一的MANO手部表面,与视觉推断的接触信息形成互补。视觉数据覆盖广泛的场景和动作,而真实触觉数据则提供高精度的物理反馈。这种“伪触觉+真触觉”的混合训练策略,极大地丰富了模型的物理感知维度。
不同来源的触觉数据格式各异:有的仅标记接触与否,有的提供指尖传感器读数,有的包含逐顶点压力信息,且存在大量缺失通道。为了解决这一异构问题,团队设计了通用触觉编码器。该编码器在统一的手部拓扑上建立了一套由粗到细的触觉金字塔,从整手接触到逐顶点压力,不同粒度的数据均可映射至对应空间。每个触觉Token不仅包含接触或压力信息,还携带三维位置、拓扑位置、左右手标记及有效性标识。特别是有效性标记,解决了“无传感器读数”与“零压力读数”的语义歧义。通过Perceiver架构,长短不一、密度不同的触觉输入被压缩为固定数量的Token,实现了输入的统一化。
触觉表示统一后,跨本体动作空间的对齐成为最后一道难关。人手、灵巧手和平行夹爪在几何结构和自由度上差异巨大。Being-H0.8提出的TopoHand模块,并未强行将所有手型改造为同一结构,而是建立了一套通用的动作语言。它将手部表示拆解为手腕位姿、形态编码、20个规范关节角和夹爪张开量,使得语义相近的动作(如捏、抓、松)在不同的本体上能够映射到相同的表示槽位。这一设计打通了人类视频与机器人控制之间的动作鸿沟,使得模型能够从人类操作中迁移学习,并复用到不同的机器人硬件上。
在真实双臂机器人实验中,Being-H0.8展现了其在高难度精细任务中的卓越性能。在包中取物任务中,机器人能透过布料感知内部物体的轮廓,调整抓取姿态以避免勾住边缘;在毛笔写字任务中,模型能根据笔尖与纸面的压力变化,实时调整下压力度,确保字迹流畅且不破纸;在挤牙膏任务中,机器人能感知软管变形的反馈,精准控制挤压力度,避免牙膏溢出;在夹薯片任务中,模型能通过触觉判断薯片的易碎性,轻柔地夹取而不使其碎裂。这些任务共同的特点是高度依赖触觉反馈,且对力度控制要求极高,纯视觉模型很难胜任。
Being-H0.8的发布,标志着智在无界在具身智能领域完成了从“验证可行性”到“规模化应用”再到“高质量精细化”的三步跨越。创始人卢宗青及其团队在早期阶段解决了人类视频预训练的可行性问题,中期解决了跨本体学习和数据规模化的问题,而在Being-H0.8阶段,重点转向了从海量视频中提取高价值的物理经验。这一转变意味着,具身智能的核心竞争力不再仅仅是数据的体量,而是数据清洗、动作恢复、触觉标注及世界建模的全链路整合能力。
尽管取得了显著进展,隐式触觉世界模型仍面临诸多挑战。首先,TactoHand推断的伪触觉数据虽然覆盖面广,但在极端形变或透明物体交互中,其准确性仍可能低于真实传感器。如何进一步提升几何推断的物理真实性,是后续优化的重点。其次,隐空间中的触觉表示是否完全捕捉了复杂的物理规律,尚需更多长程、动态交互任务的验证。此外,50万小时的数据积累虽庞大,但如何进一步挖掘长尾场景下的极端案例,以增强模型的泛化能力,也是值得探索的方向。
从更宏观的视角来看,Being-H0.8代表了AI从“感知智能”向“行动智能”深化的趋势。世界模型不再仅仅是预测视觉像素的变化,而是开始理解物理世界的交互本质。触觉的引入,使得机器人能够像人类一样,通过“手”去探索和理解世界。这种能力的跃升,将推动机器人在医疗手术、精密制造、家庭服务等领域的广泛应用。未来,随着触觉数据标准的统一和更多跨模态模型的涌现,具身智能将逐渐摆脱“盲操”的局限,进入一个具备全面物理感知的新阶段。这不仅是算法的胜利,更是数据工程与物理世界深度融合的必然结果。