隐式触觉世界模型突破:50万小时视频如何赋予机器人“触觉”?
在具身智能的演进历程中,视觉一直被视为核心感知模态。然而,视觉存在天然的局限性:它擅长捕捉物体的外观、位置和运动轨迹,却难以精确感知接触力、摩擦系数、材质硬度以及细微的滑动。对于需要精细操作的任务,如拧开瓶盖、从包装袋中取出易碎物品或进行毛笔书法创作,仅靠视觉往往会导致操作失败或损坏物体。触觉,作为人类探索物理世界最细腻的工具,一直是机器人领域的“圣杯”。如何让大模型拥有触觉,成为当前学术界和工业界争夺的高地。近日,BeingBeyond(智在无界)发布的Being-H0.8,提出了一套基于人类视频数据的隐式触觉世界动作模型解决方案,试图从根本上解决这一难题。
Being-H0.8的核心突破在于,它首次将触觉模态完整纳入隐空间表示中,构建了一个能够“预测—执行—反馈”闭环的隐式触觉世界-动作模型。与以往仅依赖视觉预测后续画面的模型不同,Being-H0.8让机器人能够在动作执行前预判接触风险,并在接触发生后,根据实时的触觉反馈动态调整后续动作。这一架构不仅提升了机器人的操作精度,更使其在处理非刚性物体和复杂接触场景时表现出类人的灵活性。
隐式触觉架构:从视觉预测到触觉交互
传统的世界模型通常以视觉为核心,旨在重建或预测未来的视觉帧。然而,这种像素级的重建计算成本高昂,且往往忽略了物理交互的关键细节。Being-H0.8采用了隐式建模策略,不再执着于生成逼真的未来画面,而是专注于预测与任务交互相关的潜在状态变化。这意味着模型学会了在隐空间中理解“接触”这一物理概念,包括是否发生接触、接触位置以及预期的受力结果。
该模型由四个关键模块协同工作:混合Transformer(MoT)、慢-快动作专家、通用触觉编码器以及TopoHand动作对齐模块。其中,MoT负责预测交互后果,而慢-快动作专家则兼顾了推理效率与实时调整能力。慢速流负责缓存视觉、语言和整体任务规划等上下文信息,维持宏观的任务一致性;快速流则在动作执行过程中,高频读取最新的机器人状态和触觉传感器数据,仅对接下来的一小段动作进行重新规划。这种架构使得机器人无需在每次触觉变化时都重新计算整个动作序列,从而实现了对滑动、受力突变等突发状况的毫秒级响应。
在训练阶段,模型利用未来时刻的触觉Token作为监督信号,学习真实接触发生后世界状态的变化规律。在部署阶段,MoT提前预测潜在的交互结果,慢速流保持全局视野,快速流则依据实时触觉纠偏。这种设计使得触觉不再是动作完成后的事后反馈,而是深度融入了机器人的决策核心,实现了从“看”到“摸”的跨越。
数据基石:50万小时人类视频的精细化挖掘
模型的强大能力源于海量且高质量的数据。Being-H0.8的数据底座建立在智在无界积累的超过50万小时第一人称人类视频数据之上,这构成了目前国内规模最大的人类操作视频数据池。然而,原始视频数据中充斥着无效片段、镜头抖动、视角偏差以及缺乏有效操作的信息,直接用于训练效果不佳。为此,团队构建了一套复杂的数据处理管线,对原始数据进行过滤、去重、切分和标准化,最终形成UniHand-3.0数据集。
这一数据工程的核心挑战在于,大规模人类视频通常缺乏触觉标注,且不同来源的数据在场景、任务分布和动作表达上存在巨大差异。为了统一这些数据,团队引入了MANO手部模型和HMR手部运动细化技术,从视频中恢复并标准化手部运动轨迹。对于机器人数据,则通过重新整理URDF规范,统一关节约定和坐标系,实现了跨本体数据的对齐。
尽管数据清洗和标准化解决了视觉和动作的统一问题,但触觉信息的缺失仍然是主要瓶颈。大多数视频并未同步记录触觉信号,这使得直接训练具备触觉能力的模型成为不可能。Being-H0.8的创新之处在于,它提出了一套从视频中“推断”和“补充”触觉信息的技术路线,将无触觉标注的视频转化为可训练的多模态数据。
TactoHand:从视觉中恢复隐式触觉
为了解决触觉数据匮乏的问题,团队提出了TactoHand,一种能够从普通人类视频中预测稠密伪触觉监督的模型。TactoHand的核心逻辑是:即使没有物理传感器,手与物体之间的几何关系也蕴含着丰富的接触信息。通过在带有三维标注的数据集中计算手部网格与物体表面顶点之间的距离和法向夹角,TactoHand能够判断接触是否发生以及接触的位置。
在训练过程中,TactoHand在MANO手部表面的778个顶点上预测两类信息:接触标注(是否发生接触)和邻近度标注(手指接近物体的连续过程)。该模型在3010万帧数据上训练,并引入时序信息以消除视角重叠带来的误判。训练完成后,TactoHand可应用于UniHand-3.0中的普通视频,通过重建手部运动并将预测的接触信息映射到统一拓扑,从而生成大规模的隐式触觉标签。对于重建不可靠的区域,系统会标记为无效,避免了噪声数据的干扰。
然而,几何推断无法替代真实的物理感知。为了提供更准确的压力、摩擦和材质信息,UniHand-3.0还融合了约55小时、540万帧的压力手套真实传感器数据。这些真实触觉信号被投影到同一套MANO手部表面,与大规模视频数据形成互补。视频数据提供了丰富的场景和动作多样性,而真实传感器数据则提供了精准的物理反馈,两者结合使得模型既能泛化,又能精确。
通用触觉编码与动作对齐:统一多模态表征
有了触觉数据,如何统一不同来源、不同粒度的触觉信号是一个关键难题。有些数据仅包含二值接触标签,有些来自稀疏的指尖传感器,有些则是密集的顶点压力图。为此,Being-H0.8设计了通用触觉编码器(Universal Tactile Encoder),在统一手部拓扑上建立了一套由粗到细的触觉金字塔。
该编码器能够从整只手是否接触,细化到具体区域、指尖,直至逐顶点的压力分布。每个触觉Token不仅包含接触或压力信息,还携带三维位置、拓扑位置、左右手标识以及有效性标记。有效性标记至关重要,因为它区分了“无传感器”和“零读数”,避免了模型对缺失数据的错误解读。通过Perceiver结构,编码器将长度和密度各异的触觉输入压缩为固定数量的Token,实现了跨设备、跨数据源的统一表示。
此外,模型还通过TopoHand模块解决了人手、灵巧手和平行夹爪之间的动作空间鸿沟。不同本体在几何结构和自由度上差异巨大,TopoHand将手部表示分解为手腕位姿、形态编码、20个规范关节角和夹爪张开量,使语义相近的动作在不同本体上进入相同的表示槽位。这种对齐并非改变硬件结构,而是建立了一套通用的“动作语言”,使得基于人类视频学习的经验能够高效迁移到各类机器人平台上。
技术演进与未来展望
Being-H0.8的发布标志着具身智能数据路线的一次重要转向。BeingBeyond的技术演进经历了三个阶段:从验证人类视频预训练的可行性,到解决海量异构数据的规模化利用,再到如今追求高质量物理经验的提取。Being-H0.8不再单纯追求数据量的增加,而是通过清洗、动作恢复、触觉标注和表征统一,从原始视频中挖掘出更精准、更具物理意义的训练信号。
这一突破不仅体现在模型架构的创新,更体现在完整数据链路的构建上。从视频收集、清洗、动作恢复、触觉标注到世界建模与机器人控制,BeingBeyond展示了一条可落地的技术路径。在真实双臂机器人实验中,Being-H0.8成功完成了包中取物、毛笔写字、挤牙膏、夹薯片等高难度任务,证明了其处理精细触觉操作的能力。
未来,随着触觉感知技术的进一步成熟和数据的积累,基于隐式触觉的世界模型有望成为具身智能的基础设施。这不仅将提升机器人的操作精度,还将推动其在医疗手术、精密制造、家务劳动等对触觉敏感领域的广泛应用。Being-H0.8的出现,为机器人赋予“触觉”提供了一条高效且可扩展的新路径,标志着具身智能正从“看懂世界”迈向“感知世界”的新阶段。