50万小时视频训练触觉世界模型:隐式触觉如何重塑机器人灵巧操作?
触觉缺失:具身智能进化的最后一块拼图
在具身智能(Embodied AI)的发展路径上,视觉曾长期占据绝对主导地位。现有的世界模型大多依赖视觉预测来理解物理世界的动态变化,它们能精准捕捉物体的移动轨迹、形变过程以及场景的空间关系。然而,视觉存在天然的局限性:它难以准确判断接触是否真正发生、接触点位于何处,更无法感知接触瞬间的力度、摩擦系数及物体的受力反馈。
对于需要精细操作的任务,如从杂乱包袋中取出易碎品、毛笔书写时的笔锋控制或挤牙膏时的力度调节,仅靠视觉信息是远远不够的。触觉传感器虽然种类繁多,但其数据形态、采样频率和表征方式各不相同,导致数据难以标准化。更严峻的现实是,目前市面上绝大多数大规模人类视频数据集和机器人数据集,并未同步记录高质量的触觉信息。这种数据层面的“断层”,使得构建具备触觉能力的世界模型成为行业难题。
BeingBeyond智在无界近期发布的Being-H0.8,正是针对这一痛点提出的系统性解决方案。作为首个基于人类视频数据的隐式触觉世界动作模型,它不仅在架构上进行了创新,更在数据工程层面实现了突破,将触觉从“事后反馈”转变为“预判与执行”的核心环节。
隐式触觉架构:预测、执行与反馈的闭环
Being-H0.8的核心创新在于其架构设计,它不再试图在像素层面重建未来画面,而是致力于在隐空间(Latent Space)中预测与任务交互直接相关的后果。这种隐式建模方式极大地降低了计算复杂度,同时保留了关键的物理交互信息。
该模型由四个核心模块构成,形成了一个高效的协同系统。首先是混合变换器(Mixture of Transformers, MoT),它负责预测交互后果,理解真实接触发生后世界状态的变化规律。其次是慢-快动作专家架构,旨在平衡推理效率与实时反馈需求。慢速流缓存视觉、语言和隐世界状态等高成本上下文,维持整体任务规划;快速流则在动作执行过程中,读取最新的触觉反馈,仅重新生成接下来的一小段动作。这种设计使得机器人无需每次触觉变化都重新计算完整计划,却能迅速对滑动、受力偏移做出纠偏。
此外,通用触觉编码器(Universal Tactile Encoder)负责将不同传感器采集的信号转换为统一的触觉Token,而TopoHand则统一了不同本体(人手、灵巧手、平行夹爪)的动作空间。在训练阶段,MoT利用后验分支学习触觉Token与状态变化的关联;在部署阶段,模型通过实时读取触觉反馈,动态调整后续动作指令。触觉由此真正融入了“预测—执行—调整”的完整闭环。
50万小时数据池:从原始视频到高质量训练集
模型的能力上限取决于数据的质量和规模。Being-H0.8背后的数据底座是智在无界长期积累的成果,涵盖了超过50万小时的第一人称人类视频数据,这是目前国内规模最大的同类数据池。然而,原始视频并非直接可用的训练数据。
团队构建了复杂的数据处理管线,对原始数据进行清洗、去重、切分和语言标注。剔除无效片段、镜头抖动以及与物体交互无关的内容后,剩余数据被切分为连续短片段并补充细粒度描述。为解决动作标注缺失问题,团队利用MANO模型统一手部状态表示,通过HMR(Hand Motion Refinement)恢复裸手运动轨迹,并结合Caliball补齐相机参数,从视频中重建出可用于学习的手部动作信息。对于机器人数据,则统一了URDF规范、关节约定和坐标系,确保跨源数据的一致性。
经过这一系列标准化处理,异构数据被整合为UniHand-3.0训练数据集。这一过程不仅解决了数据规模问题,更通过严格的完整性检查、运动学一致性和跨模态同步验证,确保了数据的高质量。
无触觉数据的触觉化:TactoHand与压力映射
有了高质量的动作和视频数据,如何让模型“学会”触觉?这是Being-H0.8最具挑战性的环节。团队提出了一套从视觉中推断触觉、再融合真实传感器数据的Pipeline。
第一步是利用TactoHand从普通人类视频中恢复稠密的伪触觉监督。TactoHand不依赖同步的触觉传感器,而是基于手与物体的三维几何关系进行推断。在有三维标注的数据中,系统计算手部顶点与物体表面的距离和方向,预测接触位置和邻近度。该模型在3010万帧数据上训练,引入时序信息以消除视角重叠造成的误判。UniHand-3.0将这一能力应用于海量视频,重建手部运动并映射接触信息至统一的MANO拓扑,对于不可靠位置则标记为无效,避免引入噪声。
第二步是引入真实物理压力信息。视觉推断虽能解决接触点问题,但难以捕捉压力、摩擦和滑移等细节。因此,数据集中融入了约55小时、540万同步帧的压力手套数据,将真实压力信号投影到MANO手部表面。大规模视频提供了多样化的场景和动作覆盖,而真实传感器数据则补充了关键的物理力学信息,两者形成互补。
统一表征与动作对齐:打通感知与控制壁垒
不同来源的触觉数据格式各异,有的仅标记接触与否,有的提供指尖局部信号,有的则是逐顶点的压力场。为了解决这一异构性问题,通用触觉编码器建立了一套由粗到细的触觉金字塔。它可以根据数据粒度,将信号映射到整只手、手部区域、指尖或顶点级别。每个触觉Token不仅包含接触或压力值,还携带三维位置、拓扑位置及有效性标记,明确区分“无传感器”与“零读数”的区别。通过Perceiver结构,长短不一的触觉输入被压缩为固定数量的Token,便于模型高效处理。
最后,TopoHand解决了人手、灵巧手和平行夹爪之间的动作鸿沟。它不试图改变本体结构,而是将动作拆解为手腕位姿、形态编码、规范关节角和夹爪张开量等语义槽位。这种表示方法使得不同本体的相似动作(如捏、抓、松)进入相同的空间,实现了跨本体的动作对齐与迁移。
从视觉到多模态:具身智能的新范式
Being-H0.8的发布,标志着具身智能研究重心的转移。早期研究关注如何利用人类视频预训练模型,验证其可行性;中期研究致力于解决大规模、异构数据的规模化利用问题;而Being-H0.8则进入了第三阶段,即如何高质量地利用人类视频。这一阶段的核心不再仅是数据量的堆积,而是通过数据清洗、动作恢复、触觉标注和表征统一,从海量原始视频中提取具有高物理意义的训练信号。
在真实双臂机器人实验中,Being-H0.8展现了其在依赖触觉的高难度精巧任务中的卓越性能,包括包中取物、毛笔写字、挤牙膏和夹薯片等。这些任务的成功,证明了隐式触觉世界模型在处理非结构化环境中的优势。它让机器人不再仅仅“看到”物体,更能“感知”物体,从而实现更加自然、鲁棒的交互。
这一突破不仅源于算法的创新,更得益于完整的数据链路构建。从原始视频到触觉表征,从世界模型预测到实时动作纠偏,BeingBeyond智在无界构建了一套端到端的解决方案。对于行业而言,这提示我们:具身智能的未来不在于单一模态的极致优化,而在于多模态数据的深度融合与高质量利用。随着触觉数据的标准化和规模化积累,机器人将逐步具备如同人类般细腻的触觉操作能力,迈向更广泛的实际应用场景。