机器人拥有“触觉想象力”?UniTac如何让VLA在未接触前预测物理反馈

0 阅读

在具身智能的快速演进中,机器人正在经历从“视觉主导”向“多模态深度融合”的关键跨越。过去几年,随着视觉-语言-动作模型(VLA)的崛起,机器人已经能够出色地处理轮廓清晰、位置明确的结构化任务。然而,当任务场景切换到柔性物体、易损物品或需要精密力控的密集接触场景时,传统的视觉主导策略往往显得力不从心。无论是轻柔地捏起一颗葡萄而不致其破裂,还是稳稳握住一只易变形的纸杯,单纯依靠视觉往往难以捕捉接触瞬间的物理细微变化。这正是当前具身智能面临的核心瓶颈:缺乏对接触过程的预判与理解。

近期,优理奇机器人(UniX AI)联合浙江大学、麻省理工学院、牛津大学、耶鲁大学及上海交通大学等顶尖机构,发布了最新科研成果UniTac。这项被ECCV 2026接收的工作,提出了一套统一的跨传感器触觉理解与生成架构,并创新性地将该能力接入VLA。UniTac的核心突破在于赋予了机器人一种“未触先感”的能力——即在物理接触发生之前,机器人能够基于视觉信息预测接触后的触觉反馈,从而规划出更安全的操作策略。这一进展标志着机器人触觉感知从“事后反馈”向“事前预测”的根本性转变。

触觉缺失:VLA在物理Grounding中的最后一块拼图

要理解UniTac的价值,首先需厘清具身智能中“Grounding”(锚定/接地)的层次。第一层是VLM(视觉-语言模型),它解决了“这是什么”的问题,将抽象语言概念映射到现实视觉信号;第二层是VLA,它解决了“怎么做”的问题,将视觉语义和语言指令转化为具体的动作轨迹。然而,当动作真正执行并作用于物理世界时,第三层Grounding至关重要,即“如何接触”。

对于人类而言,抓取一条毛巾或一只杯子,大脑会瞬间结合视觉信息与过往的触觉经验,预判接触的硬度、摩擦力和潜在形变。但对于机器人,如果仅依赖视觉标签进行轨迹规划,往往会导致操作失败。例如,在未引入触觉预测机制的情况下,VLA可能会识别出多个外观相似的物体,但无法区分它们材质的差异,从而对易碎品施加过大的抓取力,或对高摩擦力物体使用错误的接触角度。这种对接触过程物理特性的无知,使得机器人在面对非刚性物体时极易失败。

UniTac的引入,正是为了填补这一空白。它不取代接触后的实时触觉反馈,而是作为一种先验知识,在“第一下手”之前就向VLA提供潜在的触觉状态预测。这种前馈机制极大地提升了首次接触的安全性,使机器人能够像人类一样,在接触前就“想象”出物体的物理属性,进而调整力控策略。

跨传感器统一:破解触觉数据异构难题

触觉感知的数据处理远比视觉复杂。虽然GelSight、DIGIT、Duragel等视觉式触觉传感器输出的也是类RGB图像,但其成像机理截然不同。这类传感器通常通过相机记录弹性凝胶受压后的形变,因此图像中混杂了两类信息:一是来自物体的物理属性(如硬度、粗糙度、纹理);二是来自传感器本身的配置(如光照、凝胶状态、Marker布局、相机参数)。

这种异构性导致了长期的数据孤岛问题。同一个物体,在不同传感器下产生的数据差异巨大,传统模型难以区分变化源于物体还是传感器。此外,现有触觉数据集往往局限于单一传感器或小规模样本,缺乏统一的标准框架。UniTac创造性地提出了一种多模态统一框架,将触觉表征解耦为“物体物理属性”和“传感器配置”两个独立维度。

在理解端,UniTac通过双任务训练迫使模型学会分离这两类信息:一方面学习描述物体的硬度、粗糙度等属性,另一方面识别信号来源的传感器类型。这种设计不仅提升了模型对物理属性的敏感度,还增强了其跨设备泛化能力。实验显示,UniTac-7B在PHYSICLEAR-Test基准上取得了66.51分的优异成绩,远超Octopi等基线模型,尤其在属性-物体匹配任务中,其64.61分的成绩证明了其不仅能识别物理特征,还能准确关联到具体物体类型。

在生成端,UniTac采用了独特的训练策略。不同于普通生成模型依赖无条件分支,UniTac认为触觉信号不存在真正的“无条件”状态,任何触觉数据必然关联特定传感器。因此,模型先给定目标传感器在无接触状态下的基准数据,再在此基础上生成由物体属性引起的触觉变化。这一创新使得UniTac在跨传感器生成任务中表现卓越,在Digit、GelSight、GelSight Mini和Duragel四种主流传感器上,其平均SSIM达到0.836,PSNR达到19.93,均刷新了行业纪录。

从理解到生成:UniTac如何赋能VLA决策

UniTac的架构优势不仅在于数据处理的统一,更在于其作为基础模块与上层决策模型(VLA)的无缝衔接。通过Sensor-Aware DiT Projector,UniTac将多模态大语言模型(MLLM)的语义输出对齐到触觉潜在空间,并注入对应的传感器Token。这意味着,VLA在接收视觉指令后,不仅能生成动作轨迹,还能通过UniTac预测该动作执行后可能产生的触觉反馈。

这种机制在实战中带来了显著的性能提升。以抓取毛巾为例,在未接入UniTac时,VLA可能因无法区分毛巾的层叠结构或柔软程度而失败。而接入UniTac后,机器人能够基于视觉输入,利用UniTac预测毛巾的质感与接触形变,从而规划出单层层抓取的精细动作。这种“想象-验证”的闭环,使得机器人能够在接触前就预判物理后果,避免了因策略不当导致的物体损坏或抓取失效。

从技术演进路线来看,优理奇机器人围绕触觉构建的技术栈已初具规模。从早期采集真实世界视触觉数据的Touch and Go项目,到统一多传感器表征的UniTouch,再到将视觉与触觉对齐到三维空间的TaRF,团队始终致力于解决机器人从“看见”到“理解接触”的跨越。UniTac作为这一路线的最新结晶,将触觉理解、生成与跨传感器迁移纳入统一架构,并将其作为基础能力直接赋能VLA,体现了其场景驱动的技术哲学。

行业展望:触觉基础模型的未来路径

UniTac的发布,标志着具身智能正进入“触觉基础模型”的新阶段。随着视觉、触觉、力觉与动作模型的进一步融合,机器人将在更广泛的非结构化场景中展现更高的鲁性。特别是在家庭护理、精细装配、服务操作和康养陪护等领域,机器人需要处理大量柔软、易碎或形状不规则的物体,触觉预测能力将成为其安全作业的关键。

此外,UniTac的跨传感器泛化能力也为行业降低了部署成本。通过统一的触觉表征,模型可以适应不同硬件配置,无需为每种传感器单独训练模型,这加速了触觉策略从仿真到真机的迁移进程。正如NVIDIA推出的TacSL等视觉触觉仿真工具所探索的方向,未来的具身智能将更依赖于这种高保真的多模态感知与预测能力。

总的来说,UniTac不仅是一项算法创新,更是具身智能感知范式的一次重要升级。它通过赋予机器人“触觉想象力”,让机器人在与物理世界交互时,从被动接收反馈转向主动预测后果。这一转变,对于实现更安全、更灵活、更通用的机器人操作具有里程碑式的意义。随着该技术的进一步成熟与落地,我们有望看到更多具备精细操作能力的机器人进入日常生活,真正弥合数字智能与物理世界之间的鸿沟。