世界联觉模型让灵巧手在噪声和扰动下稳定操作未见物体
灵巧手的真实挑战:不只是“会动”,而是“稳得住”
实验室里的灵巧手 demo 往往看起来很流畅——手指灵活翻转小方块、旋转鸭子、甚至拧瓶盖。但一旦放到真实环境中,问题就来了:深度相机在近距离下充满噪声和空洞,触觉信号稀疏且不可靠,物体形状千奇百怪,还可能被人突然推一把。这时候,很多策略就退化成“开环套路”——按预设动作走一遍,一旦偏离就彻底失控。

现有 in-hand manipulation 方法大多依赖理想条件:固定物体、已知初始姿态、干净传感器输入。可现实世界没那么友好。真正实用的灵巧操作,必须能在 noisy depth(噪声深度)、稀疏触觉、外力扰动和未见物体 下稳定泛化。这正是 Sharpa Robotics 团队在 CoRL 2026 被高分收录的工作所要解决的核心问题。

他们提出的 World Synesthesia Model(WSM,世界联觉模型) 不是简单堆传感器,而是把视觉几何、触觉接触、本体感觉和动作历史统一到一个可复用的世界模型状态中,让策略持续推断手-物系统的隐含物理状态,而不是只对当前观测做反应。

四大模块构建抗噪世界表征

WSM 的整体架构基于 Dreamer 风格的 RSSM(Recurrent State Space Model),但做了关键改进,使其更适合灵巧操作的多模态、部分可观测特性。

多模态状态编码:从噪声中重建几何

系统接收三类输入:腕部深度图像、指尖触觉信号、以及关节角度等本体感觉。这些信号分别被编码后融合进循环状态。训练时有个巧妙设计:输入的是带噪声的深度图,但重建目标却是“干净”的深度。这种不对称监督迫使模型从混乱的观测中提炼出可靠的手-物几何结构。

部署时,策略网络(Actor)同时接收当前原始观测和 WSM 输出的循环特征 $w_t = h_t$。这个隐藏状态包含了对物体姿态、接触点、滑移趋势的持续估计,即使当前帧的深度全是 NaN,策略也能基于历史上下文做出合理动作。

干净监督 + 循环记忆:缺一不可

消融实验清楚地说明了机制来源。如果只用噪声深度做监督,训练回报只有 708.0;去掉动作条件的循环输入,回报降到 705.4;而如果完全不用循环状态、只用逐帧潜变量,回报更是跌到 667.6。只有 干净几何监督 + 动作条件循环推理 的完整组合,才能达到 753.3 的最高性能。

这意味着,单纯去噪不够,单纯记忆也不行——必须两者耦合,才能让模型学会“在噪声中保持对物理世界的连贯理解”。

从真实噪声中恢复可用几何

在真实硬件上,腕部深度相机在 20–30 厘米工作距离下表现很差:大量像素是 NaN,边缘模糊,还有运动伪影。但 WSM 的潜变量重建出的深度图明显更干净、结构更完整。这不是靠插值补全,而是模型通过触觉反馈和动作历史“猜”出了被遮挡或丢失的部分。

比如当手指挡住物体一侧时,深度图出现大片空洞,但触觉信号显示接触点仍在,结合之前的运动轨迹,WSM 能合理推断物体仍在手中,并估计其当前朝向。

可复用先验:9 物体预训练,迁移到 49 个新物体

团队在仿真中用 9 种日常物体(如鸭子、草莓、角块等)进行 z 轴旋转预训练。经过 3000 个 epoch 后,平均每 episode 能旋转 9.37 弧度,掉落率仅 0.3%;而没有 WSM 先验的基线只能转 3.28 弧度,掉落率达 6%。

更关键的是迁移能力:这个预训练好的 WSM 直接用于 49 个从未见过的新物体,无需微调,就能实现稳定旋转。t-SNE 可视化显示,不同物体的循环状态在隐空间中形成清晰聚类,说明模型学到了通用的物理表征,而非过拟合特定形状。

真实硬件验证:扰动恢复与多轴操作

所有实验最终都在 Sharpa Wave 真实平台上闭环运行。这是一台人形尺寸的 22 自由度五指灵巧手,配备腕部深度相机和指尖触觉阵列。

多物体 z 轴旋转:一策略通吃

同一个策略能处理鸭子、草莓、角块等九种物体,连续旋转超过一分钟。角块这种对称性差、易滑落的物体也能稳定操作,说明策略不是靠死记硬背轨迹,而是基于对当前状态的理解动态调整。

y 轴旋转与工具操作

y 轴旋转更具挑战——物体悬臂更长,侧向力矩更大,容易翻转。但 WSM 在牙膏、螺丝刀这类细长工具上也实现了闭环旋转。这证明模型能处理非对称动力学,不只是对称物体的“花式表演”。

掌姿变化下的重力不变旋转

当手掌姿态改变(比如从平放变为倾斜),重力方向相对手坐标系发生变化。传统方法往往需要重新规划抓握。但 WSM 支持的“紧凑抓握”策略能在掌姿变化时维持接触,继续旋转。这得益于模型对接触状态的持续估计,而非依赖固定参考系。

零样本泛化与扰动恢复

在未见过的十字块、灯泡等物体上,策略能自动调整:初始位姿不好?先用三指扶正再旋转。过程中被外力推向掌心?3–6 秒内调整回舒适工作区。这些都不是预编程行为,而是策略基于 WSM 提供的状态上下文实时决策的结果。

工具使用:平移+高速旋转



更进一步,系统还能执行目标条件平移(把物体移到指定位置)并配合高速轴向旋转——这已经接近真实工具使用的场景,比如拧螺丝或涂抹药膏。
与主流基线的真实对比
在真实角块 z 轴旋转任务中,多个基线表现不佳:
- 开环 Replay:无任何反馈,一旦偏移就无法恢复;
- 纯触觉策略(Touch Dexterity):因缺乏几何信息,物体频繁侧翻;
- IHR(In-Hand Rotation):受噪声深度影响,状态估计漂移,很快失稳;
- 仅用去噪深度:虽改善输入质量,但缺乏循环上下文,仍无法长时间稳定。
而 WM-Craftnet(即 WSM + 策略) 能连续旋转超过一分钟,期间多次经历微小扰动并自动修正。关键在于,它的策略始终“知道”物体在哪、怎么转、是否要滑,而不是盲目执行动作。
世界模型的新角色:理解当下,而非预测未来
这项工作的深层启示在于重新定义了世界模型在机器人中的作用。
过去,世界模型常被用于“想象未来”——预测下一帧图像或状态,辅助规划。但 WSM 表明,对于真实灵巧操作,更重要的是“更好地理解当下”。它不追求长时域预测,而是构建一个对当前物理状态更完整、更鲁棒的表征,作为策略的上下文输入。
这种“联觉”式的融合——将视觉、触觉、本体感觉和动作历史编织成统一状态——让策略在传感器残缺时仍能“脑补”出合理的世界模型。这比单纯增加传感器或提升感知精度更有效,也更符合人类操作的直觉:我们也不是靠高清视觉完成精细操作,而是综合多种感官线索形成对物体状态的内在判断。
此外,WSM 证明了可复用的物理先验是可行的。灵巧操作的泛化不一定依赖超大端到端网络,也可以通过预训练一个通用世界表征,再迁移到新物体、新任务。这为未来 scale up 提供了新路径:先构建高质量世界模型,再在其上训练轻量策略。
结语:走向真实泛化的灵巧操作
Sharpa Robotics 的这项工作,把灵巧手从“demo 级”推向了“应用级”。它不靠理想条件,不依赖特定物体,而是在噪声、扰动和未知中保持稳定。核心不是算法有多复杂,而是思路有多务实:与其幻想完美感知,不如学会在混乱中保持对物理世界的连贯理解。
世界联觉模型的意义,或许正如其名——像人类一样,用多种感官协同“感受”世界,而不是孤立地依赖某一种信号。这条路,可能才是灵巧操作真正走进家庭、工厂和医院的关键。