Puffin-World开源:统一物理、几何与外观的多模态世界模型

3 阅读

统一三种原生状态:物理、几何与外观

传统图像生成模型关注的是“看起来像”,但对机器人来说,真正重要的是“世界实际如何存在”。Puffin-World从这个根本问题出发,把三维世界拆解成三种相互关联的原生状态:物理状态、几何状态和外观状态。

文章配图

物理状态描述相机在真实世界中的绝对朝向,核心是重力方向。无论相机怎么旋转或移动,上下方向不能乱——地平线不能歪,建筑不能倒。模型通过纬度图和重力场信息锚定这一参照系。

文章配图

几何状态表达场景的三维结构,用深度信息刻画物体远近、表面关系和空间布局。这不是简单的2D透视,而是能支撑导航和避障的真实空间理解。

文章配图

外观状态就是最终看到的RGB图像,但它不再是孤立的像素堆砌,而是在物理和几何约束下生成的结果。

文章配图

这三者共同构成一个完整的“世界状态”:不仅告诉你画面长什么样,还确保这个画面在物理上成立、在空间中连贯。比如生成一个俯拍视角时,模型不仅要画出屋顶,还要保证重力方向正确、建筑高度合理、透视关系一致。

为统一绝对方向和跨视角运动,Puffin-World提出了Omni-Camera表示法。它把重力锚定的绝对相机参数(横滚角、俯仰角、视场角)和基于射线的相对几何结合起来。模型先从参考图像中精确推断当前相机姿态,再通过物理传播机制,把重力信息传递到后续视角。即使经历连续旋转或长轨迹移动,整个生成过程始终有一个稳定的物理参照系。

更关键的是,Puffin-World在同一次生成中联合输出RGB图像和深度图。这意味着生成结果可以直接用于三维重建,不需要事后调用独立的深度估计算法。世界生成和世界重建不再是两个割裂的步骤,而是同一个状态预测过程的不同侧面。

一个模型完成四件事

过去,机器人要完成空间任务往往需要多个系统拼接:一个模型做相机姿态估计,另一个做新视角合成,再一个做三维重建,还有一个负责路径规划。Puffin-World把这些能力整合进同一个框架。

首先是单图理解相机物理信息。给一张照片,模型不仅能说出“图中有沙发、窗户、地板”,还能判断“这张图是从略微俯视的角度拍的,相机向右倾斜了5度,垂直视场角约70度”。这种空间推理能力让机器人从第一眼就能建立对环境的物理认知。

其次是自由视点空间仿真。用户不仅可以输入文字描述,还能明确指定相机位置、朝向和视场角。模型据此生成符合目标机位的画面,实现从“内容控制”到“空间控制”的跨越。比如要求“从左侧30度、高度1.5米处看这个房间”,模型就能生成对应视角。

第三是三维世界生成与重建。从文字、单张图或少量参考图出发,模型能按指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。这些视角随后可以融合成一个具有一致空间结构的三维场景,直接用于机器人仿真或虚拟现实。

最后是闭环自校准探索。当相机姿态偏离重力方向时,模型能感知当前物理状态,推理需要执行的修正动作,并生成动作执行后的预期观察。这个“感知—预测—生成—校准”的闭环,让它能高效扮演World Action Model(WAM)的角色。技术报告还展示了模仿式探索能力:从同一初始视角出发,按照给定轨迹扩展并探索新的三维空间。

这四项能力不是四个模型的简单堆叠,而是由同一套视觉、语言、相机和世界状态表征共同支撑。任务切换不再依赖系统重构,而由输入内容、相机条件和视图角色自然决定。这种统一性更贴近机器人从感知到行动的完整工作流。

1600万核心数据与4450万开放标注

世界模型的能力上限往往由训练数据决定。现有数据集要么只有图像和文本,缺少相机信息;要么只有相对位姿,缺乏绝对物理参照。Puffin-World团队为此构建了Puffin-16M数据集,包含两个互补部分。

Puffin-Cam-15M提供了1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成场景,包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型“图中有什么”,还说明“这张图是在什么观测条件下形成的”。

Puffin-Traj-1M则包含100万条具有挑战性的旋转轨迹,涵盖连续俯仰、横滚、偏航、复合运动和360度环视等复杂情况。这部分专门补足传统三维数据集在大幅旋转和长轨迹探索上的不足。

与只描述视角间相对变化的数据不同,Puffin-16M引入了相机相对于重力和真实世界的绝对方向。模型不仅要学“相机从上一帧移动了多少”,更要理解“相机当前在世界中处于什么方向”。

除了自建数据,团队还利用Puffin-World的物理感知能力,为28个公开数据集补充了绝对相机位姿标注,覆盖约4450万张图像。这些数据集包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包含横滚角、俯仰角和视场角,可用于研究视觉数据中的机位偏差,也为相机条件生成和空间智能训练提供了大规模监督信号。

更重要的是,项目同步开源了代码、模型和全部数据。这不只是发布一个算法,而是提供了一套从数据、标注、训练到评测的完整技术链路,方便研究者和开发者在机器人仿真、合成数据生产、虚拟现实和具身智能等领域开展后续工作。

四项SOTA验证统一能力

Puffin-World的统一架构在四个基准测试中均取得领先结果,证明其能力不是单一任务的优化,而是多维度协同的体现。

在相机到真实世界理解任务上,模型在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差。其中在Stanford2D3D上,横滚角、俯仰角和垂直视场角的中位误差分别为0.29度、0.53度和1.62度,显示出极强的绝对相机理解能力。

在相机可控生成基准Puffin-Cam-Bench上,生成结果的上方向、纬度和重力方向中位误差分别为0.84度、1.26度和0.79度,FID为75.93,优于通用图像生成模型和已有相机可控方法。这意味着它不仅能生成高质量图像,还能让画面准确服从指定的相机状态。

在Puffin-Traj-Bench上,模型取得18.00的PSNR、0.613的SSIM和0.288的LPIPS;生成轨迹的相机控制误差也全面领先。其中PSNR、LPIPS和三项相机误差均为最优。

在RealEstate10K三维世界生成测试中,PSNR、SSIM和LPIPS三项视觉一致性指标同样优于对比方法。

这些结果表明,Puffin-World成功在相机物理理解、空间控制、几何一致性和视觉质量之间建立了相互支撑的关系。它推动世界模型从“生成一段看起来合理的视频”转向“预测一个具有物理、几何和外观一致性的世界状态”——这正是世界模型真正进入机器人训练和具身智能应用所需的关键转变。