国产世界模型登顶李飞飞榜单:UniWorld-View如何破解大基线视角合成难题
在人工智能内容生成的浪潮中,世界模型(World Model)被视为通往通用人工智能的关键一步。近期,全球瞩目的WorldScore榜单迎来了新的榜首,这一荣誉被中国团队斩获。由兔展智能联合北京大学、鹏城实验室共同研发的UniWorld-View模型,凭借其在单图3D生成与视频4D生成领域的卓越表现,成功登顶。更令人瞩目的是,该模型不仅全面适配国产昇腾算力,还实现了代码与权重的完全开源,为全球开发者提供了宝贵的技术资源。
这一突破的核心在于解决了一个长期困扰计算机视觉领域的难题:新视角合成(Novel View Synthesis)。通俗来说,就是让AI仅凭一张正面照片或一段单目视频,就能“脑补”出侧面、背面甚至任意角度的画面。这并非简单的图像拼接,而是要求AI具备对三维空间结构的深刻理解与重构能力。传统的神经辐射场(NeRF)和3D高斯溅射(3DGS)技术虽然在建模精度上表现出色,但它们严重依赖多视角输入。当面对视角覆盖极少的随手拍视频时,这些方法往往因数据稀疏而产生大量空洞伪影,甚至完全失效。
与此同时,基于生成式扩散模型的方法虽然具备强大的“想象力”,能够填补未知区域,但大多数现有方案将相机位姿仅作为抽象的条件向量输入。这种缺乏显式3D几何约束的做法,导致模型在大角度视角变换时极易失控,出现结构扭曲或内容漂移。UniWorld-View的创新之处,正是在于它找到了一条介于纯重建与纯生成之间的中间道路,既保留了几何结构的准确性,又利用了生成模型的补全能力。
然而,这条道路并非坦途。研究团队发现,现有的混合路线普遍存在一个隐蔽却致命的缺陷:点云渲染的“穿帮”现象。点云本质上是空间中孤立点的集合,缺乏面与面的连接信息。当相机视角发生大幅变化时,渲染出的条件图会出现两种典型错误。首先是前景与背景的撕裂,由于深度边界处缺乏连接,前景纹理会被错误地拉伸至背景,造成视觉上的混乱。其次是背面漏光,由于点云没有明确的朝向概念,当相机绕至物体背后时,正面的点会穿透物体显示出来,仿佛透过皮肤看到了内脏。
在小幅度视角变换中,这些错误尚可通过生成模型的平滑能力掩盖,但在大基线(Large-baseline)场景下,这些错误的几何信号会严重误导扩散模型,导致生成结果结构崩塌。针对这一痛点,UniWorld-View提出了“遮挡感知点云渲染”技术,通过两招精妙的算法设计彻底清除了条件图中的噪声。
第一招是“双重投影”机制,专门用于解决前景背景撕裂问题。该机制将源画面投影到目标视角,然后再逆向投影回源视角。在这个过程中,那些无法准确返回原位的像素,即为被遮挡或发生剧烈形变的区域。系统将这些区域沿相机轨迹逐帧累积,生成精确的遮挡掩码(Mask)。在最终渲染时,这些不可靠的区域被直接剔除,留下明确的“空洞”。这种做法看似留下了缺失,实则是将纠错的任务交给了更擅长上下文补全的生成模型,避免了错误纹理的误导。
第二招是“法向过滤”,旨在消除背面漏光现象。团队为点云中的每个点估计法向量,并计算其与视线方向的夹角。凡是背对相机的点,即法向量与视线夹角超过一定阈值的点,都会被直接剔除出渲染队列。这一简单的几何约束,有效确保了渲染图中只包含当前视角可见的表面信息。经过这两步处理,输入给扩散模型的条件图变得干净且可靠,既保留了准确的几何结构,又明确指出了需要生成的区域。
在解决了几何输入的可靠性问题后,UniWorld-View进一步设计了“双流条件注入”架构,以平衡几何结构与外观细节。传统方法往往试图用一个模块同时处理结构和纹理,导致顾此失彼。UniWorld-View则将任务拆解为两个并行的流:几何流与外观流。
几何流负责“构图”。它将经过遮挡感知处理的点云渲染图及掩码编码后,直接添加到潜变量中。这一步的作用是将生成内容牢牢地钉在正确的3D结构上,确保物体的形状、位置符合物理规律。外观流则负责“上色”与细节修复。团队引入了新设计的Ref-DiT模块,利用交叉注意力机制(Cross-Attention),将新视角的特征作为查询(Query),源视频的特征作为键值(Key/Value)。这使得模型能够主动从源视频中“寻找”匹配的纹理素材,哪里缺失补哪里。即使点云渲染中存在微小的伪影,外观流也能通过参考源视频的清晰纹理进行修正,从而生成既结构准确又细节丰富的图像。
除了静态的新视角合成,UniWorld-View在动态4D重建方面也展现了独特的巧思。常规的生成式方法在处理视频时,往往将空间变换与时间推进耦合在一起,导致视角在4D空间中分布不均,难以进行高质量的重建。UniWorld-View采取了解耦策略,将过程分为两步。
第一步是“拍摄定妆照”。系统冻结时间轴在第一帧,围绕场景生成一圈静态的环绕视图。这些视图作为整个场景的外观锚点,提供了全方位的空间参考。第二步是“拍摄动态视频”。在固定的多个机位上,生成同步的多视角视频序列。每个机位的第一帧都与之前的“定妆照”严格对齐,确保时空一致性。对于前景自遮挡等复杂情况,系统通过迭代生成的方式逐步补全。最终,这些高质量的多视角视频被送入4D高斯溅射(4DGS)优化流程,从而得到完整的动态4D场景。
这一技术路径的实现,离不开底层算力的支持。UniWorld-View全面适配国产昇腾算力,证明了国产硬件在运行大规模视觉AI模型时的可行性与高效性。这不仅降低了研发成本,也为国内AI生态的自主可控提供了有力支撑。兔展智能作为北京大学校友与青年领军人才联合创立的企业,始终专注于视觉AI大模型的底层技术研发。从行业首个开源文生视频模型Open-Sora Plan,到理解与生成统一架构的UniWorld系列,团队一直在探索视觉AI的前沿边界。
值得注意的是,UniWorld-View的开源策略对整个行业具有深远意义。在闭源模型占据主流的今天,高质量的开源模型能够极大地加速技术迭代与应用创新。开发者可以基于此模型,快速开发出适用于电商展示、虚拟现实、影视制作等领域的应用工具。例如,即将推出的RabbitVis产模一体设计生产工具,就将把这一前沿技术转化为实际的生产力,推动视觉AI进入商业设计工作流。
从技术演进的角度看,UniWorld-View的成功标志着视觉大模型正从单纯的“生成”向“理解与生成统一”转变。它不再仅仅是一个像素预测器,而是一个具备空间推理能力的智能体。通过显式的几何建模与隐式的生成补全相结合,它在保持生成多样性的同时,大幅提升了几何一致性。这种架构思路为未来的世界模型研发提供了新的范式。
当然,技术仍有提升空间。例如,在极端光照变化或透明物体处理上,点云渲染仍面临挑战。但随着数据的积累与算法的优化,这些问题有望在未来版本中得到解决。目前,UniWorld-View已在WorldScore榜单上证明了其实力,但其真正的价值将在广泛的应用场景中得以体现。无论是让普通用户通过手机视频重现旅行记忆,还是帮助设计师快速构建产品3D原型,这项技术都展现出了巨大的潜力。
综上所述,UniWorld-View的登顶不仅是单一模型的胜利,更是国产AI技术在基础算法、算力适配及开源生态建设上综合实力的体现。它通过解决大基线视角合成中的核心痛点,为世界模型的发展开辟了新的路径。随着技术的不断成熟与开源社区的持续贡献,我们有理由相信,基于此类世界模型的应用将迎来爆发式增长,深刻改变我们创作与交互数字内容的方式。