国产世界模型登顶李飞飞榜单:UniWorld-View如何破解大基线视角难题

28 阅读

在人工智能内容生成的浪潮中,世界模型被视为通往通用人工智能的关键基石。近期,全球瞩目的WorldScore榜单迎来了新的霸主,这一变化不仅代表了技术排名的更迭,更折射出中国科研团队在视觉AI底层逻辑上的深刻突破。登顶者是由兔展智能携手北京大学、鹏城实验室共同研发的UniWorld-View模型。值得注意的是,该模型不仅在性能指标上超越了众多国际顶尖竞品,更实现了对国产昇腾算力的全面适配,且将核心代码与模型权重完全开源,这一举动无疑为全球开发者提供了一套高质量的技术基准。

新视角合成一直是计算机视觉领域的皇冠明珠之一。其核心挑战在于让AI具备“脑补”能力,即仅凭有限的二维图像或视频片段,重构出未被拍摄到的三维空间信息。传统的神经辐射场(NeRF)和3D高斯溅射(3DGS)技术依赖于多视角的重建逻辑,数据越密集,重建效果越好。然而,在实际应用场景中,用户往往只能提供单目随手拍的视频,视角覆盖极其有限。在这种情况下,传统重建方法极易产生空洞伪影,甚至完全失效。而早期的生成式方法虽然敢于“想象”,但往往缺乏显式的三维几何约束,导致在大角度旋转时出现结构漂移和失控现象。

UniWorld-View的创新之处,首先体现在它对现有混合路线中隐蔽缺陷的精准打击上。当前主流的高级方案通常采用“几何+生成”的两阶段策略:先利用几何模型构建3D点云,再将目标视角的点云渲染图作为条件输入给视频扩散模型。尽管ViewCrafter和英伟达GEN3C等模型均沿袭此路,但在研发过程中,团队发现点云渲染环节存在严重的“穿帮”问题,这成为了制约大基线新视角合成质量的瓶颈。

点云本质上是空间中孤立点的集合,缺乏拓扑连接信息和表面朝向定义。当相机视角发生大幅度变化时,这种离散性会导致两种典型的视觉错误。首先是前景与背景的撕裂。在深度边界处,由于缺乏连接信息,视角变换会导致前景纹理像被拉扯的口香糖一样粘连到背景上,或者背景像素错误地覆盖前景物体。其次是背面漏光现象。由于点云没有“面”的概念,无法自动处理遮挡关系,当相机绕至物体背后时,正面的点会直接穿透显示,造成透过物体看到内部或背面的荒谬视觉效果。在小幅度视角变化中,这些瑕疵尚可被生成模型掩盖,但在大基线条件下,错误的几何信号会严重误导扩散模型,导致最终生成的视频结构扭曲、伪影丛生。

针对这一痛点,UniWorld-View提出了“遮挡感知点云渲染”机制,通过两招组合拳彻底净化了条件图中的错误信号。第一招是双重投影技术,专门用于解决前景背景撕裂问题。该方法将源画面投影至目标视角,再逆向投影回源视角。在这一往返过程中,那些无法成功返回的像素即为被遮挡区域。系统将这些区域沿相机轨迹逐帧累积,生成精确的遮挡掩码(Mask)。在渲染阶段,这些区域被直接剔除,留下明确的“空洞”,从而避免错误纹理对生成模型的误导,将补全任务交还给擅长推理的扩散模型。

第二招是法向过滤技术,旨在消除背面漏光。系统为点云中的每个点估算法向量,并计算其与视线方向的夹角。凡是背对相机的点,即被视为不可见部分并被直接剔除。经过这两步处理,输入给生成模型的条件图不再包含误导性的几何噪声,而是保留了可靠的几何结构以及明确的待补全区域,为大基线下的稳定生成奠定了坚实基础。

在解决几何一致性问题后,如何平衡“位置准确”与“内容真实”成为下一个挑战。点云渲染图虽然几何位置正确,但内容缺失;而源视频内容完整,却不符合目标视角的空间关系。UniWorld-View采用了创新的双流条件注入架构来化解这一矛盾。其中,“几何流”负责将点云渲染图及掩码编码后加入潜变量,确保生成内容严格遵循三维空间结构;“外观流”则通过新设计的Ref-DiT模块,利用交叉注意力机制,让模型以新视角特征为查询键,从源视频中检索匹配的外观特征。这种分工明确的机制,相当于让一个分支负责搭建骨架,另一个分支负责填充血肉,既保证了视角的准确性,又维持了外观的一致性,甚至能修复点云伪影带来的纹理模糊。

更进一步,UniWorld-View展示了从单目视频到4D场景重建的强大能力。传统生成式方法往往将空间变换与时间推进耦合,导致视角分布不均。UniWorld-View巧妙地将两者解耦,采用“先静态后动态”的两步走策略。首先冻结时间,围绕场景生成一圈静态环绕视图,作为整个场景的外观锚点,即“定妆照”。随后,在固定机位上生成同步的多视角视频,并利用“定妆照”对齐每一帧的初始状态,通过迭代生成逐步补全前景的自遮挡部分。最终,这些多视角视频被送入4D高斯溅射优化流程,从而得到高质量的动态4D场景。这意味着,用户只需一段随手拍摄的单目视频,即可获得一个支持自由视角漫游的完整4D数字世界。

这一技术突破的背后,是兔展智能在视觉AI大模型领域的长期深耕。作为由北京大学校友及视觉领域青年领军人才联合创立的企业,兔展智能始终坚持底层技术的自主研发。从行业首个开源文生视频模型Open-Sora Plan,到探索理解与生成统一架构的UniWorld系列,再到2026年发布的UniWorld-V2.5,其技术演进路径清晰且稳健。特别是在InfoGraph、图文交错及文字密集场景下的生成能力,已与国际顶尖水平看齐。此次UniWorld-View的开源,不仅是技术实力的展示,更是推动视觉AI进入商业工作流的重要一步。随着产模一体设计生产工具RabbitVis的即将推出,视觉AI将从实验室走向更广阔的生产力场景,为数字内容创作带来革命性的效率提升。

从技术原理来看,UniWorld-View的成功并非偶然,而是对几何先验与生成概率模型深度融合的必然结果。它证明了在缺乏海量多视角数据的情况下,通过精细化的几何预处理和架构创新,依然可以实现高质量的世界模型构建。这对于算力资源相对受限、数据获取成本较高的应用场景具有极高的参考价值。同时,对国产算力的适配也表明,自主可控的硬件生态完全能够支撑起最前沿的AI模型训练与推理,为国内AI产业的独立发展注入了强心剂。

展望未来,随着世界模型能力的不断进化,其在虚拟现实、自动驾驶、机器人导航等领域的应用潜力将被进一步释放。UniWorld-View所展现出的大基线视角合成能力,正是实现高保真数字孪生的关键技术之一。当AI能够真正理解并重构三维物理世界时,人机交互的方式也将发生根本性变革。我们不再局限于平面的屏幕操作,而是可以在真实的三维空间中进行自然的互动与创造。这一愿景的实现,离不开像UniWorld-View这样扎实的基础研究突破,也离不开开源社区的共同协作与迭代。