国产世界模型登顶李飞飞榜单:UniWorld-View如何破解大基线视角合成难题

1 阅读

在人工智能视觉领域,世界模型(World Model)一直被视为通往通用人工智能的关键路径之一。它要求AI不仅能理解静态图像,更能构建动态、三维且符合物理规律的世界表象。近期,这一领域迎来了一个里程碑式的突破:由兔展智能团队联合北京大学、鹏城实验室共同研发的UniWorld-View模型,成功登顶由李飞飞团队建立的WorldScore基准测试榜单。这一成就不仅代表了中国科研团队在世界模型前沿技术上的领先地位,更因其对国产昇腾算力的全面适配以及代码权重的完全开源,为全球开发者提供了极具价值的技术参考。

UniWorld-View的核心能力在于其强大的新视角合成技术。用户只需提供一段随手拍摄的单目视频,甚至仅仅是一张静态图片,模型即可生成具有任意指定相机轨迹的新视角视频。无论是推拉摇移的基础运镜,还是围绕场景360度旋转的复杂视角变换,模型都能实现精确的位姿控制。这种“单图生3D、视频生4D”的统一架构,打破了以往单一任务模型的局限,真正实现了视觉理解与生成的深度融合。

新视角合成的技术难点,长期以来集中在“大基线”(Large-baseline)问题上。所谓大基线,是指目标视角与原始拍摄视角之间存在巨大的空间差异。例如,仅给AI观看人物的正脸照片,却要求其生成侧脸乃至后脑勺的画面。传统的神经辐射场(NeRF)和3D高斯溅射(3DGS)技术依赖于多视角的重建逻辑,即在拥有足够多角度数据的情况下才能构建高质量模型。然而,现实生活中的随手拍视频往往视角覆盖有限,导致这些传统方法在面对大基线任务时,容易出现空洞、伪影,甚至完全无法收敛。

早期的生成式方法试图通过扩散模型来解决这一问题,但它们通常将相机位姿作为抽象的条件向量输入,缺乏显式的3D几何建模。这种做法在小幅度视角变化下尚可接受,一旦涉及大角度旋转,生成的画面极易出现结构漂移和失控。随后出现的第三条技术路线,尝试先利用几何模型将画面转化为3D点云,再将目标视角的点云渲染图作为条件输入视频扩散模型。虽然ViewCrafter和英伟达GEN3C等模型采用了类似思路,但在实际研发中,团队发现点云渲染环节存在严重的“穿帮”现象,这成为了制约生成质量的关键瓶颈。

点云本质上是由孤立的空间点组成的集合,缺乏点与点之间的连接信息以及表面的朝向定义。当视角发生较大变化时,渲染过程会出现两类典型错误:一是前景与背景的撕裂。由于深度边界处缺乏连接信息,视角变换会导致前景纹理像被拉扯的口香糖一样粘连到背景上,或者背景像素错误地覆盖前景物体。二是背面漏光。由于点云没有“面”的概念,无法自动处理遮挡关系,当相机绕至物体背后时,正面的点会直接穿透显示,造成视觉上的逻辑悖论。

针对上述痛点,UniWorld-View提出了“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)技术,通过两招核心策略彻底清理了条件图中的错误几何信号。第一招是“双重投影”(Double-Reprojection)。该技术将源画面投影至目标视角,再逆向投影回源视角。在这一往返过程中,那些无法正确返回的像素即被视为被遮挡区域。系统将这些区域沿相机轨迹逐帧累积生成遮挡掩码(Mask),在渲染时直接剔除。这种处理方式保留了真实的几何空洞,而非用错误纹理填充,从而引导生成模型进行合理的补全,而非被误导。

第二招是“法向过滤”。系统为点云中的每个点估算法向量,并计算其与视线方向的夹角。凡是背对相机的点,即被视为不可见部分并直接剔除。这一机制有效解决了背面漏光问题,确保渲染出的条件图仅包含当前视角下可见且可靠的几何信息。经过这两步处理,输入扩散模型的条件图不再包含误导性的几何噪声,为后续的高质量生成奠定了坚实基础。

在解决几何一致性问题后,UniWorld-View进一步攻克了内容一致性的难题。点云渲染图虽然位置准确,但往往存在内容缺失;而源视频虽然内容丰富,但视角并不匹配。为了兼顾两者,模型采用了“双流条件注入”架构。其中,“几何流”负责将点云渲染图及掩码编码后加入潜变量,确保生成内容严格遵循3D结构约束;“外观流”则通过新设计的Ref-DiT模块,利用交叉注意力机制,让模型从源视频中检索缺失的纹理细节。这种分工明确的机制,使得模型既能保持构图的准确性,又能还原真实的外观质感,甚至能修复因点云伪影造成的模糊纹理。

更为引人注目的是,UniWorld-View在4D重建方面展现了独特的巧思。传统的生成式方法往往将空间变换与时间推进耦合在一起,导致视角在4D空间中分布不均。UniWorld-View则将这一过程解耦为两步:首先,“冻结”时间,基于第一帧生成一圈静态环绕视图,作为场景的外观锚点;其次,在固定机位上生成同步的多视角视频,并利用静态锚点对齐每一帧的前景自遮挡。最终,这些多视角视频被送入4D高斯溅射优化流程,从而得到完整的动态4D场景。这一流程实现了从单目随手拍到自由视角漫游4D场景的全链路打通。

这一技术突破的背后,是兔展智能在视觉AI大模型领域的长期深耕。作为一家由北京大学校友及视觉领域青年领军人才创立的企业,兔展智能始终坚持底层技术的自主研发。其此前发布的Open-Sora Plan已成为全球引用量最高的开源文生视频模型之一,而UniWorld系列则率先探索了理解与生成统一的架构。2025年发布的UniWorld-V2早于国际同类产品数月问世,确立了理解生成一体化的新方向;2026年推出的UniWorld-V2.5则在图文交错、文字密集等复杂场景下对齐了国际顶尖水平。

值得注意的是,UniWorld-View的全面开源及其对国产昇腾算力的适配,具有深远的产业意义。在当前全球算力竞争加剧的背景下,证明高性能视觉大模型可以在国产硬件平台上高效运行,为国内企业摆脱对外部算力依赖提供了可行路径。同时,代码和权重的开放降低了技术门槛,激发了社区的创新活力,有助于加速世界模型技术在影视制作、虚拟现实、数字人等领域的商业化落地。

随着RabbitVis等产模一体设计生产工具的即将推出,视觉AI正从实验室走向实际工作流。UniWorld-View的成功不仅是一次技术排名的超越,更是中国AI团队在基础模型架构创新、工程化落地以及生态建设上综合实力的体现。它证明了在正确的技术路径指引下,通过解决具体的几何与生成矛盾,可以显著提升世界模型的可用性与真实性,为未来更加智能、沉浸式的视觉体验铺平了道路。