国产世界模型登顶李飞飞榜单:UniWorld-View如何破解大基线生成难题?

13 阅读

在人工智能内容生成的浩瀚星海中,世界模型(World Models)正逐渐成为连接2D视觉感知与3D物理世界的核心枢纽。2026年7月,这一领域迎来了一个极具里程碑意义的时刻:由兔展智能联合北京大学、鹏城实验室共同研发的UniWorld-View模型,正式登顶斯坦福大学李飞飞团队维护的WorldScore权威榜单。这不仅标志着国产AI在基础模型能力上取得世界级突破,更因其全面适配国产昇腾算力、代码与权重全开源的开放性姿态,为全球开发者提供了一套高效、透明的新一代视觉生成范式。

UniWorld-View的核心突破在于其统一的处理架构——无论是基于单张图片的3D生成,还是基于单目视频的4D动态生成,模型均能在同一套代码逻辑下运行。用户只需提供一张照片或一段随手拍摄的视频,模型即可生成具有精确相机位姿控制的新视角视频。支持推、拉、摇、移乃至360度环绕拍摄,真正实现了“给定条件,还原世界”的承诺。这种能力并非简单的图像拼接,而是基于对场景深层几何结构的理解与重构,其技术路径对传统的计算机视觉方法提出了严峻挑战,同时也开辟了全新的解决思路。

要理解UniWorld-View的价值,首先需审视其解决的核心痛点:大基线新视角合成(Large-Baseline Novel View Synthesis)。在传统摄影或计算机视觉中,“大基线”意味着相机视角变化幅度极大,例如从正脸视角生成侧脸甚至后脑勺图像。传统的神经辐射场(NeRF)和3D高斯溅射(3DGS)等重建方法,依赖于密集的多视角输入。当面对仅包含单一视角的单目视频时,由于视角覆盖严重不足,传统重建方法极易产生空洞、伪影,甚至彻底失效。而早期的生成式方法虽然敢于“脑补”,但往往将相机位姿视为抽象的条件向量,缺乏显式的3D几何约束,导致在大幅旋转时画面结构扭曲,生成结果失控。

近两年,行业尝试走出第三条道路:先通过几何模型将画面重建为3D点云,再将目标视角的点云渲染图作为条件输入视频扩散模型。这种“几何归几何,生成归生成”的思路在ViewCrafter、英伟达GEN3C等工作中有所体现。然而,UniWorld-View团队在深入研发中发现,这条看似平坦的道路上隐藏着一个普遍被忽视却致命的陷阱:点云渲染中的几何穿帮。

点云由孤立的数据点组成,缺乏面片连接信息和表面朝向概念。当视角发生大角度变化时,渲染图极易出现两种典型的错误信号。首先是前景背景撕裂,由于深度边界缺乏连接信息,前景纹理可能被错误拉伸至背景,或背景像素污染前景,导致画面出现类似口香糖拉伸的畸形纹理。其次是背面漏光,点云没有自遮挡机制,当相机绕至物体背后时,正面的点会穿透物体被渲染出来,造成逻辑上的悖论。在小视角变化下,扩散模型尚能凭借先验知识进行模糊修正,但在大基线场景下,这些错误的几何信号会直接误导扩散模型,导致生成结果结构崩塌。

针对这一行业难题,UniWorld-View提出了“遮挡感知点云渲染”技术,通过两招精准拆解问题。第一招是“双重投影”策略,专门解决撕裂问题。该策略将源画面投影至目标视角,再反向投影回源视角。通过比对两次投影的一致性,识别出无法回投影的像素区域,这些区域即为潜在的遮挡区域。团队将这些区域沿相机轨迹逐帧累积,形成精确的遮挡掩码(Mask)。在渲染时,直接将这些区域挖空,留下明确的待补全区域,而非保留误导性的错误纹理,从而引导生成模型进行合理的纹理填补。

第二招是“法向过滤”机制,旨在消除背面漏光。模型为点云中的每个点估计法向量,并计算其与视线方向的夹角。凡是背对相机的点,即法向量与视线夹角大于90度的点,均被判定为不可见点,直接从渲染序列中剔除。这两项技术的结合,彻底清除了条件图中的错误几何信号,保留了可靠的几何结构与明确的补全需求,为后续的生成步骤奠定了坚实基础。

在解决了几何渲染的准确性问题后,UniWorld-View面临着第二个核心挑战:如何平衡3D结构的准确性与视觉内容的连贯性。点云渲染图提供了正确的空间位置,但内容缺失;源视频拥有丰富的视觉内容,但缺乏目标视角的几何约束。UniWorld-View采用了创新的“双流条件注入”架构,实现了构图与上色的完美分工。

在“几何流”中,点云渲染图与遮挡掩码被编码后直接注入到潜变量中,起到“骨架”的作用,强制生成内容严格贴合3D空间结构,防止画面漂移。在“外观流”中,模型设计了全新的Ref-DiT模块。该模块将新视角的特征作为查询(Query),源视频特征作为键(Key)和值(Value),通过交叉注意力机制,让模型自主地从源视频中检索并匹配纹理。这种机制不仅确保了生成内容与源视频的高度一致性,还能自动修复因点云伪影导致的模糊或失真纹理,实现了“有质有样”的高保真生成。

UniWorld-View的野心不止于生成任意视角的视频,更在于打通从2D内容到3D世界的全链路。既然模型能够生成任意视角的多视角视频,那么通过多视角视频进行4D重建(动态3DGS)便成为可能。然而,常规方法中相机的空间运动与时间推进往往耦合在一起,导致4D空间内的采样分布极不均匀,重建效果受限。

UniWorld-View巧妙地解耦了空间与时间两个维度,采用“先定妆,后动态”的两步走策略。首先,将时间冻结在第一帧,生成一圈静态的环绕视图,作为整个场景的外观锚点。这一步确保了场景静态结构的完整性与一致性。随后,在固定机位上生成同步的多视角视频,并将每一帧的第一帧与“定妆照”进行对齐。对于前景中的自遮挡区域,则通过迭代生成的方式逐步补全。最终,将这些多视角视频输入4DGS优化器,即可高效重构出高保真的4D动态场景。这一流程将单目随手拍转化为可自由漫游的4D世界,极大降低了3D内容创作的门槛。

值得注意的是,UniWorld-View不仅在算法层面实现了突破,在生态构建上也展现了强烈的国产化适配意识。模型已全面适配国产昇腾算力,这意味着在缺乏高端GPU集群的环境下,国内开发者依然能够高效训练和部署这一顶级世界模型。代码与权重的全开源,进一步降低了研究与应用门槛,促进了学术与产业界的协同创新。

兔展智能作为该模型的主要研发方,其背景亦值得关注。公司由北京大学校友及视觉领域青年领军人才创立,专注于视觉AI大模型的底层技术研发。早在2024年,其开源的文生视频模型Open-Sora Plan便以全球第一的代码引用量引发行业关注。2025年发布的UniWorld-V2,率先探索了理解与生成统一架构,引领了多模态大模型的新方向。2026年4月发布的UniWorld-V2.5,则在图文交错、文字密集等复杂场景下,具备了与GPT-Image-2等国际顶尖模型对齐的能力。

随着UniWorld-View的发布,兔展智能正加速推动视觉AI大模型的能力产品化。近期即将推出的产模一体设计生产工具RabbitVis,旨在将世界模型的能力直接嵌入商业设计工作流,赋能广告、游戏、影视等行业的数字化转型。从底层模型创新到上层应用落地,UniWorld-View不仅是一个算法模型的突破,更是中国AI产业从跟随走向引领的缩影。它证明了在算力自主可控的前提下,通过算法创新同样可以突破瓶颈,构建具有全球竞争力的AI基础设施。未来,随着更多开发者基于开源代码进行二次创新,世界模型将在自动驾驶、虚拟社交、数字孪生等领域释放巨大潜力,重塑人类感知与创造世界的方式。