国产世界模型登顶李飞飞榜单:昇腾适配与全开源背后的技术突围
在人工智能内容生成的浪潮中,世界模型(World Model)被视为通往通用人工智能的关键基石。近期,全球瞩目的WorldScore榜单迎来了新的领跑者,这一变化不仅标志着技术指标的刷新,更折射出国产AI底层研发能力的实质性跃升。登顶该榜单的是由兔展智能团队联合北京大学、鹏城实验室共同研发的UniWorld-View模型。值得注意的是,该模型不仅在性能上超越了众多国际顶尖竞品,更在基础设施层面实现了对国产昇腾算力的深度适配,并将核心代码与模型权重全部开源,为全球开发者提供了一个高质量的技术参考基准。
UniWorld-View的核心能力在于其强大的新视角合成技术。用户只需提供一段随手拍摄的单目视频,甚至仅仅是一张静态图片,模型即可生成具有精确相机轨迹控制的新视角视频。无论是推拉摇移的基础运镜,还是围绕场景进行360度环绕的高难度拍摄,模型都能保持极高的几何一致性与视觉真实感。这种“单图即世界”的能力,打破了传统视觉生成对多视角数据输入的依赖,极大地降低了三维内容创作的门槛。
新视角合成的技术难点,长期以来集中在“大基线”问题上。所谓大基线,是指相机位置发生大幅度移动时,如何准确推断出未被拍摄到的物体背面或侧面结构。传统的神经辐射场(NeRF)和3D高斯溅射(3DGS)技术依赖于密集的多视角输入进行重建,在面对视角覆盖稀疏的单目数据时,往往会出现严重的空洞或伪影。而早期的生成式方法虽然具备“脑补”能力,但通常将相机位姿作为抽象的条件向量输入扩散模型,缺乏显式的三维几何约束,导致在大角度旋转时容易出现结构扭曲或画面漂移。
针对这一行业痛点,UniWorld-View团队发现,现有的混合路线——即先通过几何模型生成点云,再将其渲染图作为条件输入视频扩散模型——存在一个被长期忽视的关键缺陷:点云渲染过程中的信息失真。点云本质上是离散的空间点集合,缺乏拓扑连接关系和表面法向信息。当视角发生剧烈变化时,直接渲染点云会导致两种典型的视觉错误:一是前景与背景的撕裂,即深度边界处的像素因缺乏连接信息而被错误拉伸;二是背面漏光,即由于点云无法自动处理遮挡关系,导致物体背面的视角中透出了正面的纹理。
为了解决上述问题,UniWorld-View引入了创新的“遮挡感知点云渲染”机制。该机制包含两项核心技术策略。首先是双重投影技术,用于消除前景背景撕裂。通过将源画面投影至目标视角,再逆向投影回源视角,模型能够精准识别出那些在往返过程中无法匹配的像素区域。这些区域即为潜在的遮挡区,系统会将其累积生成遮挡掩码(Mask),在渲染阶段直接剔除,从而避免错误纹理对生成模型的误导,将修复任务留给更擅长上下文推理的扩散模型。
其次是法向过滤技术,旨在解决背面漏光问题。模型为点云中的每个点估计法向量,并计算其与视线方向的夹角。凡是背对相机的点,即法向量与视线夹角超过阈值的点,将被直接剔除出渲染过程。这一操作确保了输入给扩散模型的条件图中仅包含可靠的几何信号和明确的待补区域,从根本上净化了生成条件,使得后续的视频生成更加稳定且符合物理规律。
在解决了几何条件的准确性问题后,UniWorld-View进一步设计了双分支架构来处理内容与结构的融合矛盾。点云渲染图虽然几何位置准确,但往往存在内容缺失;而源视频虽然内容丰富,但其像素位置并不对应目标视角。为此,模型采用了“双流条件注入”策略。其中,“几何流”负责将点云渲染图及遮挡掩码编码后加入潜变量,确保生成内容严格遵循三维空间结构;“外观流”则通过新设计的Ref-DiT模块,利用交叉注意力机制,让模型在源视频中检索匹配的特征,对缺失部分进行精准填充和纹理修复。这种分工明确的架构,既保证了画面的几何真实性,又保留了源视频的细节质感。
更为引人注目的是,UniWorld-View将这一技术延伸至4D重建领域。传统生成式方法在处理动态场景时,往往将空间变换与时间推进耦合,导致视角分布不均。UniWorld-View采取了解耦策略:首先冻结时间轴,基于首帧生成一圈静态环绕视图,作为场景的外观锚点;随后在固定机位上生成同步的多视角动态视频,并利用静态锚点进行对齐。通过迭代生成逐步补全前景自遮挡部分,最终结合4D高斯溅射技术,实现了从单目视频到可自由漫游的4D场景的完整闭环。
这一技术突破的背后,是研发团队在视觉AI大模型领域的长期积累。兔展智能作为北京大学校友与青年领军人才联合创立的企业,始终坚持底层技术的自主研发。从早期开源的文生视频模型Open-Sora Plan,到探索理解与生成统一架构的UniWorld系列,团队不断推动技术边界的拓展。UniWorld-V2及后续的V2.5版本,在图文交错、文字密集等复杂场景下的表现已与国际顶尖模型看齐,证明了国产模型在多模态理解与生成一体化方向上的竞争力。
此次UniWorld-View的开源,对于整个AI社区具有重要意义。它不仅验证了国产算力平台在训练大规模世界模型时的可行性,也为研究者提供了一套经过验证的高效技术路径。特别是在遮挡处理和几何约束方面的创新,为解决生成式AI中的结构性难题提供了新的思路。随着RabbitVis等产模一体设计工具的即将推出,视觉AI技术正加速从实验室走向商业工作流,赋能影视制作、虚拟现实、数字孪生等多个行业。
从技术演进的角度看,世界模型的发展正从单纯的视觉生成向具备物理常识和空间推理能力的综合智能体转变。UniWorld-View的成功表明,通过精细化的几何预处理与先进的生成架构相结合,可以在数据稀缺的情况下实现高质量的三维内容创作。这种技术路线不仅降低了对海量多视角数据的依赖,也提高了模型在真实世界应用中的鲁棒性。
未来,随着算力的进一步提升和算法的持续优化,我们有理由期待更多基于国产基础软硬件的创新成果涌现。UniWorld-View的登顶只是一个开始,它预示着中国AI团队在全球前沿技术竞争中,正从跟随者转变为引领者。通过开源共享,这一成果将激发更多开发者的创造力,共同推动世界模型技术向更深层次的空间理解与交互方向发展,为构建更加智能、沉浸的数字世界奠定坚实基础。