AI构建3D世界新基准:从鹈鹕到中土,大模型空间推理能力大考

1 阅读

从鹈鹕到中土:AI基准测试的进化

还记得那个让无数大模型“翻车”的经典测试吗?一张鹈鹕骑自行车的SVG图片,曾几何时是检验AI空间理解能力的试金石。然而,随着模型能力的飞速提升,这只鹈鹕已经“骑到头了”。近日,AI大神卡帕西(Andrej Karpathy)宣布,Anthropic团队开始采用一种全新的基准测试——直接让模型用Three.js构建《指环王》中的中土世界。这一转变不仅标志着测试难度的升级,更折射出大模型从“画图”到“造世界”的能力跃迁。

新基准:两小时,百万Token,一个中土世界

卡帕西在推文中展示了这一测试的初步成果:将《指环王》第一章的开头文字输入给Claude Opus 5,要求其使用Three.js(一个JavaScript 3D库)生成一个可实时运行的3D场景。模型需要理解文本描述,将其转化为多边形人物、建筑、道具,并安排它们在三维坐标系中的位置、动画和交互。整个过程消耗了100万token,耗时2小时,最终生成了5500行代码。

从效果来看,画面确实粗糙,甚至有些“抽象”,人物穿模、漂浮等问题频出。但关键在于,这并非简单的视频生成,而是模型通过代码构建了一个真正的3D世界——摄像机可以移动,人物可以走动,灯光可以变化。卡帕西坦言,Opus 5目前还无法“进入”自己生成的世界,只能通过截图检查问题,这恰恰暴露了当前大模型的短板:它们能写代码、搭场景,却还不能真正理解视频内容,也无法亲自体验自己创造的游戏。

技术解析:Three.js与程序化3D生成

要理解这一测试的意义,我们需要明白Three.js的工作原理。与视频生成模型直接输出像素不同,Three.js要求开发者先建立三维对象(如人物、建筑),然后通过代码实时计算它们的位置、角度和运动状态。因此,卡帕西的Demo实际上是一个3D网页场景的录屏,而非一段AI生成的视频。

这种程序化3D生成方式,对模型的空间推理能力提出了更高要求。模型必须理解“前后、内外、远近”等空间关系,以及物体在不同视角下的相对大小和位置。同时,它还需要将抽象的文字描述转化为具体的几何结构,这涉及到对物理规律和日常物体的常识理解。

卡帕西在评论区提到,程序化3D和视频生成并非二选一。他设想,可以先用代码生成粗糙的3D场景作为“骨架”,再交给视频模型(如Seedance)进行高画质渲染,补充纹理、光影和细节。这种“代码+视频”的混合模式,或许将成为未来AI内容创作的主流。

网友创意:从城市到演唱会,AI造世界百花齐放

卡帕西的Demo发布后,网友们的创意如泉涌。有人用Claude启动了“Earth Online”项目,试图通过AI Agent逐步构建整个地球,目前已完成低多边形风格的旧金山滨水区,建筑比例和人物尺度保持得相当统一。还有人用Fable 5和GPT-5.6 Sol搭建了纽约市的3D数字模型,并接入实时数据,探索空间推理的新基准。

更夸张的是,有网友因买不到Kanye West的演唱会门票,干脆用AI在浏览器里生成了一场专属演唱会。整个项目仅用一个HTML文件,舞台、人物、灯光全部由代码生成,还准备了14首歌曲,每首都有独立的灯光设计。用户可试听片段,连接Spotify Premium后还能播放完整曲目。

这些案例展示了AI在实时3D内容创作上的巨大潜力。虽然距离成熟游戏仍有距离,但制作门槛已被大幅降低。卡帕西甚至畅想,未来可以给这些3D世界加入玩法,让玩家以旁观者、NPC甚至故事角色的身份进入其中。而网友已经先行一步,用Opus 5和Three.js做出了可交互的游戏原型,连音频都配上了。

鹈鹕的退役:为什么需要新基准?

“鹈鹕骑自行车”测试由开发者Simon Willison提出,要求模型生成一张鹈鹕骑自行车的SVG图片。这道题看似简单,实则考验模型对物体结构、空间关系和组合逻辑的理解。鹈鹕的大嘴、短腿与自行车的车架、踏板形成鲜明对比,模型是否真正理解“骑车”这一动作,一眼就能看出。

然而,随着模型能力的提升,这只鹈鹕已经难不倒它们了。DeepSeek R1和V4等模型已能生成相当像样的SVG,且一张图片只能考察一次性输出,无法测试模型在复杂项目中的规划、迭代和纠错能力。因此,卡帕西将测试升级为“搭个世界”,要求模型连续工作数小时,生成数千行代码,并在过程中不断检查和修正错误。

争议与思考:空间推理的本质

新基准的推出,在社区引发了热烈讨论。Hacker News的高赞评论认为,这些Demo虽然画面粗糙,但恰恰说明我们需要一个更难的新测试,来区分模型之间的差距。然而,也有人质疑,消耗大量token生成3D世界是否值得,且Three.js代码能力能否代表综合能力。

有网友反驳称,将抽象文学文本转化为3D动画,需要同时处理空间关系、物理规律、日常物体以及计算机图形学中的数学问题,这绝非简单的“会写Three.js”所能概括。更有人提出一个开放性问题:空间推理与大模型处理文字、代码时的推理是否本质相同?一种观点认为,画面能否成立取决于模型对空间关系的理解;另一种观点则认为,无论处理“石头旁边”还是“数组里面”,模型做的都是同一件事——根据上下文逐个生成Token,并在此过程中完成推理。

如果是后者,那么Opus 5展示的或许并非一项突然冒出的“空间能力”,而是大语言模型原本用于理解文字和代码的通用推理能力,开始自然延伸到三维世界。从画一只鹈鹕到搭出一个中土世界,题目变了,但背后测试的始终是同一个问题:模型能否把自己对世界的理解,转化成一套真正能够运行的结构。

未来展望:AI原生内容创作的曙光

卡帕西的新基准,不仅是一次测试方法的革新,更预示着AI内容创作范式的转变。当通用大模型能够自己写代码搭建3D世界,再调用其他API完成画面和声音,用户或许不再需要打开专门的视频生成产品,而是直接通过对话就能生成一部可交互的电影或游戏。

当然,这仍面临诸多挑战:如何让模型真正“进入”自己生成的世界?如何提高长时间运行的稳定性?如何让玩法更有趣?但不可否认,实时3D内容和可玩原型的制作门槛已被大幅降低。正如卡帕西所言,能有一种新的方法测试模型能力,同时又足够有趣、好玩,岂不美哉?

或许,在不久的将来,我们每个人都能像卡帕西一样,用几句话就创造出一个属于自己的“中土世界”。而这一切,都始于那只终于“骑到头”的鹈鹕。