Code-as-World:用可执行代码重构物理智能的理解范式
在人工智能快速演进的今天,生成模型已经能够以惊人的精度复现视觉世界的表象——无论是高清图像、连贯视频,还是复杂的三维场景。然而,这种“看起来像”的能力,并不等同于“理解得对”。正如一句深刻的洞察所言:“像素告诉我们世界如何呈现,物理代码解释世界为何如此运行。”这一区分,恰恰揭示了当前AI在物理理解上的根本局限:它擅长描述现象,却难以触及机制。

人类面对一个滚动的球、一个倾倒的积木塔或一场雨后的水洼,不会仅仅记住每一帧画面的像素分布。相反,我们会调用诸如质量、重力、摩擦力、动量守恒等抽象概念,去解释为何物体会如此运动。这种基于机制的理解,具有极强的泛化能力——无论球的大小、材质或斜坡角度如何变化,我们都能做出合理预测。而当前主流的生成式AI,即便能合成一段看似合理的视频,也未必知道其中是否存在违反牛顿定律的瞬间。问题的核心在于:什么样的表征,才能支撑真正的物理理解与推理?

现有的世界表征方式各有侧重,却都存在盲区。像素保留了丰富的感官细节,但将因果关系深埋于结果之中;3D重建恢复了几何结构与空间关系,却无法自动解释物体为何加速、碰撞或静止;自然语言虽能简洁表达实体与事件,却难以精确刻画连续轨迹、接触力或瞬时加速度。这些表征要么过于隐式,要么缺乏可计算性,难以支撑深层次的物理推理。正是在这一背景下,MirroS提出的 Code-as-World 框架,试图开辟一条新路径:用可执行代码作为理解物理世界的核心表征。

Code-as-World 的核心思想是将观测到的现实世界,主动重建为一段可运行、可干预、可验证的程序。这段代码不再只是对视觉结果的拟合,而是对世界内在结构的显式建模。它包含三个关键维度:Composition(组成)、Evolution(演化) 和 Appearance(外观)。Composition 描述世界中存在哪些对象,它们的质量、形状、材质、摩擦系数等物理属性;Evolution 刻画这些对象如何随时间变化——包括初始状态、运动方程、碰撞响应和事件触发;Appearance 则定义观测条件,如相机位置、光照、背景和渲染参数。三者结合,构成一个完整的、可执行的“世界假设”。

这种表征的优势在于其双重身份:它既是描述,也是模拟器。你可以修改其中任意参数——比如将一个球的质量加倍,或将重力方向反转——然后重新运行整个程序,观察世界如何随之演化。这种“编辑即干预”的能力,远超传统生成模型在像素层面的微调。更重要的是,代码的可执行性使其具备可证伪性。一个错误的世界假设,在执行后会暴露出与观测不符的轨迹、速度或交互结果,从而为修正提供明确方向。

那么,如何从一段模糊、带噪声的真实视频中,逆向推导出这样一段精确的代码?Code-as-World 并未将其视为一次性生成任务,而是构建了一个 agentic discovery loop(智能体发现循环)。该过程模拟科学发现中的溯因推理:从有限证据出发,不断提出最可能解释观测的机制假设,并通过实验验证其有效性。具体而言,系统首先将输入(文本或视频)转化为结构化证据——文本中提取实体与事件,视频中则进一步解析深度图、实例分割掩码和3D轨迹。随后,智能体进入五个阶段的迭代循环:

- Propose(提出):基于当前证据和历史反馈,生成或修改世界代码;
- Instantiate(实例化):将抽象代码编译为可执行的物理模拟程序;
- Execute(执行):运行模拟,获得完整的状态序列(位置、速度、接触力等);
- Render(渲染):将状态序列转换为可观测的视频帧;
- Verify(验证):将渲染结果与原始输入逐项比对,量化差异并生成修正建议。

这一循环的关键在于:错误不是失败,而是信息。每一次验证暴露的偏差,都会被转化为对世界组成、动力学规则或观测条件的具体质疑,从而指导下一轮更有针对性的假设调整。这种“利用错误学习”的机制,使得系统能够逐步逼近真实物理规律,而非依赖海量数据的统计拟合。

更深远的影响在于,Code-as-World 为物理智能的训练提供了可规模化的监督信号。现实中,绝大多数视频并不包含底层物理标签——我们看不到物体的真实质量、瞬时加速度或接触点法向力。这导致物理推理模型长期面临“有数据无标签”的困境。而一旦将视频背后的物理世界重建为可执行代码,所有隐藏状态便自然浮现:模拟器输出的不仅是像素,还有精确的3D轨迹、时间戳、速度场和事件日志。这些信息构成了高质量的物理监督,可用于训练下一代视觉语言模型(VLM)。
实证结果令人振奋。基于Code-as-World生成的数据,MirroS训练了Code-as-World-VL系列模型,并在李飞飞团队提出的QuantiPhy基准上进行评估——这是首个专门量化VLM物理推理能力的测试集。结果显示,90亿参数的Code-as-World-VL-9B模型得分达到54.8,超越Gemini-3.1 Flash;而270亿参数的Reasoning版本更是提升至58.6。这一突破证明,可执行世界不仅是模拟工具,更是一种新型训练数据形态,能够将不可观测的物理机制转化为可学习的信号。
值得注意的是,Code-as-World 的愿景并不仅限于代码本身。MirroS进一步提出“结构化语言(Structured Language)”这一更广义的概念,将代码视为其中一种精确、可执行的形式。与之互补的是自然语言——它承载着人类千百年积累的因果直觉、科学概念和定性推理能力。代码擅长处理可建模的连续动力学,而自然语言则能描述复杂系统、社会互动或长期演化趋势。二者结合,既能保证推理的严谨性,又不失语义的灵活性。更重要的是,它们都与人类知识体系深度耦合,使AI无需从零开始“重新发现物理”,而是站在已有科学大厦之上进行扩展。
这种统一的世界表征,正在重塑多个AI子领域的技术路径。在物理推理中,模型不再直接从图像回归答案,而是先构建内部世界模型,在其中查询状态、推演轨迹、验证假设;在视频生成中,系统先推进一个持续演化的世界状态,再按需渲染为像素,从而天然保持物体一致性、几何稳定性和历史连贯性;在具身智能中,Agent可基于内部世界模拟多种行动后果,选择最优策略,并将同一套抽象无缝迁移至真实环境。推理、生成与行动,由此不再是割裂的模块,而是围绕同一个世界表征展开的不同操作:查询、演化、渲染与干预。
从更宏观的视角看,Code-as-World 为 Physical RSI(物理递归自我改进) 提供了关键基础设施。每一次对世界的理解,都被编码为可复现、可修正的程序,并持续回流至模型训练与智能体决策中。这种可积累的结构化物理经验,正是物理智能Scaling的核心燃料。当语言模型的Scaling已进入深水区,物理智能的Scaling才刚刚启航——而真正需要扩展的,不是更多像素,而是更多可执行、可验证、可组合的世界知识。Code-as-World 正是在这条道路上迈出的关键一步:它让AI不仅看见世界,更能运行世界、质疑世界,并最终理解世界。