Aether AI 发布因果世界模型 CausalWM:让机器人预测未来时先写“解题过程”
世界模型也开始写「解题过程」
把一个杯子从桌子左边推到右边,对人来说轻而易举。但拆解这个动作会发现,“未来”并非凭空跳出来:手臂先动,接触发生后杯子才滑动,位置和空间关系随之改变,最终形成下一帧画面。

当前很多世界模型的做法却像只写答案的学生——输入当前画面和动作指令,直接输出未来视频。这种方法在数据量足够时确实有效:模型见过成千上万次“手推杯子”,自然能猜出杯子大概率会移动。

问题在于,运动、接触、几何变化全被压进模型内部黑箱。我们无从判断它是否真正理解物理过程,还是仅仅靠统计相关性“蒙”出一个看起来合理的未来。

一旦场景变复杂——比如机器人连续操作多个物体,或预测时间拉长——中间一次接触判断失误,后续画面就可能越偏越远。

Aether AI 最近发布的 CausalWM(16B 参数)试图改变这一点。它不急着生成未来,而是先显式推演物体如何运动、三维几何关系怎样变化,再基于这些中间结果继续生成未来画面。团队称这种新范式为 Causal Chain-of-Thought(因果思维链)。

目标很明确:世界模型能不能不只预测“未来长什么样”,还进一步理解“未来是怎样一步一步发生的?”

一条看得见的推理链:Motion → Geometry → Future

CausalWM 的核心不是用了哪些物理变量,而是如何组织它们。

团队选取了三类可从视频自动提取的信号:

- Optical Flow(光流):描述画面中物体往哪移动、移动多少;
- Depth(深度):表示物体与相机的距离;
- Pointmap(点图):为每个像素赋予三维空间坐标,重建场景几何结构。

过去,这些变量常被用作训练时的辅助监督信号,但未来视频仍可能走另一条内部路径生成。CausalWM 的关键区别在于:每一步预测结果都会重新放进上下文,成为下一步推理的条件。

以推杯子为例,模型的推理顺序是:
- Physical Motion:先判断“什么东西在动?往哪动?”——通过光流表达;
- Geometry:再推演“这样的运动如何改变三维空间关系?”——杯子位置变了,机械臂与杯子距离变了,整个场景结构随之调整,这一步由 Depth 和 Pointmap 表达;
- Future Observation:最后才生成“在这样的运动与几何变化后,未来画面应该是什么样?”
于是形成一条清晰的链:Observation → Physical Motion → Geometry → Future Observation。
为防止模型“偷看答案”,CausalWM 还引入 stage-ordered attention mask。简单说,就是给不同推理阶段设阅读权限:前面步骤只能看到已发生的信息,不能提前读取后面的 Pointmap 或未来画面。这样,无论训练还是推理,模型都必须按 Motion → Geometry → Future 的顺序往下走。
三阶段训练:从生成能力到因果优化
要让模型真正沿着这条链推演,光有架构不够。Aether AI 构建了约 3 万小时的具身视频混合数据,覆盖机器人操作、第一视角视频、多视角机器人数据等物理交互场景。训练分三步走:
第一阶段:Pixel-level Pre-training
以 LTX-2.3-22B 为基座,在大规模视频上学习语言条件下的未来预测。目标是先建立足够强的世界生成能力——给一段当前画面和任务描述,模型能生成连贯可信的后续视频。
现实数据的一大难题是:大量视频缺少机器人动作标注,且不同机器人的关节数量、控制方式差异巨大。团队为此引入 CD-LAM,从视频中提取统一的 latent action(潜在动作)。它能把画面变化压缩成一种通用动作表示,让模型在无真实控制指令时仍能学习“什么动作带来什么变化”。不同机器人的视频也能通过这套表示共同训练。
此外,考虑到机器人通常有头部、手腕等多个摄像头,团队还训练了多视角版本,确保模型能从不同位置观察同一次操作并保持状态一致——这为后续参加 TriWorldBench 打下基础。
第二阶段:Causal CoT Mid-training
正式学习因果思维链。模型按预设物理依赖关系逐步生成中间变量,典型顺序是:Flow → Pointmap → Future RGB。
前一步的预测结果会重新放回上下文,指导下一步。例如,预测出的光流用于推演 Pointmap,Pointmap 又参与未来画面生成。同时,stage-ordered attention mask 确保模型无法提前看到后面的答案,迫使它真正依赖中间推理。
第三阶段:Multi-objective RL Post-training
视频生成具有开放性——同一初始场景可能有多个合理未来。单纯监督学习难以兼顾物理一致性、时序质量和任务完成度。
CausalWM 因此加入多目标强化学习。针对同一上下文,模型采样多个未来结果,再从物理一致性、视觉质量、任务完成度等维度获得奖励,通过 group-based optimization 比较优化候选结果。
这一步还反向优化中间的 Causal CoT:能产生合理未来的推理路径被强化,容易带偏运动和几何关系的路径被抑制。因果链由此从固定监督链,变成可探索优化的物理推理过程。
中间变量变成“控制旋钮”
Causal CoT 还带来一个意外收获:它成了 in-context learning 的控制接口。
训练中,模型不断接收光流、深度、Pointmap 等视觉变量,并用它们生成下一步结果。久而久之,它学会了一种更通用的操作:只要新条件能表示成视觉信息,就有机会被放进上下文参与未来生成。
例如,研究人员在仿真器中规划好机械臂关节轨迹,利用机器人 URDF 结构和正向运动学,可将这串关节数据渲染成画面中的动作轨迹,再编码成视觉 token 输入 CausalWM。
经少量微调,模型就能识别这种原本不在 Causal CoT 中的条件,并生成与指定轨迹一致的未来视频。人工绘制的物体路径、几何约束等视觉信号,也可沿同一接口输入。
这已接近因果问题的核心:普通预测问“接下来大概率出现什么?”,而加入轨迹相当于主动干预一个条件,再观察未来如何变化。模型开始处理“如果让机械臂这样运动,杯子会怎样移动”这类带有干预意味的问题。
当然,这离严格反事实推理还有距离,但它让世界模型从“观看未来”迈向“操纵条件、比较结果”。
在 TriWorldBench 和 PAI-Bench 上验证效果
CausalWM 在多个具身世界模型基准上进行了评测,包括在线榜单 TriWorldBench 和离线基准 PAI-Bench。
TriWorldBench 要求模型同时生成头部、左腕、右腕三个视角的未来画面——这模拟了机器人真实工作状态:头部看全局任务,腕部关注局部接触。三个画面不仅要各自“像”,还必须描述同一个物理世界:机器人何时运动、物体是否被抓取、不同视角状态能否对应。
CausalWM 以 66.04 的 TWB-Score 登顶榜首,在三视角一致性、任务对齐、运动质量、透视合理性和图像质量等多项指标均进入前列。它并未包揽所有单项第一,但总分领先说明其能较好平衡多视角一致性、任务理解和物理交互。
PAI-Bench 则拷问更底层问题:模型预测的未来是否符合物理规律?该基准案例来自行车记录仪、工业相机等真实场景,横跨自动驾驶、机器人操作、工业、人类活动等领域。评测不仅看画面质量,还引入“Domain Score”——让多模态大模型当裁判,对着生成视频逐条追问物理细节。因此,仅靠“画面像”无法拿高分。
CausalWM 在 PAI-Bench 也取得领先。同一套方法在多种任务设置下表现稳健,至少说明:相比直接从 Observation 跳到 Future,显式建模 Motion 和 Geometry 确实有助于更稳定地预测物理世界变化。
从“预测世界”到“理解世界”
过去几年,世界模型的主线是 Scaling:更多数据、更大模型、更长视频、更高分辨率。这条路教会模型回答“未来长什么样”。Aether AI 更关心另一个问题:“未来为什么会这样发生?什么真正决定了未来?”
这也是其推进 因果智能(Causal Intelligence) 的核心出发点。现有方法常把运动、几何、物理知识隐式压缩进隐表示,模型可能生成合理未来,却难判断它是否识别了 关键因果变量,还是依赖数据中的 shortcut correlation 直接“猜”结果。随着预测时间拉长、交互变复杂,这种隐式建模的局限会更明显,误差在看不见处层层累积。
CausalWM 是 Aether AI 在因果世界模型方向的第一版尝试。它把隐藏在模型内部的物理变化显式化,将光流、深度、三维几何组织成有序的 Causal CoT,让模型沿 Motion → Geometry → Future 的因果链逐步推演。换句话说,模型不再只学“输入到结果”的相关性,而开始显式建模 哪些中间变化导致了哪些后续结果。
实验验证了这条路线的潜力:CausalWM 登顶 TriWorldBench,在 PAI-Bench 多项指标超 SOTA,其中不乏参数更大的模型。相比继续扩大规模,Aether AI 更想验证另一条路径:通过建模 causal variables、causal dependencies 和 causal transitions,提升世界模型对物理世界的理解能力。
更进一步,Causal CoT 让“因果推理”和“控制”共享同一接口。原本用于解释未来的中间变量,可反过来作为 intervention 通过 in-context learning 注入。例如,将仿真器中规划的机械臂轨迹渲染成视觉信号加入 context,模型就能生成与该干预一致的未来。这意味着,世界模型开始从单纯观察“世界会发生什么”,走向建模:“当我们改变某个变量、施加某个行动后,世界将如何变化。”
当然,CausalWM 只是起点,离完整因果发现和反事实推理仍有很长距离。但这也正是 Aether AI 希望持续推进的方向:从因果表示学习、因果推理到因果干涉,逐步实现更完整的因果智能。
把视野放宽,CausalWM 只是长期路线的一个阶段性成果。此前的 RSIAgent 让智能体在数字环境里主动探索、验证操作与结果的关系;CausalWM 则把同一问题搬进物理世界——一个处理软件里的因果,一个处理物理世界里的因果。
这正是 Aether AI “Towards Real-World Causal Intelligence” 所指向的方向:让 AI 从预测相关性,走向发现因果、理解因果、利用因果,并最终通过因果作用于世界。