世界模型定义之争:为何“动作条件”是具身智能的核心门槛?
具身智能的“大脑”困境:从行为模仿到机理理解
2026年上半年,中国人工智能领域出现了一个显著的资金与人才流向:世界模型。据行业数据显示,仅前六个月,国内世界模型赛道的披露融资总额约为300亿元。若将“具身智能+世界模型”的融合赛道纳入统计,这一数字更是膨胀至900多亿元,融资增速超过去年同期5倍。百亿资金与海量人才的涌入,标志着行业对下一代AI核心能力的极度渴求。
然而,在热潮之下,一个核心问题悬而未决:究竟什么是世界模型?从业者寻找方向,投资人筛选标的,大厂研究生存策略,所有人都希望有人能厘清这一概念的边界。在这一背景下,IDEA研究院讲席科学家、视启未来创始人张磊给出了极具操作性的定义。作为IEEE Fellow,张磊在计算机视觉领域拥有深厚的积累,其主导的DINO系列模型曾在COCO榜单上霸榜,Grounding DINO和DINO-X更是被李飞飞团队、英伟达等全球顶尖机构广泛引用。
具身智能当前面临的最大瓶颈并非本体硬件,而是“大脑”的深层次能力缺失。虽然宇树、智元等企业在运动控制和本体成本上取得了显著进展,甚至实现了马拉松奔跑和翻跟头等高难度动作,但这些能力更多依赖于仿真强化学习带来的硬件迭代。真正的挑战在于,现有深度学习模型主要学习的是智能的“行为表象”,而非“智能机理”。具身智能需要的是对物理世界的因果推断能力,即理解“因为A所以B”的逻辑链条,而不仅仅是统计关联。目前,大多数机器人仍依赖外部算力,且成功率在复杂场景下难以突破70%-80%的阈值,这意味着每五次操作就有一次失败,无法满足独立部署的需求。
世界模型的复兴:从游戏验证到物理世界
世界模型并非新概念,早在20世纪90年代就有学者提出,旨在帮助强化学习智能体对环境进行建模。2018年至2020年间,随着深度学习的发展,World Models概念在游戏场景中得到了验证,AI智能体开始尝试自主“学出”环境演化过程。然而,这一概念在沉寂二十年后突然爆发,其核心驱动力来自具身智能对高效试错机制的迫切需求。
当前,视觉-语言-动作模型(VLA)主要沿用大语言模型的模仿学习范式,即通过预测下一个动作来执行任务。这种方法虽然有效,但面临两大致命障碍:数据收集效率极低,以及真实环境中的失败成本不可承受。在数字世界中,语言模型可以低成本试错;但在物理世界中,机器人学习洗碗可能打碎一万个碗,学习驾驶可能经历大量事故。世界模型提供的虚拟环境,正是解决这一痛点的出口。它允许机器人在虚拟空间中通过“脑补”推演动作后果,从而在真实执行前优化策略,大幅降低试错成本。
定义澄清:不以动作为输入,就不叫世界模型
在行业定义混乱的当下,张磊提出了一个严格的判定标准:真正的世界模型必须具备“动作依赖性”(Action Conditioned)。这意味着模型必须能够回答“如果执行某个动作,环境会变成什么样”。智能体与环境的交互是一个闭环过程,环境状态的每一次转移都依赖于上一步执行的具体动作。因此,世界模型的本质不应仅仅是Next State Prediction(下一状态预测),而应是Action Conditioned的Next State Prediction。
这一标准将纯视频生成模型(如Sora)和World Action Model(WAM)排除在世界模型的核心定义之外。Sora等视频生成模型虽然能生成自洽的视频序列,但缺乏对“动作”的建模,无法直接服务于强化学习中的交互决策。WAM虽然涉及动作预测,但其建模逻辑是先果后因,即先生成未来画面再反推动作,这种逆向推导方式同样无法直接用于强化学习中的正向策略优化。只有那些能够基于动作条件预测环境状态变化的模型,才真正符合强化学习需求,具备辅助具身智能决策的价值。
路线之争:像素派与隐空间派的殊途同归
世界模型的技术路线主要分为像素派和隐空间派。像素派以Sora为代表,追求像素级的逼真还原;隐空间派以LeCun的JEPA架构为代表,主张在抽象表征空间中进行预测。张磊指出,这两条路线并非水火不容,而是各有侧重。实际上,像素派在处理图像时也会借助隐空间进行压缩和表征,因此表征空间才是更本质的问题。
两者的核心分歧在于进入隐空间后保留什么信息。隐空间派希望排除光影、纹理等非物理规律驱动的像素细节,以学习状态变化背后的本质规律,但这面临“表征坍塌”的风险,即不同状态映射为相同表示,导致模型丧失辨别能力。像素派则追求视觉细节的完整性,但这往往是为了迎合人类的视觉感知,而非物理合理性。张磊强调,以人眼对画质的判断作为世界模型的评价标准是不充分的。人脑在进行反事实推理时,也是在隐空间中进行操作,而非逐像素渲染。因此,世界模型应追求生成序列的物理合理性,而非单纯的视觉逼真度。
物体结构:隐空间路线的关键增量
在隐空间路线上,张磊团队提出了一个关键改进:引入“物体结构”。LeCun的JEPA架构虽然验证了表征空间预测的有效性,但在面对具身智能所需的复杂物理环境时,缺乏对物体独立性的建模。张磊团队基于DINO-X在开放世界物体感知上的优势,让物体成为世界模型预测与规划的基本单元。物理规律是作用在物体上的,让隐空间表征理解物体及其相互关系,可以更有效地学习物理规律,避免表征坍塌,同时提升模型在真实环境中的泛化能力。
这种“物体为中心”的框架并非束缚,而是通过Mask技术处理流沙、水流等非刚性物体,实现了对复杂物理场景的务实建模。通过反事实测试,可以验证模型是否真正理解了物理规律:如果模型在轨迹微调后仍能做出正确预测,说明其学到了规律;否则,仅学到了统计相关性。这种简洁的范式迭代,避免了过多人为设计对长期发展的阻碍。
数据闭环与动作对齐:从EgoTwin到真实落地
世界模型的落地离不开高质量的数据支撑。张磊团队提出的EgoTwin解决方案,旨在解决“动作对齐”问题。由于人手与机械臂的构型差异,直接混用2D视频和3D坐标数据效率低下。EgoTwin通过提取3D关键点,将人手的2D视频转化为3D空间操作序列,与机械臂数据对齐到同一物理空间,实现了多本体动作的统一表征。这一技术不仅解决了数据采集的效率问题,还为更高层的动作意图理解奠定了基础。
数据质量是训练世界模型的关键。张磊强调,需要算法和数据两条线并行迭代,找到懂算法的人深入参与数据采集,确保数据的有效利用。从Grounding DINO到DINO-X,团队在通用物体感知上的积累,为世界模型提供了坚实的感知基础。这种从感知到决策的闭环能力,是视启未来在竞争激烈的市场中脱颖而出的核心优势。
科研底色:理解透与长期主义
张磊的科研历程深受两位导师的影响:张钹院士和沈向洋院士。张钹院士强调“理解透”,即透彻理解底层原理,避免被表象欺骗;沈向洋院士则在产业方向和团队构建上给予指导。这种“理解透”的科研底色,贯穿了张磊从AGV小车调试到世界模型研究的三十年。在面对技术低谷时,他坚持死磕难题,通过换个角度或等待数据涌现来实现突破。这种长期主义和好奇心驱动的研究态度,是中国科研人精神传承的缩影。
世界模型作为具身智能的关键答案,其发展路径依然充满挑战。但通过明确定义、优化路线、强化数据闭环,行业正逐步从概念炒作走向实质突破。对于从业者而言,保持对第一性原理的追问和对底层机理的深刻理解,是在这一浪潮中立于不败之地的关键。