JEPA为何胜出?AI世界模型从像素生成到因果推理的范式跃迁
物理世界AI的瓶颈与破局:为何大语言模型不够用?
人工智能从数字空间向物理现实世界的跨越,正面临一道难以逾越的鸿沟。这道鸿沟并非源于算力的不足,而是源于认知范式的不匹配。在2026年ICML大会上,AMI Labs联合创始人冯雁教授指出,当前主流的大语言模型(LLM)和视觉语言模型(VLM)虽然能够处理海量的文本和图像描述,但它们本质上是“二手”世界的学习者。它们从人类生成的文本中学习物理规律,而非直接从物理交互中习得因果逻辑。
这种学习方式的根本缺陷在于优化目标的错位。LLM的训练目标是最大化下一个词元(token)的概率,旨在追求对话的流畅性和语言的优美度,而非对物理现实的精准模拟。这导致模型缺乏对重力、质量、摩擦力等基础物理量的真实理解。在DeepPhy、IntPhys 2等多个物理推理基准测试中,人类的表现遥遥领先,而即使是Claude、GPT-4o等前沿模型,其表现也远低于人类,仅略高于随机水平。例如,在评估物理直觉的测试中,人类得分高达90%以上,而VLM大多徘徊在50%-65%之间。
更致命的风险在于“幻觉”问题。在文本生成领域,幻觉或许仅是信息的偏差,用户可以事后辨别;但在物理世界,幻觉意味着预测与现实的脱节。对于自动驾驶汽车或协作机器人而言,将障碍物误判为空地,或将错误轨迹规划为可行路径,直接后果是物理碰撞与系统崩溃。这种“落地差距”(Grounding Gap)表明,仅靠规模堆砌和文本预训练,无法赋予AI智能体在复杂、噪声丰富且动态变化的真实环境中安全决策的能力。
生成式世界模型 vs. JEPA:两种截然不同的哲学
面对物理世界AI的难题,当前学术界主要衍生出两条技术路线:生成式世界模型与JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)。
生成式世界模型(如Cosmos、Genie等)的设计哲学源于一种直觉:要理解世界,就必须能够重现世界。这类模型通常基于自编码器或扩散模型,试图预测并生成未来的每一帧像素。虽然它们在视觉保真度上表现出色,能够生成逼真的驾驶视频或机器人操作画面,但这种“像素完美”的追求在物理世界应用中显得笨重且低效。生成过程需要巨大的计算开销,且容易陷入对无关细节的过度拟合,导致模型在面临环境微小变化或噪声时鲁棒性下降。
相比之下,JEPA路线由Yann LeCun提出,并随着V-JEPA系列工作的推进而日益成熟。JEPA的核心哲学是“预测重要的信息,忽略不重要的信息”。它不尝试重建像素,而是将图像、动作和状态编码到高维的潜在空间(Latent Space)中,并在该空间中预测未来的表征嵌入(Embeddings)。人类在观察世界时,并不会关注每一像素的细微变化,而是关注事物的结构关系和因果动态。例如,我们预见玻璃杯会掉落,是基于对重力和支撑力的理解,而非需要渲染玻璃碎裂时的每一个光子反射。
JEPA通过预测抽象表征,直接捕捉物理世界的因果结构。这种设计带来了显著的结构性优势:参数量更小、推理速度更快、对噪声和环境连续变化的鲁棒性更强。在嵌入空间中,模型可以进行高效的规划与推理,直接查询未来状态而不必“观看”具体的画面。这种对因果正确性的追求,而非像素的完美重建,使得JEPA在机器人控制、动作预测等需要高精度实时决策的任务中,展现出天然的优势。
JEPA技术脉络:从V-JEPA到VL-JEPA的关键突破
沿着JEPA的技术脉络,研究团队已完成了一系列标志性工作,逐步验证了该路线在物理世界应用中的可行性。
早期的V-JEPA利用自监督学习,在长达465年的视频数据上进行了训练,成功提取了兼具外观和运动特征的视觉表征,并在行动预期任务上达到最先进水平。随后的V-JEPA 2进一步将其应用于机器人规划,在嵌入空间中实现了机械臂的运动预测。最新的LeWorldModel则实现了端到端的稳定训练,仅需两种损失项即可从原始像素直接训练出高效的模型预测控制(MPC)规划器,并实现了开源。
在可穿戴AI智能体领域,JEPA的潜力得到了更充分的发挥。冯雁团队提出了VL-JEPA(Vision-Language JEPA),这是一种基于语言空间进行世界建模的创新方法。与生成式模型不同,VL-JEPA将观测和目标都转化为语言描述,在潜空间中预测未来动作和状态的语义嵌入。这种方法不仅大幅降低了计算复杂度,还赋予了智能体“心理世界模型”的能力——即理解人类用户的意图、目标和长期偏好。
VL-JEPA的一个重要特性是“有选择性地解码”。它不会无休止地生成内容,而是仅在检测到有意义的事件或动作变化时才进行解码输出。这一机制使得模型在保持实时性的同时,将解码操作减少了约2.85倍,极大地节省了功耗。在CVPR 2026 EgoVis行动识别挑战赛中,VL-JEPA凭借零样本跟踪动作和高能效比,赢得了冠军。此外,团队还发布了包含1.47亿个层次结构动作的Action-100M数据集,为社区提供了丰富的训练资源,进一步推动了JEPA生态的建设。
面向未来的智能体形态:可穿戴辅助与自主执行
冯雁教授将未来物理世界中的AI智能体划分为两大主力形态,二者虽任务迥异,但都依赖世界模型提供的预测能力作为能力底座。
第一类是嵌入可穿戴设备(如智能眼镜)的主动式辅助智能体。这类智能体拥有与人类共享的第一人称感知场,能实时看到和听到用户所经历的一切。其核心任务是“过程规划”与“主动协助”。例如,当用户尝试制作一道复杂的菜肴时,智能体不仅能提供菜谱,还能实时观察用户的动作,判断其是否偏离了计划,并给出个性化的指导。如果用户是新手,它会详细展示每一步操作;如果是老手,它则会根据长期记忆忽略琐碎步骤,仅在关键时刻介入。这种智能体需要处理长期的情景记忆、个性化偏好以及复杂的社交与文化线索,JEPA的高效性和低延迟特性使其成为可穿戴设备的理想选择。
第二类是部署于自动驾驶、无人机和家务机器人等系统中的自主执行智能体。这类智能体需要完成从高层语义指令到电机细微动作的分层规划。例如,收到“打扫房间”的指令后,智能体需将其分解为移动、抓取、放置等一系列子任务,并精确控制机械臂的动作轨迹。这要求模型具备强大的物理推理能力和鲁棒性,能够在不断变化的环境中进行零样本学习。JEPA通过预测未来状态的抽象表征,能够在低成本下实现高效的策略搜索,避免生成式模型在高频控制中的算力瓶颈。
伦理安全与挑战:构建负责任的世界模型
随着AI智能体深度介入物理世界,其带来的伦理与安全问题不容忽视。可穿戴设备和机器人的传感器始终开启,捕捉到的数据极度个人化且涉及旁观者隐私。此外,当智能体以类人方式交互时,容易引发用户的“拟人化”倾向,导致过度信任和情感依赖,这可能被不正当利用。
因此,在模型设计上必须平衡用户参与度与防操纵机制。未来的世界模型不仅需要具备技术上的准确性,还需内置伦理约束和安全护栏。例如,在预测用户行为时,应尊重其隐私边界;在提供建议时,需避免诱导性或误导性信息。正如冯雁教授所言,一个人读论文太孤单,一群人刷顶会才好玩。在追求技术突破的同时,学术界与产业界需共同努力,建立透明、可控、负责任的AI智能体生态,确保技术真正服务于人类福祉,而非成为新的风险源。
从LLM的文本幻觉到JEPA的因果预测,AI正在经历一场深刻的范式革命。JEPA路线因其对物理世界本质的更贴近理解,为智能体在现实世界中的落地提供了更具潜力的路径。随着V-JEPA、VL-JEPA等工作的不断迭代,以及开源数据集和基准测试的完善,我们有理由相信,具备真实物理认知能力的AI智能体,终将走出实验室,融入我们的日常生活。