AI落地物理世界为何遇阻?冯雁解析JEPA模型如何破解落地难题
物理世界的“接地气”挑战:从数字幻觉到因果真实
人工智能(AI)正在经历一场从数字空间向物理世界延伸的深刻变革。然而,这一过程并非坦途。在ICML 2026大会上,AMI Labs联合创始人兼首席研究创新官冯雁(Pascale Fung)指出,当前主流的大语言模型(LLMs)虽然具备强大的文本处理能力,但在面对真实世界的物理交互时,仍存在显著的“落地差距”。这种差距的核心,在于模型缺乏对物理世界因果关系的深刻理解。
现实世界中的AI智能体主要分为两类:一类是嵌入可穿戴设备(如智能眼镜)的主动式辅助智能体,它们与人类共享第一人称感知场,承担过程规划与实时指导;另一类是部署于自动驾驶或机器人系统中的执行智能体,需完成从高层语义指令到电机细微动作的分层规划。尽管形态各异,这两类智能体的共同能力底座是对物理世界演化的预测能力。无论是预判用户动作以避免干扰,还是推演机械臂轨迹以规避碰撞,这种预测远非背诵文本或识别静态图像所能及,它要求模型内化一套可因果推理的物理认知框架。
大语言模型的局限:文本世界的“二手”认知
为何现有的大语言模型难以直接用于物理世界决策?冯雁从三个维度剖析了LLMs的固有缺陷。首先,LLMs的训练数据来源于人类写下的文本描述,这意味着它们学习的是“二手”的世界模型。它们掌握的是关于力的词汇,而非力本身,因此无法真正预测重力、质量或嘈杂环境中的实际物理相互作用。
其次,LLMs的优化目标旨在优化对话流畅度或语言描述的美观性,而非因果推理的正确性。这种错误的优化目标导致模型需要耗费数万亿token进行训练,但其在物理学习上的效率仍远低于人类。更关键的是,LLMs基于生成下一个Token的机制,必然产生“幻觉”。在文本交互中,幻觉可能仅被视为无伤大雅的错误,但在物理世界中,幻觉意味着机器人可能产生错误的动作指令,导致碰撞或事故,这是不可接受的风险。
多项基准测试数据佐证了这一观点。在DeepPhy物理推理基准中,人类表现率为64.7%,而GPT-4o等顶级模型仅为35.2%左右,甚至接近随机水平。在测试直觉物理理解的IntPhys 2基准中,生成模型的得分也远低于人类近乎完美的表现。这些结果揭示了一个核心事实:LLMs和视觉语言模型(VLMs)虽然能背诵物理教科书,但并未真正理解物理世界。
JEPA路线的优势:追求因果正确性而非像素完美
面对LLMs的局限,Yann LeCun提出的联合嵌入预测架构(JEPA,Joint Embedding Predictive Architecture)提供了另一种解题思路。JEPA代表了对世界建模的不同设计哲学。传统的生成式世界模型(如Cosmos、Genie)认为,AI若要理解世界,必须能够完整生成每一帧的像素细节。这类模型通过预测下一帧图像来模拟世界,依赖于复杂的自编码器或扩散模型。
相比之下,JEPA并不尝试生成视频或预测像素,而是预测未来世界状态和动作的抽象表示。它舍弃了不可预测或无关的细节,直接在潜空间(Latent Space)中进行推理。冯雁用了一个生动的例子来解释这一区别:当一个人进入房间时,并不会注意到每个像素,而是根据任务惯例忽略不必要的细节,关注屏幕、文字或特定的人。JEPA正是模拟了人类的这一认知机制,预测重要的信息,忽略不重要的信息。
这种设计带来了显著的结构性优势。由于不需要重构每个像素,JEPA模型的参数量更小,推理速度更快,且对噪声和环境连续变化的鲁棒性更强。它关注的是抽象空间中的结构核心,例如预期玻璃会掉落,而不必渲染它下落时的每一个光影变化。对于需要在实时环境中做出决策的物理智能体而言,这种“理解”而非“生成”的模型更具实用价值。
VL-JEPA与可穿戴智能:主动式辅助的实时响应
在可穿戴AI领域,JEPA路线的优势尤为突出。冯雁介绍了AMI Labs开发的VL-JEPA(Vision-Language JEPA)模型,专门用于解决可穿戴设备上的主动式辅助问题。这类智能体需要始终开启,具备环境智能和上下文感知能力,能够无延迟地理解当前情境并主动提供建议。
生成式模型在可穿戴设备上面临巨大挑战,因为它们的计算成本高且延迟大,难以满足实时性要求。VL-JEPA通过在语言空间进行世界建模,将视觉输入和文本查询编码到公共嵌入空间,实现了开放词汇的动作和状态跟踪。与逐Token生成的VLM不同,VL-JEPA不强制重建表面细节,而是预测目标语义嵌入,从而消除了自回归延迟。
演示案例显示,当用户尝试制作黄油派时,VL-JEPA能够实时跟踪用户的动作,并在嵌入空间中预测下一步操作。如果用户中途喝水,模型能识别这是无关动作并直接忽略,继续根据预设计划提供指导。这种选择性解码机制不仅提高了效率,还实现了节能。VL-JEPA以少50%的参数达到了比VLM更高的性能,且在推理速度上更具优势,完美契合了边缘设备的算力约束。
从机器人规划到开源生态:构建具身智能基石
在自主系统方面,JEPA同样展现出强大的潜力。冯雁提到的V-JEPA 2模型已用于机器人规划,能够在嵌入空间中进行过程规划,预测机械臂在初始状态和目标之间的运动轨迹。AMI Labs与纽约大学合作开发的LeWorldModel,更是实现了从原始像素直接训练的端到端稳定JEPA模型,仅使用两种损失项就实现了高效的模型预测控制(MPC)。
为了推动这一技术路线的生态建设,团队发布了包含1.47亿个层次结构动作的Action-100M开源数据集,并推出了主动过程协助基准和架构。这些资源旨在帮助研究者更好地探索可穿戴AI和自主系统的主动协助机制。例如,在制作浓缩咖啡的场景中,智能体不仅能监控进度,还能在用户偏离计划时自动检测偏差并重新规划。
伦理与安全:技术落地的必要考量
随着AI智能体深入物理世界,伦理安全问题日益凸显。可穿戴设备和机器人始终开启的摄像头和麦克风捕捉到的数据极度个人化,且可能涉及旁观者隐私。此外,智能体的类人交互容易引发用户的过度信任和情感依赖,存在被不当利用的风险。
冯雁强调,需要在模型设计上平衡用户参与度和防操纵机制。这不仅是一个技术问题,更是一个社会问题。未来的AI智能体需要具备 principled agency(有原则的代理能力),在提供辅助的同时,确保用户的安全和自主权不被侵犯。
总体而言,JEPA路线通过其独特的架构设计,为AI从数字空间走向物理世界提供了一条切实可行的路径。它不再执着于像素级的完美生成,而是聚焦于因果正确性和高效推理。随着技术的不断突破和生态的逐步完善,我们可以期待看到一个更加智能、高效且安全的物理世界AI时代。