物理AI新瓶颈:模型路线趋同后,胜负手转向何处?

0 阅读

物理AI路线趋同,瓶颈浮出水面

过去一年多,VLA、世界模型、基座模型、数据闭环等概念频繁出现在智能驾驶和具身智能公司的技术宣言中。越来越多的AI公司试图让模型进入真实世界,赋予机器理解环境、预测变化和执行行动的能力。不同技术路线各有侧重,但穿透到技术底层,指向的问题却越来越趋同:AI如何从真实世界获取数据,如何形成对环境的理解,如何将理解转化为行动,又如何根据行动结果持续学习。

这个问题并非今天才出现,但当路线逐渐收敛,真正的瓶颈开始显现。

从模块化到端到端,再到物理AI

智能驾驶的研究对象经历了多次变迁。早期是高度模块化的软件系统,感知、预测、规划和控制各司其职,每个模块有相对独立的指标。端到端模型兴起后,行业开始减少人工规则和模块接口,让模型直接从传感器输入生成轨迹或控制信号。直到物理AI热潮席卷,研究对象进一步推进到让AI理解并作用于整个物理世界。

当前,物理AI的技术表达大致收敛为两条明线和一条暗线。

明线一:VLA(视觉-语言-动作)。将视觉信息、语义理解和行动生成整合进同一模型体系,让AI看到环境、理解场景,直接作出行动。理想、小鹏等车企押注这一路线。

明线二:世界模型。重点学习环境如何随时间和动作变化,用于场景生成、闭环仿真、数据生产和模型评测。华为WEWA、蔚来NWM是代表。

暗线:物理AI基座。通过大规模物理世界数据预训练,学习环境变化、物体关系和运行规律,再通过少样本或后训练适配不同任务。基座模型与VLA、世界模型并不并列,而是两条明线共同奔赴的方向。

两条明线的边界已趋于模糊,关系从路线选择走向能力协同。但整合起来绝非易事,当前行业虽已拥有大部分技术组件,各环节之间却存在几层“断裂”。

三层“断裂”阻碍物理AI进化

第一层断裂:模型与数据之间。物理AI需要海量真实数据,但数据规模扩大并不会自动产生对世界的理解。模型需要从数据中学习空间关系、时间变化、行为规律和行动后果。同时,模型在真实环境中暴露的能力缺口,又决定下一轮需要收集、筛选或生成什么数据。因此,数据与模型之间需要持续反馈:模型发现问题,数据系统补充场景,训练系统重新学习,再通过评测和真实环境确认能力提升。

第二层断裂:视觉与行动之间。模型看见场景并理解关系,不代表能形成稳定行动。物理AI区别于传统AI的关键在于视觉与行动的关系。例如,车辆识别到前方行人可能横穿马路,还需解决一系列问题:何时开始减速、减速幅度多大、是否变道、周围车辆如何响应、动作能否在实时算力下平稳执行。视觉和语义理解需要转化为连续、实时、可验证的动作。VLA承担连接认知与行动的任务,但这条连接仍需未来预测、策略训练、闭环评测和真实验证共同支撑。

第三层断裂:模拟与真实之间。世界模型和仿真系统可低成本生成大量场景用于训练和测试,但真实世界情况更复杂:交通参与者行为不确定,传感器受天气、光照和遮挡影响,大量长尾事件难以完整建模。模型在虚拟环境中的提升未必能等比例转化为真实表现。物理AI必须建立双向链路:真实世界的问题进入仿真和训练,仿真中获得的能力再回到真实环境验证。

这些断裂层横跨数据、算法、仿真、Infra、产品和工程团队,看似属于不同技术方向,实则指向同一问题——物理AI需要一套能够持续学习和进化的系统。这已非独立模型所能解决,技术问题开始越过技术部门边界,延伸到技术如何被组织,放进同一个闭环。

弥合断裂:构建技术闭环与组织闭环

物理AI公司的当务之急是弥合断裂层,把整条链路放进同一个研究闭环。但建立闭环前,还需解决研发体系中的两层“摩擦”。

第一层摩擦:技术之间。模型暴露的不足需反馈给数据系统;真实环境问题需进入仿真和训练流程;训练后的能力需回到现实场景检验。难点在于这些环节并非独立存在,任何一环连接不畅,投入再多数据、算力和模型规模,也可能只带来局部指标提升。

第二层摩擦:研发组织内部。通常,基础模型、VLA或世界模型、数据、仿真和AI Infra由不同团队负责,各有专业目标和工作节奏。但完整闭环要求所有环节围绕同一模型问题快速反馈,现实中很难天然对齐。因此,技术闭环最终需要组织闭环支撑。

在这一行业困局下,国内首个面向物理世界基础能力研究的AI Lab——Superfluid Lab出现了。它来自深圳公司元戎启行,由前DeepSeek核心成员、元戎启行首席科学家阮翀带队。

“Superfluid”意为超流体,一种完全没有黏性的奇特物质状态,可理解为“无视”摩擦力的流体。超流体能在环状容器中永无止境流动而不损失能量,也能零阻力穿过极微小缝隙。这名字有两层含义:一是信息零阻力流动、协作零内耗;二是进入物理世界的智能需要零摩擦的底层架构。这恰好对应研发闭环所需面对的两层摩擦。

据知情人士透露,Superfluid Lab于今年5月在元戎内部成立,已完成基础设施重构等早期工作。实验室以基座模型为研究核心,重点探索VLA模型,同时推进世界模型和多模态理解。首次公开时,元戎同步发起招聘,分三个方向:大模型算法(视觉、语言与动作结合)、仿真算法(物理规律建模、环境交互、仿真到真实迁移)、AI Infra(构建支撑大模型训练的新一代基础设施)。

从招聘方向看,Superfluid Lab覆盖模型、仿真和训练基础设施。其基本技术结构可推测为:基座模型从物理世界数据中形成认知,VLA模型将认知转化为行动,世界模型推演行动结果并提供仿真环境,AI Infra支撑大规模训练和高频实验,最终由真实世界完成验证。

在《对话Superfluid》中,元戎将研究重点概括为三组关系:模型与数据之间的流畅性、视觉与行动之间的衔接、模拟与真实之间的迁移。实验室第一步是定义问题,再进入研究和解决过程。基座模型被放在闭环中心,阮翀称之为“一种信仰”。这里的“信仰”并非指已有确定答案,而是指向研究周期和目标:持续挑战模型能力上限,解决越来越复杂的问题。

基座模型的特殊之处在于改变了过去AI研发以单点能力优化为中心的方式。因此,基座模型竞争背后不只是算法竞争,更是围绕模型持续迭代的研发体系竞争。

这套技术闭环也提出相应的组织要求。招聘信息显示,Superfluid Lab强调开放的研究环境、相对扁平的协作方式和较少的固定工作边界。不同方向的研究人员围绕同一模型展开工作,并共同对最终模型能力负责。这是一种新的组织范式,与传统研发围绕车型、版本和功能迭代不同,Superfluid Lab不以某一产品节点为研究终点,而是围绕基础模型能力建立长期路线,更像持续循环过程。研究单位从独立模块转向持续演进的模型,评价目标从局部指标扩展到模型最终能力。

这种组织方式能否真正提升物理AI研发效率,仍需时间验证。Superfluid Lab更像一次探索,尝试通过改变研发组织方式,建立更高效的能力积累路径。而这背后对应整个行业正在发生的变化。

物理AI竞争进入新阶段

回看智能驾驶发展,行业竞争核心正在变化,技术竞争进入新阶段。演进路径大致分三个阶段:

第一阶段:产品竞争。比较功能覆盖、用户体验、量产规模和商业化效率,技术价值通过可交付产品体现。

第二阶段:模型竞争。端到端、VLA、世界模型成为比较对象,数据规模、模型参数、训练算力和迭代速度影响技术差距。

第三阶段:基础能力与组织竞争。企业需将人才、数据、算力、模型、仿真、工程和真实世界反馈组织成能长期进化的系统。

从这一趋势看,Superfluid Lab可视为元戎提前进入第三阶段的尝试。据接近元戎的人士介绍,元戎从创立之初就定位为AI公司,也是最早以“物理AI”定位自身的公司,时间可追溯到2025年3月,比行业整体浪潮提前近一年。选择从智驾行业入手,是因为辅助驾驶积累的真实数据、工程能力和开放道路场景,是行业内普遍认可的物理AI能力“试金石”。随着基座模型、多模态等技术成熟,这些积累开始向更广泛物理世界能力延伸。

Superfluid Lab正是在这一背景下成立,依托驾驶产生的数据和工程反馈,专注于将研究目标指向物理世界的通用基础能力。元戎启行也逐步从提供辅助驾驶技术的公司,走向生产物理世界基础能力的公司。

这种变化与十年前OpenAI的思路有相似性。2015年末OpenAI成立时,AI已有大量应用和研究成果,但行业缺少一套能持续提升智能能力的基础体系。OpenAI选择围绕更底层的通用智能问题建立长期研究组织,随后推动基础模型时代。几年后,基础模型成为AI产业底座,大量应用建立其上。如今,物理AI正经历类似阶段:自动驾驶、机器人等应用快速发展,但行业仍缺少能理解物理世界、预测环境变化、通过真实反馈持续进化的基础能力体系。当时OpenAI探索数字世界智能的底层能力,今天物理AI领域寻找的是面向物理世界的智能底座。

Superfluid Lab就是这一背景下的一次探索。但不得不说,这一定位仍需长期结果支撑。相较于过去用新模型、新参数和新纪录衡量进步,第三阶段周期更长,更难在短期内证明价值。然而,连接数据、研究、工程和真实世界的能力,往往只能在更长时间里沉淀。

阮翀对这种长期投入有更直接的解释:“快的东西,往往也很快被替代。慢的东西,一旦建成,会成为很多快的东西的底座。”真正的长期主义,始终是去做那些难而正确的事。