小鹏第二代VLA大模型升级:4D时空理解如何重塑智能驾驶安全边界?
在人工智能与物理世界深度融合的进程中,理解“时间”正成为智能体能否真正融入现实环境的关键分水岭。2026年8月27日,小鹏集团以“TIME 时间”为主题,正式发布第二代VLA(Vision-Language-Action)大模型的首次重大升级。这一版本不仅标志着其物理AI基座模型从静态3D空间感知迈向动态4D时空理解,更通过多项底层技术创新,将智能驾驶的综合安全能力提升达20倍。这场技术演进的背后,是一套围绕时间维度重构的全新认知架构。

传统自动驾驶系统依赖于对单帧图像或短时序列的识别与响应,本质上仍将世界视为一系列离散快照。然而真实交通场景是连续演化的:一辆车的轨迹、行人的意图、旁车的变道倾向,都需基于历史行为进行推断。小鹏此次升级的核心突破,在于引入Infini-VLA长时序架构,使模型能够有效记忆并处理过去30秒内的完整环境状态。这意味着AI不再仅“看到此刻”,而是“理解过程”——例如,当一辆电动车在路口反复犹豫是否左转,系统可基于其前10秒的微小移动趋势预判其最终意图,而非等到其突然启动才被动反应。
为支撑这一长时序理解能力,小鹏将端侧VLA模型的参数量扩大3.5倍,显著拉开了与业内主流轻量化模型的差距。更大的模型容量不仅提升了感知精度,更为复杂时序建模提供了必要算力基础。但参数增长若伴随延迟上升,则可能抵消安全增益。为此,小鹏同步推出Streaming Inference(流式自回归推理) 技术,彻底改变传统“采集-处理-决策”的串行流程。新架构下,传感器数据流持续输入,模型边接收、边推理、边输出控制指令,实现真正的“边看、边想、边行动”。实测显示,端到端响应速度提升300%,在应对前车急刹、行人折返等高危场景时,系统反应时间缩短至人类老司机水平。
更进一步,小鹏首次将X-Foresight预测世界模型部署上车。该模型可对未来6秒内周边交通参与者的行为进行多模态推演,生成概率化的轨迹分布。例如,在无保护左转场景中,系统不仅能识别对向直行车流,还能预测其中某辆车因前方施工而减速变道的可能性,并据此调整自身通行策略。这种前瞻性能力,使得车辆从“被动避险”转向“主动规避”,大幅降低冲突概率。
值得注意的是,上述能力并非孤立存在,而是通过MoT(Mixture of Tasks)混合架构实现高效协同。MoT根据当前驾驶场景(如高速巡航、城区拥堵、自动泊车)动态激活模型中对应的任务专家模块,避免不同场景下的功能干扰。例如,在园区低速泊车时,系统会强化对静态障碍物和车位几何的建模能力,同时弱化对高速车辆轨迹的预测权重,从而在有限算力下实现资源最优分配。
在座舱交互层面,小鹏首次推出整车大脑Master Agent,标志着其从“功能集成”迈向“意图驱动”的智能体范式。Master Agent作为中央协调者,可理解用户模糊自然语言指令(如“找个安静地方停一下”),并自动拆解为“寻找低噪路段→开启靠边停车→激活自动泊入”等子任务,调度智驾、底盘、车身控制等多个垂直Agent协同执行。这种架构借鉴了机器人领域的任务规划逻辑,使车机系统具备类人的问题分解与执行能力。新版本已支持“语音靠边停车”“语音就近泊入”等功能,形成从语义理解到物理动作的完整闭环。
技术下放方面,小鹏正加速将Robotaxi的L4级能力注入量产车型。搭载第二代VLA的Robotaxi已获广州主驾无安全员测试资质,其同源技术通过模块化设计反哺G9L等消费级产品。例如,X-Foresight模型最初为无人出租车开发,现经优化后适配于G9L的Max版本,使普通用户也能享受高阶预测能力。
为实现科技普惠,小鹏并未止步于高端平台。通过学习式Token压缩与蒸馏训练,团队成功将第二代VLA的核心能力压缩至更低算力平台,推出图灵VLA 2.0 Lite版本。该轻量化模型将于9月首发搭载于小鹏G9L Max,让更多用户以合理成本体验先进AI驾驶辅助。这种“大模型蒸馏+边缘部署”策略,体现了小鹏在性能与普及之间的平衡智慧。
全球化布局亦同步推进。近期,小鹏在德国完成第二代VLA的本地化验收测试,涵盖欧洲典型道路结构、交通规则及天气条件。目标是在2027年上半年率先获得欧盟监管许可,实现海外交付。这不仅是技术输出,更是对物理AI跨文化适应能力的验证——模型需理解德国环岛优先权、法国窄巷会车习惯等本地化规则,方能在全球市场真正落地。
支撑这一切的,是小鹏长期构建的AI Infra体系。依托百万级车队产生的十亿级真实驾驶片段(clips),其数据飞轮单次训练吞吐量已达1亿clips,半年内增长10倍。这些数据不仅用于模型迭代,更通过仿真平台生成极端场景,加速corner case覆盖。更重要的是,这套基础设施正从汽车延伸至机器人领域。搭载3颗图灵AI芯片的小鹏人形机器人IRON,算力高达2250 TOPS,已能端侧运行VLA模型并自主完成搬运、操作等复杂任务。近期机器人业务完成超9亿美元融资,投后估值超63亿美元,印证资本市场对其具身智能路径的认可。
小鹏的终极愿景,是打造一个统一的物理AI技术底座,使汽车、机器人乃至未来其他智能体共享同一套感知-决策-执行框架。当VLA模型在G9L上学会预测行人轨迹,在IRON机器人上学会避开移动障碍物,其底层时空理解能力实则同源。这种跨本体复用,不仅能摊薄研发成本,更能通过多场景数据反哺加速模型进化。
回望此次升级,“理解时间”不仅是技术口号,更是认知范式的根本转变。当AI开始以连续、动态、前瞻的方式解读世界,安全便不再是被动防御的结果,而是主动塑造的产物。20倍的安全能力提升,背后是30秒的记忆长度、6秒的预测视野、300%的响应提速,以及一个正在成型的物理智能生态。小鹏正试图证明:真正的智能,不在于瞬间的精准识别,而在于对时间流中因果链条的深刻把握。