文远WITT重构数据闭环:如何让每公里路都成为AI进化的燃料?
自动驾驶领域的核心矛盾正在发生深刻转移。过去,行业竞争焦点在于谁积累的道路里程更多,但随着车队规模的指数级增长,数据形态已从“短缺”转向“过剩”。一辆测试车每天产生的数小时视频,对于千辆规模的商业化车队而言,意味着PB级的数据堆积。然而,这些海量数据中,充斥着大量重复的日常直行场景、人为接管片段以及低效识别错误。真正能推动模型迭代进化的,往往是那些稀缺、复杂且难以复现的“长尾场景”,如施工区域内的行人横穿、雨天低能见度下的车辆压线等极端情况。
传统的数据处理模式依赖人工标签预设,这种方式不仅成本高昂,且难以覆盖瞬息万变的真实路况。即使引入通用大模型进行视频理解,也面临着幻觉频发、时序错乱和目标遗漏的风险。通用模型擅长处理语义逻辑,却缺乏对物理世界因果关系的严谨校验。当错误的数据进入训练链路,不仅无法提升模型性能,反而可能引入有害信号,导致自动驾驶系统的安全边界模糊。因此,如何从非结构化的视频流中精准提取高价值信息,并建立可验证的事实链路,成为突破自动驾驶瓶颈的关键。
文远知行发布的物理AI认知基础大模型WITT,正是针对这一痛点提出的系统性解决方案。WITT的全称为“WeRide WITT”,寓意“以可信事实建立世界认知”,其核心理念致敬了维特根斯坦的哲学观点——世界是事实的总和。在自动驾驶语境下,这意味着模型必须首先准确确认道路上究竟发生了什么物理事实,而非仅仅进行模糊的语义描述。通过引入“最小物理事实单元”概念,WITT将连续变化的道路场景拆解为可识别、可验证的最小结构块,重构了AI对物理世界的理解框架,为数据的高效利用奠定了理论基础。
核心架构:从视频流到结构化事实的四步跃迁
WITT的核心竞争力在于其构建的四条闭环能力链:事实提取、事实推理、事实验证和事实编排。这一流程不仅改变了数据的形态,更重塑了数据进入训练模型前的处理逻辑。
在事实提取阶段,WITT不再依赖预设标签,而是从标准驾驶行为、多主体交互和复杂物理条件等多个维度,自动识别视频中的最小物理事实单元。例如,一段雨夜城市路口右转的视频,会被拆解为自车转向、道路类型、信号灯状态、能见度等级以及周边参与者动作等独立事实。每个事实单元均可独立检索,并精准追溯到对应的时间戳和视频帧。这种机制使得工程师可以通过自然语言直接检索特定场景,如“寻找施工区内行人突然横穿的片段”,无需逐帧回放,极大地释放了数据挖掘的效率。
事实推理则进一步深挖数据背后的因果逻辑。同样是一次异常减速,背后可能隐藏着前车急刹、行人靠近、车道变窄或系统策略保守等多种原因。WITT通过分析场景主体关系、关键事件及风险演化趋势,构建完整的事件因果链。工程师获得的不再是一段孤立的异常视频,而是包含前后文逻辑的事实链路,这有效解决了“找到视频却定位不到问题根源”的行业痛点。
事实验证是WITT区别于通用大模型的关键防线。针对通用模型在边缘目标识别、时序判断上的幻觉问题,WITT引入了“6+1事实验证”机制,从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度进行多维评估,并结合外部物理证据反向验证结论。内部测试数据显示,在自动驾驶垂类场景中,WITT的平均片段事实错误率仅为通用大模型的三分之一,显著提升了数据清洗的准确性。
最后是事实编排,它决定了数据的最终流向。根据数据的稀缺性、置信度和训练价值,WITT智能分配数据路径:稀缺长尾场景被送入文远自研的世界模型GENESIS用于生成仿真变体;高频日常场景用于强化学习优化;低置信度片段则进入人工复核。这一环节使得WITT超越了单纯的视频理解工具,成为自动驾驶数据闭环中的智能调度中枢。
工程效能:200倍效率提升背后的成本重构
技术理念的落地离不开工程能力的支撑。WITT在算力成本和处理效率上的表现,直接决定了其商业应用的可行性。相较于百亿级参数的通用大模型,WITT在同类任务中节省了98%的Token消耗。其单卡单日处理能力可达1万分钟车辆运行视频,数据处理效率提升了200倍。在标签模式下的测试中,单次请求即可输出100多个动态标签,这种高效率使得实时或近实时的数据闭环成为可能。
这种效率提升并非简单的算力堆叠,而是源于对物理事实的精准聚焦。通用大模型试图理解视频中的所有内容,包括光影变化、背景噪声等无关信息,导致算力浪费。WITT通过提取“最小物理事实单元”,屏蔽了无关干扰,专注于与驾驶决策强相关的物理约束。这种“少即是多”的策略,不仅降低了计算负荷,更提高了模型对关键风险点的敏感度。
物理AI飞轮:L4与L2+的数据双向反哺
WITT的价值实现,依赖于前端海量真实数据与后端强大生成能力的协同。文远知行目前已拥有超过3000辆L4级自动驾驶车队,在多个城市开展常态化无人商业运营。这些车队长期在复杂城市道路上运行,积累了高价值的长尾场景数据。然而,车队规模本身并不自动转化为模型能力,必须通过高效的数据闭环机制进行转化。
WITT负责闭环的前半段,即从真实视频中提炼事实;后半段则由世界模型GENESIS承接。GENESIS基于WITT提取的真实事实,生成高保真的仿真场景和长尾变体。例如,针对雨天施工路段行人横穿这一稀缺场景,GENESIS可改变雨量、道路宽度、行人速度等参数,生成大量相似但不同的训练样本。这种“真实-仿真”的协同训练模式,构成了文远的“物理AI飞轮”。
这一飞轮机制的意义在于,它具体化了L4向L2+反哺的技术路径。L4车队提供高复杂度的真实场景,经过WITT提炼验证后,通过GENESIS扩展,同时用于训练L4自主驾驶模型和L2++量产辅助驾驶模型。文远的L2++端到端方案WRD 3.0已量产上车奇瑞星途、广汽埃安等车型,这意味着L4积累的复杂场景知识,能够下沉并赋能更大规模的量产车型,实现数据特征的双向互补。
结语:每一公里都是模型进化的资产
自动驾驶的本质是对物理世界的持续认知与适应。通用大模型擅长处理语言和视频的语义关联,但无法替代对物理规律和因果逻辑的严谨验证。WITT通过引入物理事实概念,将自动驾驶数据从“非结构化视频”转化为“结构化事实”,解决了数据价值密度低、检索困难、验证缺失等核心问题。
未来,衡量自动驾驶公司竞争力的核心指标,将不仅是车队规模或算法参数,而是数据闭环的效率与质量。每一公里真实道路,究竟需要多久能转化为下一版模型的能力,将成为区分行业领跑者与跟随者的关键尺度。随着WITT与GENESIS的协同迭代,文远知行正在探索一条从物理认知到智能驾驶的实证路径,为自动驾驶的大规模商业化落地提供坚实的数据基础设施。
在技术快速迭代的今天,单纯的数据堆砌已难以为继。只有构建起以物理事实为核心、以高效闭环为手段的数据生态,才能让每一公里的行驶都成为推动智能驾驶进化的真实燃料。这一变革不仅关乎算法的优化,更关乎自动驾驶系统安全底座的加固与商业模式的可持续突破。