WITT大模型如何重构数据闭环?解析文远知行物理AI进化的200倍效率提升
突破里程迷信:从数据堆积到认知重构
在自动驾驶发展的早期阶段,行业普遍存在一种“里程迷信”:认为车辆行驶的路网越广、采集的视频越多,模型的智能程度就越高。然而,随着L2级辅助驾驶车型的爆发式普及以及L4级Robotaxi车队规模的扩大,这种线性增长逻辑正在失效。一辆测试车队每天产生的海量视频数据中,超过90%属于高重复性的日常驾驶场景,充斥着无效片段、人为接管记录以及低价值的路况信息。真正决定模型上限的,是那些罕见却关键的“长尾场景”,如施工区域行人突变、雨夜低能见度下的车道线识别等。
传统的数据处理模式依赖于人工标注或预定义的标签体系,这种离散化的处理方式难以应对连续且复杂的物理世界。工程师往往需要在数万公里视频中人工检索特定场景,不仅效率低下,且容易遗漏目标或混淆时序。更致命的是,通用大语言模型在理解视频时存在“幻觉”风险,可能生成现实中并未发生的情节,或遗漏边缘交通参与者。这些错误若直接导入训练集,将对模型性能产生灾难性影响。因此,如何从海量冗余数据中精准提炼高价值事实,并建立可验证的反馈闭环,成为行业亟待解决的核心痛点。
WITT的核心突破:最小物理事实单元
针对上述瓶颈,文远知行发布了物理AI认知基础大模型WITT(World Intelligence Toward Truth)。该模型的设计理念源自维特根斯坦“世界是事实的总和”这一哲学命题,旨在通过结构化手段重构AI对物理世界的理解框架。WITT并没有简单地将视频视为图像序列,而是提出了“最小物理事实单元”这一创新概念。
所谓“最小物理事实单元”,是将连续变化的真实道路场景拆解为独立的、可识别且可验证的原子化信息。例如,一段车辆在雨夜通过城市路口的视频,不再被整体编码,而是被拆解为“自车右转”、“城市道路”、“交叉路口”、“信号灯状态变化”、“低能见度”以及“周围交通参与者动作”等多个独立事实。这种拆解使得每一项事实都可以独立检索、追溯并关联到具体的视频画面和时间点。
这一机制彻底改变了数据检索的方式。过去,工程师需要预先设计复杂的标签体系才能查找特定场景;现在,通过自然语言即可进行语义级搜索。例如输入“寻找施工区域内行人突然横穿的片段”,WITT能够直接定位相关视频、目标主体及发生时间。这种类文本的搜索能力,让长期沉睡在存储服务器中的高价值长尾数据得以重新激活,极大降低了数据召回的成本与难度。
四大核心能力:构建可信的数据处理流水线
WTT的价值不仅在于数据的提取,更在于其构建了一套完整的数据处理流水线,涵盖事实提取、事实推理、事实验证和事实编排四个关键环节。
在事实推理阶段,WITT超越了简单的视觉识别,深入分析场景中的主体关系、风险演化及事件成因。例如,面对一次自车异常减速,模型不仅记录这一现象,还会分析是因前车急刹、行人靠近还是策略保守所致,从而提供完整的事件因果链路。这解决了研发中“知道有问题,但不知原因”的痛点。
事实验证则是确保数据质量的关键防线。针对通用大模型常见的遗漏、幻觉及时序错误问题,WITT引入了“6+1事实验证”机制。该机制从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,并引入事实置信度,调用外部物理证据进行反向验证。内部测试数据显示,在自动驾驶垂类场景中,WITT的平均每片段事实错误率仅为通用大模型的三分之一。
最后,事实编排环节根据数据的稀缺性、可信度及训练价值,对数据进行智能分流。稀缺的长尾场景被送入世界模型GENESIS用于生成仿真样本;高频日常场景用于强化学习优化;而置信度不足的片段则进入人工复核。至此,WITT从单纯的视频理解工具,进化为介入数据闭环决策的核心引擎。
工程效率与成本优化:200倍提速背后的逻辑
从工程落地角度来看,WITT展现出了极高的处理效率。文远知行披露,相较于百亿参数级的通用大模型,WITT在同类任务中可节省98%的Token成本。其单卡单日处理能力高达1万分钟车辆运行视频,数据处理效率提升最高达200倍。
这种效率提升并非简单的算力堆叠,而是源于对数据结构的深度优化。通过提取动态标签,WITT一次请求可输出100多个细粒度标签,实现了从非结构化视频到结构化知识的高效转化。这意味着自动驾驶公司可以更低廉的成本,将更多真实道路数据送入模型迭代循环,打破了以往因数据清洗成本高昂而导致的“数据孤岛”现象。
物理AI飞轮:L4与L2++的双向反哺
WITT的发布并非孤立的技术突破,而是文远知行构建“物理AI飞轮”的关键一环。该飞轮由云端的WITT与GENESIS世界模型共同驱动,形成了L4 Robotaxi与L2++量产智驾之间的双向数据反哺路径。
目前,文远知行在12个国家、40多座城市运营着超过3000辆L4自动驾驶车队。这些长期运行的Robotaxi积累了大量高复杂度、高价值的长尾数据。WTT负责从这些数据中提炼事实并验证,随后将稀缺场景输入GENESIS世界模型。GENESIS基于真实物理规律,对原始场景进行参数化变体生成(如改变雨量、行人速度、道路宽度等),生成高保真仿真训练样本。
与此同时,文远知行的L2++端到端方案WRD 3.0已量产上车于奇瑞星途、广汽埃安等近30款车型,并进入德法日等海外市场。L2++车型庞大的保有量提供了更广泛的城市覆盖和用户驾驶习惯数据,与L4车队的复杂场景形成互补。WITT与GENESIS协同处理两端数据,形成了“L4提供复杂场景 -> WTT提炼验证 -> GENESIS数据增强 -> 两端模型共同进化 -> 新车型产生新数据”的闭环。
这种架构打破了L4与L2之间的技术壁垒,将L4的“特种作战”能力转化为L2的“规模化优势”。它不仅加速了模型迭代周期,更验证了物理AI在规模商业场景中的可行性。
未来展望:每一公里的资产化定价
自动驾驶行业的竞争重心,正从单纯的算法精度比拼,转向数据闭环效率与物理世界认知深度的较量。WITT的诞生标志着自动驾驶进入“物理AI”新阶段:模型不再仅仅依赖数据统计相关性,而是必须理解并验证真实世界的物理约束。
未来,衡量自动驾驶公司核心资产的标准将出现新的维度:每一公里真实道路数据,需要多久才能转化为模型的有效能力。当数据提取、验证、生成实现自动化与规模化,自动驾驶的迭代速度将不再受制于人力标注瓶颈,而是取决于物理AI对世界认知的精确度。文远知行通过WITT与GENESIS的协同,正在探索这条从数据到认知的确定性路径,为自动驾驶的大规模落地提供了可复制的工程范式。