(来源:网易科技)

自动驾驶行业有一个反直觉的现象:车队越大、数据越多的公司,越头疼怎么用数据。
数据越来越多,但模型的进步却越来越依赖那些罕见、复杂、真正值钱的长尾场景。把它们从数据堆里挖出来,成了比采集本身更难的一件事。
7月17日的世界人工智能大会上,文远知行发布了物理AI认知基础大模型WeRide WITT。
发布会现场,文远知行上海研发中心总经理霍达没有先谈参数,而是从一个更基础的问题讲起:“没有可信的事实基础,我们其实就没有办法去判断模型哪里对了,哪里错了。”
这句话也解释了WITT诞生的原因。
它是一个运行在云端的数据理解模型。从连续的道路视频中提取可信事实,判断哪些数据值得进入训练,哪些需要进一步验证,哪些只是大量重复出现的普通样本。
今年1月,文远知行发布了负责生成仿真场景的世界模型GENESIS,半年后,WITT补上了另一端的数据理解能力。
一个负责理解真实世界,一个负责生成虚拟世界。两者共同组成文远知行物理AI飞轮的重要环节。
01 从有没有数据,到怎么用数据
自动驾驶行业过去几年一直在追求更多数据。
特斯拉FSD累计行驶里程已经超过84亿英里,马斯克却认为,要实现安全的无监督自动驾驶,大约还需要100亿英里训练数据。美国兰德公司是一家长期研究国防、交通、安全等公共政策问题的非营利研究机构。它曾对自动驾驶安全验证做过测算:如果想以80%的置信度证明自动驾驶比人类司机安全,100辆测试车需要连续行驶518年。
训练数据和安全验证并不是同一个问题,但两组数字都说明了一件事:真实道路测试,很难覆盖所有罕见情况。
与此同时,当车队规模扩大以后,另一个问题又出现了——数据多到无法有效使用。
文远知行超过3000辆L4车辆在全球多个国家运营。一辆Robotaxi每天持续运行,会产生大量道路视频。其中绝大多数是普通的直行、跟车、等灯,真正影响模型能力的,是少数的复杂场景。
这些长尾数据价值高,但数量少,而且往往隐藏在大量普通数据中。人工筛选并不是一个可持续的方法。面对每天新增的大量视频,工程师很难靠人工逐段查看找到所有有价值的数据。
那么,能不能直接交给通用大模型?答案也并不理想。
在WACV 2025的CODA-LM基准测试中,GPT-4V面对自动驾驶corner case场景时,通用感知得分为57.5分。
问题不仅仅是识别错误。交通场景里的视觉大模型还可能产生幻觉,它会描述了一个视频中不存在的细节,或者错误理解事件发生的先后关系。
如果错误的数据进入训练流程,模型学习到的可能不是现实规律,而是错误的判断,反而会影响算法的表现。
过去几年,自动驾驶行业一直在讨论“数据闭环”。采集、标注、训练、仿真、部署,看起来是一条完整链路。但真正落到工程现场,很多闭环卡在了同一个环节:哪些才是有价值的数据?
发布会上,霍达把这个问题总结为一句话:“没有可信的事实基础,我们其实就没有办法去判断模型哪里对了,哪里错了。”
WITT试图解决的,就是这一步。
02 WITT:用事实建立对世界的认知

WITT的技术思路藏在它的名字里。
它的全称是World Intelligence Toward Truth,中文解释是“以可信事实建立世界认知”。这个名字同时致敬了哲学家路德维希·维特根斯坦。他在《逻辑哲学论》中写下的第一条命题是:“世界是事实的总和。”
放在哲学史里,这句话讨论的是世界、事实与语言之间的关系。进入物理AI的语境,文远知行把它变成了一条具体的工程路线:AI要理解真实世界,需要先从环境、行为、规则、风险和时序关系中提炼出能够验证的事实,再在这些事实之上做判断和推理。
这条路线的载体,被文远知行称为“最小物理事实单元”。
霍达称,这是行业内首次把这一概念引入物理AI。发布会现场,他用一个场景解释了这套方法:“一个路口里面可能有多个对象、多个行为、多层关系。比如说下雨是一个事实,右转是一个事实,路边有行人横穿马路是一个事实。这些事实按照时间和因果关系组合起来,才形成了我们看到的完整的场景。”
在WITT眼中,一段夜间雨天的城市道路视频不再只是一串连续像素。
它会被拆解成一组相对独立、能够回到画面中验证的事实:天气正在下雨,自车准备右转,车辆位于交叉口,路边行人正在横穿马路,路口信号正在发生变化。
这里的“最小”指的是事实的颗粒度。复杂场景被拆开以后,每个单元只描述相对明确的一件事。在这些事实单元之上,WITT还会生成更完整的场景描述,把一段视频里发生的事情、参与者之间的关系和风险变化重新组织起来。
这和常用的标签系统不一样。
传统的数据处理方式,是先由人定义类别,再给视频贴上标签。标签可以回答“这段视频里有没有行人”,却很难描述行人与自车的距离如何变化、风险从哪一刻开始、车辆为什么在这个时候减速。
一张图像有可能有上百万个像素点,但跟决策相关的只有一小部分。
WITT要做的,是把这些像素背后的道路事实识别出来,再还原事实之间的关系,变成模型能够直接使用的认知单位。
事实单元是基础。真正让它进入自动驾驶研发流程的,是在此之上搭建的事实提取、事实推理、事实验证和事实编排四项能力。
03 WITT四大核心能力

“最小物理事实单元”解决的是AI如何理解真实世界的问题,而围绕这些事实形成的四项能力,则决定了这些信息如何真正进入自动驾驶研发流程。
WITT目前形成了事实提取、事实推理、事实验证和事实编排四项核心能力。它们分别对应自动驾驶研发中的几个关键环节:从真实道路视频中提炼事实,理解事件背后的关系,判断模型输出是否可信,以及让不同数据进入合适的训练路径。
事实提取:从连续视频中找到关键事实
自动驾驶面对的真实世界并不是由一个个孤立标签组成的。一辆车在道路上行驶,背后同时包含天气、道路结构、车辆状态、交通参与者行为等多个因素。
WITT首先需要做的,就是从这些连续变化的信息中提取出能够被理解和验证的事实。
文远知行将事实分为三个层面:一类是标准驾驶事实,例如车辆转向、变道、减速;一类是多主体交互事实,例如车辆、行人、非机动车之间的位置和行为变化;另一类是物理模糊条件,例如雨雾、反光、遮挡等导致的不确定状态。
一段夜间雨天城市道路视频,在WITT看来,不再只是一串连续画面,而是一组相互关联的事实:正在下雨,自车准备右转,车辆位于交叉路口,路边存在行人,信号状态正在变化。这些事实单元组合起来,才形成工程师真正关心的道路场景。
事实推理:不仅找到场景,还理解发生了什么
找到事实之后,下一步是理解事件。
自动驾驶研发中,经常需要从大量历史数据里寻找某类特殊情况。例如施工区域内行人突然横穿、雨天低能见度下其他车辆压线、窄路会车时自车减速避让。
过去,工程师需要依靠标签系统筛选,再人工查看大量视频。WITT内置的视频数据引擎支持通过关键词和自然语言进行检索。工程师可以直接描述希望寻找的场景,模型定位相关时间段,并进一步分析事件的原因和演化过程。
它回答的不只是“这里发生了什么”,还包括“为什么发生”。
例如,一辆车突然减速,是因为前方车辆影响,还是因为行人正在进入潜在风险区域;一次避让动作,是正常驾驶行为,还是模型决策出现问题。
事实验证:减少模型对物理世界的误解
对于自动驾驶来说,理解错误比理解慢更危险。通用视觉语言模型能够描述画面,但在复杂交通场景中,也可能产生幻觉:补充不存在的信息,遗漏关键对象,或者错误判断事件顺序。
WITT针对这一问题建立了事实验证机制。它从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,并加入事实置信度,形成“6+1”验证体系。
模型输出的问题会被归纳为事实错误、幻觉、遗漏和时序错误,再用于判断数据质量,并反馈给模型训练。
按照文远知行披露的数据,在自动驾驶垂类场景中,WITT平均每片段事实错误率约为通用基础大模型的三分之一。
事实编排:让不同数据进入不同路径
自动驾驶数据并不是越多越好。
不同数据,需要进入不同的处理流程。WITT会根据事实价值对数据进行编排:稀缺的长尾场景进入世界模型GENESIS,用于生成更多模拟训练场景,大量高频日常场景用于强化学习和流程优化,暂时无法确认价值的异常片段进入复核机制,避免关键数据被误判为“脏数据”。
这也是WITT和传统数据处理工具最大的区别之一。它不是简单给数据分类,而是在判断这些数据接下来应该如何被使用。
这套机制最终还要接受工程现实的检验。发布会上,霍达披露,在11项物理AI公开测试中,WITT有7项取得领先;单次请求可以输出100多个动态行为标签,事实错误率为通用基础大模型的三分之一。
在工程成本方面,WITT相比通用大模型可以节省98%的Token成本;在同等算力预处理条件下,数据处理效率最高提升200倍,单张主流显卡每天可以处理1万分钟车辆运行视频。
霍达总结这套能力时表示:“用云端物理AI模型大规模处理车辆运行数据,在工程上变成了可行。”对于自动驾驶公司来说,真正困难的并不是让模型看懂一段视频,而是让它每天处理成千上万分钟的视频,并融入在研发流程中。
04 WITT + GENESIS:文远知行的物理AI飞轮

WITT解决的是“理解现实”的问题。
但对于自动驾驶来说,仅仅理解现实还不够。到一个危险场景之后,还需要在大量相似场景中进行训练,发现一次模型错误,也需要在安全环境中不断验证改进。
今年1月,文远知行发布了通用仿真世界模型WeRide GENESIS。它负责生成高保真的虚拟道路环境,将真实世界中难以反复采集的场景搬到仿真环境中。
车辆加塞、无保护转弯、行人突然出现,甚至极端天气条件,都可以在仿真世界里不断生成和测试。
如果说GENESIS负责“创造世界”,那么WITT负责的就是告诉它应该创造什么样的世界。
真实道路中的数据经过WITT处理后,高价值长尾场景被提取出来,进入GENESIS进行扩展,生成的仿真数据再用于车端模型训练;车辆重新进入真实道路,又产生新的数据回流到WITT。
一个负责理解现实,一个负责生成接近真实世界的训练场景。
两者共同组成文远知行的物理AI飞轮。这样的方向也正在成为自动驾驶行业的重要趋势。
过去行业更多在讨论世界模型如何生成世界,而WITT在这基础上进一步探索:
模型应该依据什么事实,去生成一个可信的世界?需要两个条件:足够多的真实道路数据和验证模型性能的产品体系。
文远知行过去几年的积累刚好满足了这样的条件。
在L4自动驾驶领域,文远知行已经形成规模化运营。公司披露,目前拥有超过3000辆L4自动驾驶车辆,产品进入12个国家、40多座城市,并在广州、北京、阿布扎比和迪拜开展常态化纯无人商业运营。量产市场上文远也已经获得近30个车型定点,并搭载于奇瑞星途星纪元、广汽埃安N60等车型。
L4车辆提供更加复杂、更加接近无人驾驶要求的真实场景,L2++量产车提供更大的车辆规模和更广泛的道路覆盖。
两者产生的数据,都可以进入WITT进行理解和筛选,再反向推动模型迭代。
自动驾驶下一阶段的竞争,不只是比谁拥有更多数据,而是谁能够更快、更准确地从中找到真正有价值的数据。
