文远知行发布自研物理 AI 大模型 WITT,首次引入“最小物理事实单元”概念
文远知行正式发布了自研的物理AI认知基础大模型WeRide WITT。这次发布的WITT,全称World Intelligence Toward Truth,翻译过来就是“以可信事实建立世界认知”,名字本身就已经点明了它的核心使命。

从行业角度来看,这次发布的WITT有个很有意思的切入点:它首次引入了“最小物理事实单元”这个概念。基于视觉语言大模型(VLM)的能力,它打通了视频、图像、文本等多模态信息,把连续变化的真实场景拆解为可被识别和验证的事实单元。换句话说,它不再把视频当成一整段画面去理解,而是像一位精密的拆解师,把每一帧、每一个动作都拆开来看。
这个命名其实也致敬了20世纪哲学家维特根斯坦,他提出过“世界是事实的总和”。这个观点和物理AI的底层逻辑高度契合——AI要认知真实世界,关键在于从环境、行为、规则、风险与时序关系中提炼出可信的事实,然后在此基础上形成判断与推理。
那么,这个模型到底能做什么?官方把它归纳为四大核心能力:事实提取、事实推理、事实验证、事实编排。这四件事构成了从场景识别到数据验证、再到学习分流的完整链路,让每一公里的真实道路数据都成为模型迭代的可靠信号。
1. 事实提取
WITT能够从标准驾驶事实、多主体交互事实和物理模糊条件三个维度,识别真实道路视频中的“最小物理事实单元”。举个例子,一段夜间雨天城市道路行车的视频,会被WITT自动拆解为自车右转、城市道路、交叉口、路口信号变化等多个事实单元。每个单元都具备高置信、可校准、可追溯的特征,能生成高密度场景描述,为后续的理解、验证和学习分流提供基础。
2. 事实推理
完成事实提取后,WITT还能进一步推理场景中的关键事件、行为关系与风险变化,分析事件成因和后续演化趋势。在自动驾驶研发流程中,工程师经常需要从海量视频里寻找特定长尾场景,比如“施工区域内行人突然横穿”“雨天低能见度下他车压线”“窄路会车时自车减速避让”等等。WITT内置的视频数据引擎,支持通过关键词或自然语言问题快速检索海量视频数据,精准定位相关时序和目标场景。这对提升长尾样本发现、数据回溯和问题定位效率来说,价值相当明显。
3. 事实验证
为了避免通用大模型在复杂交通环境中产生“幻觉”,WITT从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,并引入了事实置信度,调用外部物理证据反向验证结论是否成立。通过追踪事实错误、幻觉、遗漏和时序错误,它既为数据使用者提供了质量判断标准,也为模型训练提供了偏好信号。目前,WITT在自动驾驶垂类场景中的平均每片段事实错误率,只有通用大模型的三分之一左右。
4. 事实编排
在真实道路运营中,不同数据的价值并不相同。WITT能够按照学习价值对事实视频进行智能分流,让每一条数据进入最合适的学习路径:稀缺长尾场景回流至文远知行自研的世界模型WeRide GENESIS,用于模拟训练和场景扩展;高频日常场景用于强化学习和流程优化;异常片段进入复核机制,避免关键数据被误判为“脏数据”。这样一来,WeRide WITT和WeRide GENESIS在云端共同驱动着文远知行的物理AI飞轮:WITT负责从真实道路数据中提取、理解、验证和编排物理事实,GENESIS据此生成高保真仿真场景与长尾训练场景,二者协同训练车端模型。
最后说说性能数据。相较于动辄百B级参数的通用大模型,WeRide WITT以更轻量的模型规模,在同类任务中能节省98%的Token成本,单卡单日可处理1万分钟车辆运行视频,最高实现200倍数据处理效率提升。在标签模式下,单次请求即可输出100+动态标签,海量真实道路视频可以快速完成检索、验证并进入模型迭代。这么一套组合拳下来,确实让人对物理AI的实际落地有了更多期待。
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |