文远知行发布物理AI大模型WITT,数据处理效率提升200倍
文远知行WITT模型通过结构化提取道路视频事实,大幅提升自动驾驶数据利用效率,缓解长尾场景发现难问题。
文远知行推出物理AI大模型WITT,将连续道路视频拆解为“最小物理事实单元”,使自动驾驶数据处理效率提升200倍,单卡每日可处理1万分钟视频,事实错误率仅为通用大模型的三分之一。
正文摘录
一辆测试车每天可以产生数小时的道路视频,而一支千辆规模的车队积累的数据量更是难以估算。但其中大部分是重复的日常场景,还混杂着人为接管、无效片段和识别错误。 问题在于,从几万小时视频中找出“施工区域内行人突然横穿”“雨天低能见度下车辆压线”“窄路会车时异常减速”这类场景,无疑是一项庞大的工程。 在 VLM(Vision-Language Model,视觉-语言模型)基础上,WITT 首次引入了“最小物理事实单元”概念,把连续变化的真实道路场景拆解成可被识别、验证的事实单元,重构 AI 对物理世界的理解框架。 官方称,WITT 最高能够将数据处理效率提升 200 倍,单卡单日处理 1 万分钟 车辆运行视频;在自动驾驶场景中,每段视频的平均事实错误率约为通用大模型的 三分之一。 这就是文远在做的事:让自动驾驶车辆跑过的每一公里,都有机会真正进入模型的进化链路。 文远知行刚刚发布的 WeRide WITT(World Intelligence Toward Truth),意为“以可信事实建立世界认知”,致敬了哲学家维特根斯坦提出的“世界是事实的总和”。 这个寓意落到自动驾驶研发里,可以理解为一个更具体的目标:先确认道路上究竟发生了什么。 文远为此提出了 “最小物理事实单元” 的概念,将连续、复杂的道路视频,转化成模型能够直接使用的结构化信息。 过去,自动驾驶公司的车队规模有限,核心任务是尽可能多地采集真实道路数据。谁的测试里程更长、覆盖城市更多,往往意味着见过的场景更多。 随着 Robotaxi 车队扩大、L2 辅助驾驶车型规模上车,数据开始迅速堆积。但一公里道路数据和另一公里道路数据,价值可能相差很大。 正常直行十公里,未必比一次施工区突然横穿更值得学习;一段车辆接管视频,也未必代表自动驾驶系统出现问题,可能只是安全员提前干预。