行业新闻

世界模型技术路线三派争辩:蚂蚁、智元、自变量各执一词

世界模型六家公司技术路线严重分歧,但非共识正是当前行业红利,迫使多方探索不同路径。

世界模型的概念、技术、训练、数据和评测都未收敛。六家公司负责人分为三派:蚂蚁灵波认为“物理合理性”比精度更重要,智元强调长时一致性,自变量则押注融合不同技术。分歧正是行业红利所在。

正文摘录

它的概念没有收敛、技术路线没有收敛、训练方式没有收敛、数据标准没有收敛、评测尺度没有收敛…… 7月19日,在 WAIC 世界模型“六小龙”论坛上,一场信息密度极高的圆桌讨论,凑齐了六家公司的世界模型(旨在模拟物理世界运行规律的模型)技术负责人。他们是: 这六家公司目前押注的技术路线,按照 “模型在什么空间里推演世界” 的尺子,可大致归类为三派: 蚂蚁灵波的沈宇军认为 “物理合理性” 比 “物理精度” 更重要。机器人只需要明白同样重量的铁比棉花掉得快,但到底快多少,不需要知道,只需要观察。 他说,机器人不必算清每一条轨迹、复现每一个物理参数,只要知道哪些差异会影响眼前的动作,就够了。 智元的任广辉认为, 推理的 长时物理一致性 (模型在长时间推演中保持物理规律自洽的能力),是评价世界模型能力必不可少的指标之一。 而自变量的王昊却直言:长程推演是“伪需求”,比起这个能力,他更看重推理的 时效性 。如果推理慢到错过决策窗口,再完整的理解也没有用。 模型对于物理世界的理解,隐空间(模型内部的高维表征空间)里可以直接回归物理量,所以敢要求物理精度;像素生成学到的天然是“看起来合理”,所以只承诺物理合理性。 而关于长时一致性,智元的世界模型,有一大用途是当仿真器,长程推演正是仿真器的生命线;自变量把世界模型与 VLA(视觉-语言-动作模型)整合进同一个端到端框架,预测是动作生成的前置步骤,预测铺得越长,推理就越慢,占掉的决策时间就越多。 任广辉和夏中谱认为是 统一表征 。语言模型找到了 token,具身智能还没找到自己的“token”,视觉、语言、动作这些模态得对齐进同一个表征。 王昊押的是 融合 ,视频生成贡献未来预测、隐空间贡献推理、3D 显式建模当空间记忆,各取所长拼出新架构,这在大语言模型历史上发生过一遍。 沈宇军的押注则落在 触觉 上。

阅读原文(qbitai.com)→

行业新闻林, 方舟2026-07-24原文

相关内容