行业新闻

上海交大提出WLA模型,统一世界建模、语言推理与动作生成

上海交大提出WLA,融合预测、语言与动作,实现高效实时机器人控制。

WLA将世界建模、语言推理与动作生成统一到同一框架,预测未来状态时同时建模文本意图和物理动态,避免重建无关细节。2B参数实现40ms延迟,性能超越多种基线。

正文摘录

从「预测」到「规划」未来:WLA 统一了世界建模、语言推理与动作生成 ![](https://image.jiqizhixin.com/uploads/article/coverimage/a83d623d-6fdc-4c5d-aac2-7dc11ce07b8a/028(2).jpg) 近期,世界 - 动作模型(World-Action Model,WAM)正成为具身智能的重要方向。它将世界建模与动作预测结合起来:机器人不仅能根据当前观测生成控制动作,还能预测未来状态或画面,在行动前先预演可能的结果。这有助于模型学习物理规律和动作影响,但也带来了新的挑战。 首先,图像预测往往需要重建大量与任务无关的细节,如背景、纹理和光照。这些信息对生成动作帮助有限,却会增加学习负担。其次,计算开销较高,如果推理阶段仍需显式生成图像或视频,可能引入额外延迟,影响机器人实时闭环控制。 更重要的是,许多 WAM 仍主要依赖像素级视觉预测,语义信息不足,难以充分表达任务意图、因果关系和长期规划。 ![图片](https://image.jiqizhixin.com/uploads/editor/c66e0bd8-6939-4533-9872-7aa2e7240f54/640.png) 图 1:WAM 的局限性:细节重建负担、推理延迟与语义缺失 为了解决这一问题,上海交通大学 DENG Lab 提出了世界 - 语言 - 动作模型(World-Language-Action Model,WLA),将世界建模、语言推理与机器人动作生成统一到同一个框架中。WLA 对未来状态的预测不只停留在「生成未来画面」,而是同时建模两类关键信息:粗粒度的文本意图与细粒度的物理动态。 文本意图用自然语言描述未来状态和任务目标,为机器人提供简洁、可解释的语义表示。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-03原文

相关内容