行业新闻

智在无界发布全球首个全身移动操作隐式世界动作模型 Being-0.7

这篇介绍了智在无界的新模型 Being-M0.7,它从人类视频中学习世界运行规律,让机器人能全身协调地移动和操作物体。

智在无界发布 Being-M0.7,全球首个面向人形机器人全身移动操作的隐式世界动作模型。它用10000小时人类视频预训练,再通过少量机器人数据适配,让机器人理解环境变化并协调全身完成任务。在鱼缸捞鱼、镜像取物等测试中表现优于其他模型。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/d50eb633-39fe-4e4a-a901-3acec7dcd817/0-2026-07-14T182022(2).301.jpg) 编辑|杨文 过去两年,人形机器人赛道的竞争焦点,正从整机硬件进一步延伸到模型能力。 整机厂商密集发布新品,翻跟头、跳舞、跑马拉松的视频轮番刷屏。但在喧嚣背后,行业也逐渐形成一个共识:决定人形机器人能力上限的,已经不只是关节与电机。能否理解环境、预测变化,并协调全身完成任务,正在成为其走向通用的关键。 世界模型、VLA 与人形机器人基础模型,也由此成为近两年这一领域最重要的技术方向之一。 热闹之下,三道难题始终摆在整个行业面前。 其一,人形机器人的真机演示数据采集成本高,采集时需要同步记录第一人称视频、本体感知数据与可执行的全身指令,受制于遥操作难度、安全风险、硬件可得性与环境多样性,很难在短时间内形成大规模、高质量的数据积累。 其二,现有不少世界动作模型沿用像素级视频预测路线,计算开销大,且大量容量被消耗在与控制关联很弱的画面细节上。人形机器人快速的自身运动和视角抖动又会进一步放大视觉预测噪声。 其三,许多现有方案仍将上肢操作与移动控制分开建模,上下半身协调性不足,难以支撑自然流畅的全身控制。 在这一背景下,具身智能公司智在无界发布了 Being-M0.7 。这是全球首个面向人形机器人全身移动操作的隐式世界动作模型(Latent World-Action Model,简称 Latent WAM),也是业内首次将隐式世界模型能力从桌面灵巧操作扩展到全身移动操作的模型。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-15原文

相关内容