行业新闻

昆仑万维发布机器人世界模型 Riemann-1.0,用人类视频训练操作技能

Riemann-1.0 用海量人类视频预训练再加少量机器人数据微调,让机器人学懂物理世界交互,在多项家务基准测试中领先。

昆仑万维旗下黎曼动力推出 Riemann-1.0,一个通过观看 20 万小时人类第一视角视频学会做家务的机器人世界模型。它结合了 VLA 和世界模型两条路线,在仿真和真机测试中表现领先,尤其擅长长流程家庭任务。

正文摘录

更有意思的是,登顶的这个名字,之前几乎没人听说过: Riemann-1.0,黎曼动力 。 薄薄贴在桌面上的勺子,夹得起来;碗里剩的汤,知道先倒了再收;完事了还顺手把桌子擦干净。 视频地址:https://mp.weixin.qq.com/s/KIBoK4IAklhdmU21fCIyVg 再往上扒,黎曼动力背后站着的是 昆仑万维 ——前者正是昆仑万维专为具身智能方向成立的子公司。 答案藏在它的「食谱」里: 23.2万小时训练数据中,占大头的根本不是机器人数据,是人的视频 。 △图片由AI生成 简单总结就是,VLA属于「直觉派」,快但容易翻车;世界模型则属于「深思派」,稳但是又慢又贵。 World Action Model(WAM,世界动作模型)已经从VLA研究里的小众分支,迅速长成了机器人基础模型的第二条主路线,而下一代机器人基础模型,大概率是两者的混合体。 △图源:英伟达官方技术博客 ICML 2026上,包括LeCun团队在内的多篇论文也在往同一个方向使劲: 从海量无标注的野外视频(in-the-wild videos)里学习潜在动作世界模型。 △图源:ICML官网 把这些工作放在一起看,一条正在被越来越多团队验证的训练范式浮出水面: 先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号 。 对机器人来说,人类每天的生活就是一场不间断的操作示范。做饭、叠衣服、整理房间,这些第一视角视频里,藏着人类怎么感知环境、规划动作、处理意外的全部秘密。 实际上,行业里少部分前沿玩家已经看到了这点。比如Being-H0.7用了20万小时第一视角人类视频,Generalist AI的GEN-1更是砸了50万小时可穿戴设备采集的人类数据。

阅读原文(qbitai.com)→

行业新闻一水2026-07-19原文

相关内容