行业新闻

清华联合无问芯穹开源具身智能体基础设施 RPent

开源框架 RPent 把大模型规划与 VLA 操作分层组合,并加入可复用记忆,为机器人智能体提供模块化基础设施。

清华大学、无问芯穹与正行创新联合开源具身智能体基础设施 RPent:用通用大模型负责任务理解与规划,用 VLA(视觉-语言-动作模型,直接根据画面和指令输出机器人动作)负责精细操作,形成「观察-规划-执行-纠错」闭环,在 LIBERO-PRO 基准上任务成功率达 92.6%。

正文摘录

Codex、Claude Code 等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。 随着 GPT-6 Astra 开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。 但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。 物理世界中的智能体,不只是“想明白”,还必须“看得见、做得到、反应快”,并且“记得住”。 今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施 RPent 正式开源。 RPent 面向真实物理世界,将通用大模型的任务理解与规划能力、VLA 等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。在 LIBERO-PRO 基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。 RPent 由大规模具身强化学习框架 RLinf 的核心团队打造,延续了该团队在具身智能基础设施领域的技术积累。 在这一视频中,RPent 展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。 值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。 1、例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结 VLA 只会沿用训练时学到的动作,将它错误地放入金属篮中;

阅读原文(qbitai.com)→

行业新闻思邈2026-09-21原文

相关内容