行业新闻

无问芯穹与清华联合发布 RLinf v0.3,打通具身智能强化学习全闭环

RLinf v0.3 打通了具身智能强化学习从仿真到真机的完整闭环,推动机器人从数据驱动迈向经验驱动进化。

RLinf 是一个面向机器人强化学习(让机器人在真实世界中通过试错学习)的开源基础设施。v0.3 首次将数据采集、管理、监督微调、强化学习、模型评测到真机部署全流程打通,新增 6 款模型、5 种仿真器和多种真机平台支持,兼容国产计算芯片,让机器人能从仿真训练无缝过渡到真实世界持续进化,大大降低开发门槛。

正文摘录

RLinf v0.3 来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造 当下的具身智能行业,正站在从“数据驱动”迈向“经验驱动”的关键拐点上。机器人不再满足于静态模仿,而是需要在真实世界中持续学习、在线进化。但在现实中,强化学习流程复杂、系统组件异构、资源形态多样以及真实世界在线学习难以规模化等关键问题,成为影响具身智能走进真实世界的行业痛点。 今天,由无问芯穹联合清华大学等共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目 RLinf,正式宣布升级为 RLinf v0.3,为破解具身智能行业发展瓶颈构建了新一代“进化底座”! RLinf v0.1 和 v0.2 分别完成了强化学习系统抽象与真实世界在线学习基础设施建设。新版 RLinf v0.3 进一步升级为面向具身智能持续进化的一站式开发平台,首次完整打通 数据采集、数据管理、监督微调(SFT,Supervised Fine-Tuning)、强化学习(RL,Reinforcement Learning)、模型评测以及真机部署等关键环节,实现从仿真训练到真实机器人在线学习、再到持续迭代优化的统一开发闭环。 由此,RLinf 不仅能够高效训练机器人策略,更能够支撑机器人在真实世界中的长期持续进化。 具体来说,RLinf v0.3 围绕 模型、算法、真机、仿真、系统 五个维度,进行了全面升级,系统性地降低具身智能开发门槛,提升训练效率与部署灵活性,覆盖更加丰富的具身智能开源生态。 针对强化学习中“参数难调、结果难复现”的行业痛点,RLinf 始终将训练效果的严格可复现作为核心标准。在此次 v0.3 正式发布前,研发团队已对大量应用示例完成了深度的复现性测试,详见 v0.3 Release Notes。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-16原文

相关内容