行业新闻

清华团队提出真机强化学习安全探索均衡理论

清华研究首次证明真机强化学习安全探索的收敛性,定义了安全探索均衡,为具身智能训练提供理论保障。

真机强化学习要求训练全程零事故,但现有方法无法保证探索能否收敛。清华团队首次证明了安全探索必然收敛到“均衡”——此时可行区域和模型精度均达到理论极限。这一收敛性证明填补了安全探索的理论空白。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/80ba3804-b77b-4483-a6cc-f7c654aaa4d4/047(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) 近日清华大学于 IEEE TPAMI 发表论文,探讨了真机强化学习的安全性保障问题,提出了一套「安全探索均衡」新型机制,揭示了安全探索的理论最大边界,并攻克了其收敛性证明难题。该论文通讯作者为清华大学车辆学院、人工智能学院教授李升波;共同第一作者为清华大学博士生杨雨杰、郑志龙。 当下,具身智能正经历着爆发式的演进。强化学习是其背后的核心驱动算法。然而,想要让智能体真正走出虚拟仿真,在物理世界中落地应用,真机强化学习(Real-World RL)是绕不开的终极考验。 与在仿真器里无限次试错不同,真实世界没有「重来」的按钮。如果在物理环境中进行无限制的探索,极易导致机器损坏甚至人员伤亡。这就引出了真机强化学习中最核心的难题: 安全探索(Safe Exploration) 。 安全探索不仅要求最终学到的策略是安全的,更苛刻的是,它要求在整个训练过程中,所有的中间策略都必须严格安全,智能体与真实环境的每一次交互都不能突破约束边界。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-23原文

相关内容