清华 AIR 联合域变换推出自进化物理智能体 Zetta ζ
Zetta ζ 让机器人在物理执行中实时纠错并自我进化,成功率出现跳跃式提升。
清华 AIR 与域变换推出 Zetta ζ,一种面向物理世界的闭环在线学习智能体。它通过实时监控机器人执行状态、触发恢复动作,并把失败经验沉淀为可复用技能,让任务成功率在有限预算下显著提升。研究者还观察到类似人类顿悟的成功率跃升现象。
正文摘录
.jpg) 端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而, 这条在线学习路径在物理世界仍未真正走通 。挑战在于,真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。 清华 AIR 与域变换联合推出 Zetta ζ ,通过演进可高频执行的 critics,闭环物理智能体的在线学习:机器人不再只是事后总结失败,而是在执行过程中持续观察环境、触发恢复,并把 rollout 经验沉淀为可复用技能。 实验显示,Zetta ζ 的任务成功率会随着自探索经验持续提升,在有限 rollout budget 下 LIBERO PRO 和 RoboCasa 分别取得 90.8% 和 93.6%,远超现有其他方法。更惊艳的是, 研究者捕捉到机器人的 “Aha Moment” ,这让研究者看到了物理智能体 scaling intelligence 的新起点。