ENPIRE:8个Codex代理操控机器人舰队,含安全、奖励、遥测设计。
我把物理世界自动研究在概念上简化了,但这需要很多人的努力,以及对机器人和循环流程的大量设计思考。最难的部分是在按下回车键之前需要设置的一切。以下是幕后之旅:
1. 安全绳
让8个机器人无人值守过夜,意味着安全性不能只是系统提示中的一条暗示。ENPIRE通过两层硬连线实现:(1) 硬运动学限制,一旦机器人离开安全包络线,立即触发任务失败并自动重置;(2) 扭矩受限的柔性夹爪,使得不良接触或错位插入最终导致安全停止,而不是压碎机器人或手中的物体。
我们使安全性比通常更保守,这样人类可以睡得安心。实际上,我们仍然需要几个人类操作员来照看这些“恩典之机器人”。
2. /done 的定义
一个可以编辑自己奖励的智能体肯定会钻空子。ENPIRE在舰队能够移动目标之前固定了球门柱。方法如下:
收集几分钟的成功与失败演示
-> 让智能体使用计算机视觉工具编写代码来分类成功,并与真实数据对比
-> 智能体在分类器上爬山,直到可靠地良好
-> 该分类器成为实时奖励函数,直接计算传感器流
-> *冻结*奖励函数在自动研究之前。它是神圣的,被封装在一个无人能触碰的Gym环境中。
3. 系统遥测设计
机器人秒是最稀缺的资源,其次是GPU秒,最后是token。我们测量这三项,并将其展示给ENPIRE,以实现实时资源感知,而不是让它在真空中爬山。
我们定义:
- 平均机器人利用率("MRU"):机器人在主动执行实验的挂钟时间占比。否则硬件空闲等待下一次代码提交。
- 平均Token利用率("MTU"):每分钟消耗的token数量,衡量智能体实际思考的强度。低MTU意味着智能体停滞,等待机器人执行结果而不是进行研究。
- GPU利用率:GPU活跃的挂钟时间占比。
……并评估两个预算到成果的指标:
1. Token到成功:舰队完成/goal消耗的token预算。
2. 时间到成功:到达/goal的挂钟时间。
1. 安全绳
让8个机器人无人值守过夜,意味着安全性不能只是系统提示中的一条暗示。ENPIRE通过两层硬连线实现:(1) 硬运动学限制,一旦机器人离开安全包络线,立即触发任务失败并自动重置;(2) 扭矩受限的柔性夹爪,使得不良接触或错位插入最终导致安全停止,而不是压碎机器人或手中的物体。
我们使安全性比通常更保守,这样人类可以睡得安心。实际上,我们仍然需要几个人类操作员来照看这些“恩典之机器人”。
2. /done 的定义
一个可以编辑自己奖励的智能体肯定会钻空子。ENPIRE在舰队能够移动目标之前固定了球门柱。方法如下:
收集几分钟的成功与失败演示
-> 让智能体使用计算机视觉工具编写代码来分类成功,并与真实数据对比
-> 智能体在分类器上爬山,直到可靠地良好
-> 该分类器成为实时奖励函数,直接计算传感器流
-> *冻结*奖励函数在自动研究之前。它是神圣的,被封装在一个无人能触碰的Gym环境中。
3. 系统遥测设计
机器人秒是最稀缺的资源,其次是GPU秒,最后是token。我们测量这三项,并将其展示给ENPIRE,以实现实时资源感知,而不是让它在真空中爬山。
我们定义:
- 平均机器人利用率("MRU"):机器人在主动执行实验的挂钟时间占比。否则硬件空闲等待下一次代码提交。
- 平均Token利用率("MTU"):每分钟消耗的token数量,衡量智能体实际思考的强度。低MTU意味着智能体停滞,等待机器人执行结果而不是进行研究。
- GPU利用率:GPU活跃的挂钟时间占比。
……并评估两个预算到成果的指标:
1. Token到成功:舰队完成/goal消耗的token预算。
2. 时间到成功:到达/goal的挂钟时间。
今天我们首次在物理世界实现AutoResearch!介绍ENPIRE:我们给8个Codex代理一支机器人舰队、GPU分配和慷慨的token预算。我们让它们自由,目标简单:尽快完成任务,让机器人忙碌。