Meta开源SOL方法,使AI agent训练提速25倍
Meta刚刚让AI agent的训练速度提升了25倍。
这是机器人学和复杂规划领域的突破。
Meta的FAIR团队开源了一种名为Scalable Option Learning的新方法。它以前只在LLM中见过的规模训练专用agent。
工作原理如下:
这类AI(通过分层强化学习训练的agent)训练缓慢的原因在于并行化瓶颈。
想象一个AI团队,有一个规划者和许多专业工人(子任务)。旧方法在处理每个规划者的决策时必须逐一处理,然后才能训练工人。
SOL通过新的系统设计解决了这个问题:
单一统一大脑:不再使用独立模型,而是使用单个actor-critic网络来容纳规划者(控制器策略)和所有工人(选项策略)。
数字“开关”:使用one-hot向量告诉统一大脑在任意给定时刻扮演哪个角色,该标志表示“对于此输入,扮演‘导航’工人角色”。这使得不同策略的数千个不同决策可以批量处理并一次性发送到GPU。
智能学习“过滤器”:在采取行动后,使用称为tensorized masking的技术。将其视为一个智能过滤器,确保正确的性能反馈(奖励和优势)到达正确的工人策略。这打破了一次更新一个的问题。
这种架构允许整个分层系统并行批量学习,消除了阻碍该领域的瓶颈。
为什么重要:
这种新训练方法改变了构建能够推理和执行长期任务的agent的可行性。
商业领袖:该架构是开发复杂自主系统的关键。25倍的训练周期加速了机器人学、物流和多阶段流程自动化的研发,使复杂、战略性的AI在商业上可行。
实践者:作者计划开源SOL。您可以实现学习长期技能的agent,而无需承受旧HRL方法的性能损失,为构建更结构化且可能更稳健的模型开辟了道路。
研究人员:本文提出了HRL扩展问题的已验证解决方案(第3.2节)。实现分层agent的高吞吐量异步更新的系统是一项重大贡献,为大规模时间抽象和信用分配实验打开了大门。
这是机器人学和复杂规划领域的突破。
Meta的FAIR团队开源了一种名为Scalable Option Learning的新方法。它以前只在LLM中见过的规模训练专用agent。
工作原理如下:
这类AI(通过分层强化学习训练的agent)训练缓慢的原因在于并行化瓶颈。
想象一个AI团队,有一个规划者和许多专业工人(子任务)。旧方法在处理每个规划者的决策时必须逐一处理,然后才能训练工人。
SOL通过新的系统设计解决了这个问题:
单一统一大脑:不再使用独立模型,而是使用单个actor-critic网络来容纳规划者(控制器策略)和所有工人(选项策略)。
数字“开关”:使用one-hot向量告诉统一大脑在任意给定时刻扮演哪个角色,该标志表示“对于此输入,扮演‘导航’工人角色”。这使得不同策略的数千个不同决策可以批量处理并一次性发送到GPU。
智能学习“过滤器”:在采取行动后,使用称为tensorized masking的技术。将其视为一个智能过滤器,确保正确的性能反馈(奖励和优势)到达正确的工人策略。这打破了一次更新一个的问题。
这种架构允许整个分层系统并行批量学习,消除了阻碍该领域的瓶颈。
为什么重要:
这种新训练方法改变了构建能够推理和执行长期任务的agent的可行性。
商业领袖:该架构是开发复杂自主系统的关键。25倍的训练周期加速了机器人学、物流和多阶段流程自动化的研发,使复杂、战略性的AI在商业上可行。
实践者:作者计划开源SOL。您可以实现学习长期技能的agent,而无需承受旧HRL方法的性能损失,为构建更结构化且可能更稳健的模型开辟了道路。
研究人员:本文提出了HRL扩展问题的已验证解决方案(第3.2节)。实现分层agent的高吞吐量异步更新的系统是一项重大贡献,为大规模时间抽象和信用分配实验打开了大门。