行业新闻

AReaL 2.0 开源,为智能体提供在线强化学习训练基础设施

AReaL 2.0 让已上线的 Agent 能直接从真实工作中学习,解决了部署后能力停滞的核心瓶颈。

AReaL 2.0 面向已部署的 Agent,通过记录并利用其在真实任务中的交互数据,结合强化学习(一种让模型从试错中学习的方法)实现持续优化。开发者无需改造 Agent,只需将模型推理请求接入统一入口,即可启动在线学习流程,让 Agent 越用越强。同时系统引入数据代理机制,确保企业数据权限可控。

正文摘录

7 月 2 日,开源强化学习基础设施项目 AReaL 正式发布 2.0 版本。AReaL 旨在打通基础模型训练与现代智能体应用之间的链路,为 Agent(智能体)应用场景提供高效的强化学习训练支撑。 此次发布的 AReaL 2.0 版本面向已经进入真实业务场景的 Agent,提供了一套让 Agent 在使用中持续学习的系统基础设施。通过 AReaL 2.0,Agent 在完成真实任务时产生的交互过程,可以被记录、整理,并接入后续训练流程,用于持续优化底层模型,从而让 Agent 在安全可控的前提下越用越强。 如今,Agent 正在进入真实生产环境,写代码、查资料、调用工具,在企业系统中完成越来越复杂的任务。但一个问题也随之出现:Agent 每天都在工作,却很难从工作中真正成长。 在真实业务中,Agent 会产生大量有价值的经验:哪些任务完成得好,哪里调用工具失败了,用户为什么不满意,某一步决策是否走错了方向。但是,这些信息大多只是以日志形式被保存下来,很难稳定、安全地转化为下一次能力提升。 AReaL 2.0 要解决的,正是 Agent 上线之后如何继续成长的问题。开发者不需要重新开发 Agent,只需让 Agent 原本发给大模型的请求经过 AReaL 2.0 的统一推理入口,就可以接入在线强化学习流程。 以 Hermes Agent 为例,Hermes 仍然照常接收任务、规划步骤和调用模型,AReaL 2.0 则在后台记录它完成任务时的关键交互过程,并结合任务结束后的反馈或奖励信号,把这些真实轨迹用于后续训练。开发者也可以把 Hermes 替换成自己的 Agent 和任务环境,用同样的方式搭建 Agent 在线强化学习流程。 这意味着,Agent 的能力提升不再只依赖人工构造数据、离线训练和重新部署。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-02原文

相关内容