行业新闻

AReaL 2.0开源:推动Agent自演进的在线强化学习系统

AReaL 2.0 将在线强化学习集成到 Agent 服务中,使 Agent 能在真实交互中自我改进。

Agent 在真实工作流中产生大量交互数据,但很少被用来改进自身。AReaL 2.0 提供一套开箱即用的在线强化学习基础设施,通过轨迹数据协议、企业级数据代理和演进控制平面三个组件,让已部署的 Agent 能在很少改动的前提下接入学习闭环,实现从使用中变强。

正文摘录

Agent 的自演进,被刚刚开源的 AReaL 2.0 按下了加速键 - 来源:机器之心 - 编辑:杜伟 当 Agent 从演示视频中的炫技片段开始走进真实工作流与生产环境,下一阶段的「何去何从」成为业界关注的焦点。 最近,Claude Code 创造者 Boris Cherny 在一次访谈节目中透露,「在 Anthropic 内部,几乎 100% 的工程师都在同时运行 100 多个带有自我改进循环的 Agent【1】。这样的能力让它们在每次运行中不断变得更好」。此外 Anthropic 也发布了名为《When AI builds itself》的深度报告,其中提到当前 AI 正在接管自身的研发流程,未来将迈向递归自我改进【2】。 种种迹象表明,Agent 正面临着又一次关键的节点:从「会使用工具并完成任务」转向「在使用中学习并改进完成任务的方法」。 但现实是,Agent 可以在软件工程、客服、科研助理等真实场景任务中运行,却很难在运行中变强。它们每天都会产生大量交互轨迹,包括成功路径、失败步骤、用户修正、工具调用结果等。可问题在于这些数据与经验大多只被当作日志或监控信息,用于排查问题,很少被系统化地转化为下一轮能力提升。 这背后暴露出的,是 Agent 进入生产阶段后的一大缺口。破局点在什么地方?由蚂蚁联合香港科技大学、清华大学组成的 AReaL 团队认为,自演进的障碍不只停留在单一 RL 算法层面,而在于缺少一套面向真实智能体服务的在线强化学习系统基础设施。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-02原文

相关内容