行业新闻

港中文与恒生大学提出 Libra,Agentic RL 后训练吞吐最高提升 3 倍

Libra 把训练和 rollout 当作耦合系统动态调 GPU,解决 Agentic RL 中资源波动导致的低效,最高提速 3 倍。

Agentic RL 后训练(让模型通过调用工具与环境交互来学习任务)中,轨迹长度波动极大,且训练与推理的资源需求不断变化。港中文与恒生大学提出 Libra,将训练和 rollout 视为整体动态分配 GPU,并通过异构推理集群、因果感知调度与弹性切换,在 48 张 A800 上实现最高 3 倍吞吐提升。

正文摘录

- title: Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍 - sourcecompany: 机器之心 - bodymarkdown: ![](https://image.jiqizhixin.com/uploads/article/coverimage/b2aaea2e-62b6-4031-bd16-8721dac6649b/032(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 大语言模型正在从 “回答问题” 走向 “完成任务”。在 Agentic RL 后训练中,模型不仅生成文本,还会调用搜索、代码执行等外部工具,根据环境返回继续推理。这样的交互让模型拥有更强的行动能力,也让训练系统面对一种比普通 RLHF 更不稳定的工作负载:同一批请求可能产生长度相差数十倍的轨迹,少量超长轨迹拖慢整个 rollout;与此同时,训练和 rollout 对 GPU 的需求还会随着策略演化不断变化。 针对上述问题,来自香港中文大学和香港恒生大学的研究团队提出了 Libra ,一个面向 Agentic RL Post-Training 的资源管理系统。Libra 不再把 rollout 视作固定瓶颈,而是将训练与 rollout 作为一个耦合系统统一优化,并通过 异构推理集群、因果感知调度和弹性资源切换 ,让有限 GPU 资源随着实时工作负载动态流动。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-12原文

相关内容