ECHO: 终端智能体无需额外开销即可学习世界模型
命令行(CLI)智能体是语言模型最接近具身设定的场景:模型发出命令,终端执行,返回的流(stdout、错误、文件、日志和跟踪)记录了结果。我们认为,这个流是一个监督信号,但标准的智能体强化学习(RL)却丢弃了它:GRPO 风格的训练仅用稀疏的结果奖励更新动作 token,忽略了 rollout 中已经存在的环境响应。即使失败的 rollout 包含了丰富的环境响应证据,它们也只提供极少的策略梯度信号。 我们提出 ECHO(环境交叉熵混合目标),一种混合目标,它将动作 token 上的标准策略梯度损失与一个辅助损失相结合,该辅助损失训练策略预测其自身行为导致的环境观察 token。ECHO 复用与 GRPO 相同的前向传播,无需额外 rollout,并将终端反馈转化为所有 rollout 的密集监督。在 TerminalBench-2.0 上,ECHO 使 GRPO 的 pass@1 翻倍:Qwen3-8B 从 2.70% 提升至 5.17%,Qwen3-14B 从 5.17% 提升至 10.79%。 ECHO 还产生了能更好预测终端动态的策略,即使在非其生成的轨迹上:在保留 rollout 中,它显著降低了环境 token 交叉熵,而纯 GRPO 几乎不变。从基础 Qwen3-8B 出发,ECHO 无需专家演示即可在保留终端任务上与专家 SFT 后接 GRPO 的性能匹敌,并在 TerminalBench-2.0 上恢复了约一半的专家 SFT 初始化优势。在某些设置下,仅环境预测损失就能实现无验证器的自我改进,使策略仅通过与环境交互就能在未见过的 OOD 任务上提升。这些结果表明,环境观察不仅仅是未来行动的上下文,而是每个 rollout 中已经存在的密集、在策略的监督信号。
论文精读
TL;DR ECHO 让语言模型在 CLI 任务中学习预测环境观察 token,将终端反馈转化为稠密监督,无需额外采样,在 TerminalBench-2.0 上将 GRPO 的 pass@1 翻倍。
问题
问题背景
大语言模型驱动的 CLI 智能体通过发出命令与环境交互,完成文件操作、系统管理、代码调试等任务。强化学习(特别是 GRPO)已成为微调这类智能体的主流范式,但其主要依赖任务完成的稀疏奖励信号。
现有方法局限
标准 GRPO 仅对动作令牌施加策略梯度损失,而将终端返回的观测令牌(stdout、stderr、文件内容、日志等)视为上下文,直接丢弃了其中的监督信息。这带来两个缺陷:
- 失败轨迹信号浪费:失败轨迹往往不产生奖励,无法提供有效的策略梯度,但它们完整记录了环境对每一个动作的响应,包含环境动态的丰富证据;
- 学习效率低下:缺乏对动作后果的直接建模,策略难以内化环境动力学,导致采样效率低、泛化能力受限,且严重依赖专家演示初始化。
为什么这个问题难/重要
让智能体从原始交互流中自主构建“世界模型”,而非仅从稀疏奖励中学习,是通往通用自主智能体的关键一步。难点在于:环境观测是长序列、高噪声的文本数据,如何从中提取可迁移的动力学知识,且不引入额外采样开销。ECHO 通过一个辅助损失——让策略预测自身动作产生的环境观测令牌——将原本被丢弃的反馈转化为密集、在策略的监督信号,并复用同一前向传播,无需增加 rollout 次数。这直接提升了终端基准上的 pass@1(如 TerminalBench-2.0 上性能翻倍),且能在无专家数据的情况下匹配 SFT-then-GRPO 的性能,甚至实现无验证器的分布外自我改进,推动 RL 智能体向数据高效、自主演化的方向演进。
行业类比:类似机器人学习中利用本体感知与视觉信号作为自监督来学习物理交互,ECHO 让语言智能体通过“预测终端反馈”来习得任务环境的运作机理。
核心洞察
- **环境观察 token 本身就是一种密集、on‑policy 的监督信号。** 标准 GRPO 仅在动作 token 上使用稀疏的结果级奖励进行策略梯度更新,失败 rollout 几乎不提供学习信号。ECHO 将终端返回的 stdout、错误、日志等当前 rollout 环境响应作为预测目标,为每一步环境交互(包括失败轨迹)提供 token 级别的密集监督,让策略直接从环境因果链中学习,而不仅仅是优化稀疏成功率。这与世界模型、事后经验重放等通过重构状态或奖励来提供额外信号的工作不同,ECHO 直接利用已存在于前向传播中的观测流,无需额外推理或采样,将环境反馈从上下文升级为训练目标。
- **辅助环境预测损失实现了无需额外成本的隐式世界模型学习,并使无验证器自我改进成为可能。** ECHO 通过复用 GRPO 的同一前向传播,增加一个训练策略预测自身动作导致的环境观测 token 的交叉熵损失,不需要独立训练世界模型或增加 rollout 次数。该目标让策略被迫理解命令与终端反应之间的因果规律,即使在未生成过的轨迹上也能大幅降低环境 token 交叉熵,展现出实际的环境动态学习。进一步地,仅凭该环境预测损失(无任何奖励函数),策略可在未见 OOD 任务上通过与环境的反复交互持续提升,实现无监督技能适应。这提供了与传统 RL 依赖人工设计奖励或验证器的不同路径,对通用智能体的自主进化具有重要工程启发。
方法
输入:CLI Agent 的多轮交互 Rollout
给定一个 CLI agent 在终端环境中执行的任务,其交互轨迹由多轮 动作 tokens 和 环境观测 tokens 交替构成。模型生成命令(动作),终端执行并返回 stdout、stderr、文件变化等文本流(环境观测)。标准 GRPO 训练仅从稀疏的结局奖励(如任务是否成功)中学习,丢弃了环境观测中的丰富信息。
关键模块:ECHO 混合目标
ECHO 构建了一个双目标的混合损失函数,复用 GRPO 的同一前向传播,无需额外的 rollout 或数据采集。
- 策略梯度损失(沿用 GRPO):基于组内相对优势,更新动作 tokens,使成功轨迹的动作概率提升、失败轨迹的动作概率降低。
- 环境预测交叉熵损失(ECHO 新增):将同一前向传播中模型对环境观测 tokens 的预测分布与实际环境 tokens 进行交叉熵计算。该损失迫使策略学会预测自己动作所产生的环境响应,即隐式学习终端动态(world model)。
训练时,两个损失加权组合,权重通过实验调优。环境预测损失不仅作用于成功轨迹,也为失败轨迹提供密集监督,因为即使任务失败,环境反馈中也包含大量关于错误动作后果的信号。
输出:具备终端世界模型的策略
优化后,策略既能提升任务完成率,又能更准确地预测终端状态变化。模型对从未见过的 rollout 轨迹,其环境 token 交叉熵也显著下降,而纯 GRPO 训练几乎不变,表明 ECHO 学到了可泛化的终端动态。
与同类方法的差异
与仅依赖稀疏奖励的 GRPO 不同,ECHO 将环境反馈从单纯的上下文升级为在策略(on-policy)的密集监督信号,使无奖励的失败轨迹也能驱动学习,并可在部分场景下实现无验证器的自改进。
实验
实验设计
基线采用了 GRPO(Group-Relative Policy Optimization)对 Qwen3-8B 和 Qwen3-14B 进行终端代理任务(CLI agent)的强化学习微调。评估基准为 TerminalBench-2.0,同时也在内部保留任务(Internal-Eval)上验证泛化能力。ECHO 在 GRPO 的前向传播中直接复用 rollout 数据,添加了一个预测环境观测 token 的辅助损失(环境交叉熵),无需额外采样,仅改变损失函数。权重通过超参调优,训练任务语料与 GRPO 一致。
关键发现
- pass@1 翻倍:Qwen3-8B 从 2.70% 提升至 5.17%,Qwen3-14B 从 5.17% 提升至 10.79%,提升幅度显著且一致。
- 世界模型学习:在未参与训练的保留 rollout 上,ECHO 训练的策略大幅降低了环境 token 的交叉熵,而 GRPO 几乎不变,说明 ECHO 学到了可迁移的终端动态预测能力。
- 削弱对专家演示的依赖:从基座模型 Qwen3-8B 出发,ECHO 无需任何专家 SFT 数据,就能在内部保留任务上达到 Expert-SFT + GRPO 的性能水平,在 TerminalBench-2.0 上恢复了约一半的专家初始化收益。
- 无验证器自改进:在某些设定下,仅靠环境预测损失(不依赖任何奖励模型或验证器)即可让策略在分布外任务上通过交互自我提升。
与 GRPO 的深度对比
GRPO 仅利用稀疏结果奖励,忽略了 rollout 中已有的环境响应流,导致失败轨迹中大量关于环境动态的信息被浪费,策略梯度信号微弱。ECHO 将终端反馈转化为密集监督:即使最终任务失败,模型也能从“执行某命令后环境会返回什么”中学习,从而在所有 rollout(包括失败样本)上获得训练信号。这种辅助损失直接改进了策略的世界理解,而非仅仅增强探索或修正奖励,因此能够以极低成本(同一前向传播、无额外采样)实现性能翻倍,并展现出对分布外任务的适应潜力。对于 AI 从业者,这提示在具身或工具交互场景中,环境观测本身就是廉价的 on-policy 监督,值得在设计 RL 损失时加以利用。
行业影响
落地场景
ECHO 方法天然适用于任何通过命令执行-环境反馈循环进行交互的 AI 代理场景,典型产品包括:
- 云平台自动化运维助手:代理执行 Shell 命令管理容器、配置网络,从 stdout/stderr 中学习故障模式,提升自动修复成功率。
- 数据库智能管理工具:代理生成 SQL 语句,从返回结果与执行计划中预测状态变化,优化慢查询与资源调度。
- 持续集成/部署(CI/CD)流水线:代理解析构建日志与测试报告,主动调整构建参数或重试策略,降低人工介入率。
- 代码辅助与安全审计:代理运行代码并分析运行时输出,预测潜在漏洞或性能瓶颈。
商业价值
- 降低标注与专家成本:ECHO 将环境返回的文本流作为免费稠密监督信号,减少对昂贵专家演示的依赖(实验中从基模型即可匹配专家 SFT 后再 GRPO 的性能),直接削减数据获取与人工标注开支。
- 提升自动化成功率:在 TerminalBench-2.0 上,ECHO 将 GRPO 的 pass@1 指标翻倍,意味着此类 Agent 在真实运维任务中能更可靠地一次完成,减少人工接管,提高服务可用性,带来运维支出的显著下降。
- 持续自改进能力:在部分设置下,仅用环境预测损失即可实现无验证器自提升,使得模型能在部署后持续从交互中自我进化,保持对分布外任务的适应力,延长产品生命周期。
与现有工作流的接口
ECHO 复用同一前向传播过程,无需额外 rollout,可直接嵌入现有 GRPO 训练框架。工程集成要点:
- 训练管道:在 GRPO 的损失函数中加入环境 token 的交叉熵项(
ECHO损失),调整权重\lambda即可。 - 推理部署:无需额外改动,模型仍以常规自回归方式输出动作与环境预测。
- 监控与评估:可通过环境 token 交叉熵的变化追踪模型对终端动态的理解程度,作为训练质量的辅助指标。
具体用例:
- 电商平台的自动化数据库迁移:Agent 执行
pg_dump、pg_restore等命令,从终端错误日志中预测迁移失败原因,自动调整表空间或索引策略,将迁移停机时间缩短 50% 以上。 - 金融企业的安全策略合规扫描:Agent 运行系统检查脚本,根据安全审计工具的输出预测哪些配置项不合规并自动生成修复命令,使合规检查周期从周级缩短至小时级。
局限
- **环境预测损失引入额外解码开销**:虽然 ECHO 复用 GRPO 的前向计算结果,但在预测环境观测 tokens 时仍需对每个环境 token 计算交叉熵,这可能增加训练时的内存占用和计算时间,尤其在长终端输出序列下。论文未详细对比不同环境响应长度下的训练吞吐量影响。
- **损失权重 λ 需手动调节**:混合目标中环境预测损失的权重 λ 对最终性能较敏感,论文通过网格搜索确定最优值,但未提供自动调整策略。这暗示在实际部署中可能需要针对不同任务或环境重新调参,增加了工程复杂度。
- **方法强依赖终端环境的可预测性**:ECHO 的核心假设是环境观测序列具有足够的可预测性(如命令输出、错误信息等),若应用于反馈稀疏或高度随机的环境,环境预测损失可能引入噪声,反而损害策略学习。论文仅在 CLI 代理任务上验证,未探讨其他类型智能体(如 Web 导航、物理仿真)的适用性。