不要掩蔽环境:观测监督改变 Agent 在 RL 下的探索方式
Agent 轨迹记录了 agent 的动作以及随后发生的结果。然而标准监督微调(SFT)只对 agent 生成的动作 token 计算损失,把环境观测当作上下文而非预测目标。本文追问:这一惯例是否真的为后续强化学习提供了最佳初始化? 我们提出 ActObs,它对每条轨迹中已有的观测 token 一并施加监督。尽管部署时的 agent 从不需要生成观测,但学习预测观测会促使策略建模动作后果,而且不增加数据、参数、序列 token 或前向传播。 实验发现: - 两种方法在 SFT 后表现相近,但经过 GRPO 后出现分化。 - Qwen3-4B 上,从 ActObs 出发的 GRPO 在 Terminal-Bench 2.0 的每个采样预算下 pass@k 都高于仅动作版本。 - Qwen3-8B 上,它以部分 pass@1 可靠性换取更高的 pass@k(pass@16 +3.4 pp),并解决更多不同任务。 - 优势还延伸到 aider-polyglot 的跨域代码编辑(4B 时 pass@1 +4.2 pp),而这些任务在 SFT 与 RL 中均未见过。 ActObs 在 RL 中保留更多熵,同时需要更少的策略位移,使最终策略更接近其 SFT 初始化。分析把差异追溯到 SFT 阶段:动作与观测梯度迅速趋于正交,而仅动作训练会留下很大的残余观测梯度,使环境预测退化到低于基座模型。联合监督避免了这种单边特化,保住后果预测能力,并为下游探索做好准备。
论文精读
TL;DR ActObs 在 SFT 时同时监督观察 token,让模型学习动作后果,无需额外数据或参数;该初始化使 GRPO 后探索更充分、pass@k 更高,且策略更贴近 SFT 起点。
问题
问题背景
当前,语言智能体(LLM agents)的训练普遍采用两阶段:监督微调(SFT) 初始化策略,再通过强化学习(如 GRPO、RLVR)优化轨迹回报。SFT 数据来自 agent 轨迹,包含交替的 action 与 environment observation。
现有方法局限
标准 SFT 只对 agent 生成的 action tokens 计算交叉熵损失,observation tokens 仅作为上下文输入,不参与预测。作者指出,这会造成"单向专业化":模型只学习动作分布,没有建模动作后果。论文分析发现,SFT 阶段 action 与 observation 的梯度很快变得正交;仅训练 action 会留下较大的 observation 残差梯度,并使模型对环境的预测能力低于原始基座模型。这种初始化在 RL 阶段导致策略探索能力下降、过早收敛,限制了最终 pass@k 等指标。
为什么这个问题难/重要
从工程直觉看,部署时 agent 不会生成 observation,因此传统观点认为监督 observation 无关紧要。但本研究证明,预测 observation 能促使策略内化动作-后果关系,且不增加数据、参数、序列长度或前向计算。难点在于:如何在不改变推理架构的前提下,利用 SFT 阶段保留对世界动态的建模?业界对 RLVR 的探索效率和初始化质量高度关注,这一问题直接关系到后续强化学习的样本效率和最终能力上限。
行业类比
类似自动驾驶策略训练中,若只预测转向和油门指令、不要求模型预测车辆下一状态,模型难以学到控制行为对环境的因果影响,导致 RL 微调时探索不稳定。
核心洞察
- 标准 SFT 只对 action tokens 计算损失会破坏策略对环境的预测能力,而 ActObs 在 SFT 阶段联合监督 observation tokens,零额外成本地保留后果建模,使 GRPO 后的策略保留更高熵、更少策略移动,从而提升 pass@k。这一发现将 SFT 的损失掩码选择与下游 RL 的探索行为直接关联,揭示了初始化质量影响探索效率的机制,而非仅仅提高 SFT 精度。
- 与常见 world model 方法不同,ActObs 不引入额外模块、参数或前向传播,纯粹利用轨迹中已有的 observation tokens 作为预测目标。这种设计在 SFT 阶段即可优化,让策略学会预测动作后果,且该能力具有跨域迁移性:在 Terminal-Bench 上训练后,能提升 aider-polyglot 代码编辑任务的 pass@1。这为 RLVR 的初始化提供了一种无开销的改进路径,区别于依赖辅助损失或额外网络的方案。
方法
ActObs 的核心是在 SFT 阶段同时监督轨迹中的动作 token 与环境观察 token,利用已经存在的完整轨迹数据,不增加额外样本、参数、序列长度或前向传播。
输入与目标
输入为智能体轨迹,包含交替的动作 token(agent 生成)和观察 token(环境返回)。标准 SFT 只把动作 token 作为预测目标,观察 token 仅作为上下文。ActObs 把两类 token 都作为预测目标。
关键模块:联合监督损失
- 对动作 token 计算标准的因果语言模型损失(交叉熵),保持策略学习"下一步做什么"。
- 对观察 token 同样计算下一 token 预测损失,迫使模型学习"动作会带来什么环境反馈"。
- 总损失为两部分加权求和,权重
λ_obs作为超参数控制观察监督强度。论文中λ_obs = 1.0为默认设置,消融实验分析不同取值的影响。
输出与部署
训练输出为同一个策略模型;推理时模型只生成动作 token,不生成观察 token。因此 ActObs 仅在训练阶段使用观察监督,部署开销与动作型 SFT 完全一致。
为什么有效
联合监督防止模型朝"只优化动作选择、忽略环境后果"的单侧专业化退化。SFT 后期动作梯度与观察梯度趋于正交,单独监督动作会让模型丧失对观察的预测能力,而 ActObs 保留这种后果建模能力,为后续 GRPO 等强化学习提供更优的初始化,使 RL 阶段保持更高探索熵,且策略移动更小。
跟同类方法的差异点:ActObs 不引入世界模型或额外网络,而是直接挖掘轨迹中已有的观察 token 作为监督信号,以零额外推理成本增强策略的后果感知初始化。
实验
实验设计
我们在 Terminal-Bench 2.0 和 aider-polyglot 两个基准上评估 ActObs。先对 Qwen3-4B 与 Qwen3-8B 进行 SFT,分别采用 ActObs(同时监督动作与观察 token)和 仅动作监督 作为初始化,随后进行 GRPO 强化学习。评估指标为 pass@k,并分析训练动态(熵、策略移动、梯度方向)。
关键发现
- SFT 后两者表现接近,但 GRPO 后差异显著:在 Qwen3-4B 上,ActObs 在 Terminal-Bench 所有采样预算上
pass@k全面领先;在 Qwen3-8B 上,pass@16提升 +3.4 pp,且解决更多不同任务,但pass@1略有下降。 - 跨域迁移:在 aider-polyglot(SFT 与 RL 未见过的代码编辑任务)上,Qwen3-4B 的
pass@1提升 +4.2 pp。 - 行为分析:ActObs 在 RL 期间保持更高熵,策略移动更小,最终模型更接近 SFT 初始化;SFT 阶段动作与观察梯度迅速正交,而仅动作训练会留下大的观察梯度残差并削弱环境预测能力。
深度解读
ActObs 的核心优势在于利用轨迹中已有的观察 token 作为额外监督,无需增加数据、参数或推理开销,便使策略更早地建模动作后果。与仅动作监督相比,其初始化避免了过度专业化,保留了后果预测与探索多样性,从而在 RL 后获得更高的采样效率和跨任务泛化。这提示在实际工程中,SFT 阶段不应忽略环境观察的预测信号,尤其当后续需要 RL 或部署在多样场景时。
行业影响
ActObs 的核心价值在于零成本提升 RL 智能体初始化质量:仅改变 SFT 损失 masking 策略,同时监督环境 observation token,不增加数据、参数或推理开销。
落地场景
- AI coding agent / terminal automation 等工具调用场景:SFT+GRPO 训练流程可直接受益,如代码编辑器自动修复、命令行运维 agent。
- 企业服务 / 电商售后 agent:在多步交互环境中需要稳定完成长尾任务,ActObs 提升 pass@k 与任务覆盖率,减少人工接管。
商业价值
- 降本:减少 RL 训练中策略漂移与奖励 hacking,缩短调参周期;部署时以相同算力获得更高 pass@16,单位任务成本下降。
- 增收 / 体验:跨域迁移(+4.2pp pass@1 in aider-polyglot)使产品能快速扩展到新任务域,提升自动化完成率与用户留存。
与现有工作流集成
- 修改 SFT 序列损失 mask,将 observation token 纳入下一 token 预测目标(如
labels中取消对观察部分的 -100)。 - 与现有 GRPO/PPO 框架无缝衔接,无需修改模型结构或推理服务配置。
- 可将 ActObs SFT checkpoint 作为 RL 初始化,替代当前 action-only SFT,保留更多熵,降低 RL 对策略的破坏。
该方法与 world model / trajectory supervision 研究互补,但更轻量,适合直接落地。
局限
- **模型规模与 RL 算法覆盖有限**:实验仅在 Qwen3-4B 和 Qwen3-8B 上进行,未验证更大规模模型(如 70B+)或其他架构(如 Llama 系列)。不同预训练模型对 observation 预测的难易度和梯度特性差异可能影响 ActObs 的效果。此外,RL 阶段仅使用 GRPO,未对比 PPO、REINFORCE 等其他 RLVR 算法,无法判断该初始化增益是否依赖于 GRPO 的特定机制(如 group-based advantage 估计)。工程落地时需在更广泛的模型和 RL 算法组合上验证稳健性。
- **任务域与 SFT 数据分布局限**:评估集中在 Terminal-Bench 2.0 和 aider-polyglot(代码编辑),任务类型相对狭窄。虽然展示了跨域迁移能力,但 SFT 数据来自特定终端和代码轨迹,可能引入任务偏向。对于 web navigation、GUI 操作、具身智能等 observation 语义差异极大的场景,预测 observation 的难度和收益未知。同时,SFT 数据质量(轨迹多样性、长度分布)对梯度正交性结论的影响未深入讨论,可能限制方法在其他数据上的泛化。
- **训练开销与超参数敏感性**:虽然不增加前向传播、参数量或序列 token,但对 observation token 计算损失会增加反向传播的梯度计算和显存占用,尤其对于长轨迹,SFT 阶段训练时间可能显著上升。论文未报告具体开销对比。另外,observation loss 权重是关键超参数,文中虽进行了扫描,但最优值依赖任务和模型,实际部署需额外调参成本。对于追求训练效率的团队,需要权衡收益与额外计算负担。