T1: 面向长时程任务的终端 Agent 强化学习
Agent 的使用正转向编码、科学发现等长时程任务,其中终端任务尤为关键。我们提出 T1,一个总参数 122B 的 Mixture-of-Experts 模型,通过强化学习训练,在云沙箱中操作真实 shell,每任务最多进行 300+ 轮工具调用,并以执行各任务自身的 verifier 作为奖励。 我们给出一套完整训练方案: 1. 激进热启动:用于稳定 actor-critic 训练,并配合稠密过程奖励,按通过 verifier 的绝对数量对轨迹打分。 2. 稳定优化:通过 TITO 构造、在精确采样的 token identifier 上训练并在轮次边界做漂移修复,以及 rollout routing replay(记录采样器在每个 MoE 层的逐 token expert 选择,并在训练时回放)。 3. 完全分布外训练语料:隔离种子与合成任务,与 Terminal-Bench 2.1 不相交,确保收益来自真实能力迁移,而非 benchmark 过拟合。 TITO 与 R3 将训练到推理的 log-probability 差异从 0.021 降至 0.013,损失区域的 token 漂移精确对齐为零。在 Terminal-Bench 2.1 上,我们的 post-train pipeline 将初始基座模型从 43.8% 提升至 T1 的 64.0% resolved;在 Long-Horizon Terminal Bench 上,T1 达到 27.9%,超过 GPT-5.4 与 GLM-5.1。
论文精读
TL;DR T1 是一个 122B MoE 终端智能体,通过强化学习在真实 shell 中执行长时程任务,以 TITO 和 R3 稳定训练,在 Terminal-Bench 2.1 上从 43.8% 提升至 64.0%。
问题
问题背景
当前 AI agent 研究正从短程问答与单步工具调用,转向长程终端任务(如代码调试、科学实验自动化、系统运维)。终端环境提供真实 shell 与可执行验证器,成为衡量 agent 长期规划与执行能力的关键场景。
现有方法局限
- 训练-推理不一致:MoE 模型在 RL 采样与训练时存在 token 重编码和路由选择漂移,导致 log-prob 偏差(T1 论文中 TITO 修复前差异达 0.021),破坏 actor-critic 的 on-policy 假设。
- 稀疏奖励难优化:传统结果奖励只在任务完全成功时给信号,对 300+ 工具调用轮次的长轨迹无法有效做信用分配,导致训练不稳定。
- 基准过拟合:训练集与评测基准相似时,模型易记住特定任务模板或漏洞,而非获得通用终端操作能力。
为什么这个问题难/重要
长程终端任务要求模型在云沙箱中持续执行数小时、数百步交互,环境反馈延迟高且奖励极稀疏。MoE 架构下 RL 的训练稳定性、基础设施的并发吞吐、以及 reward hack 的防范都是工程硬骨头。业界对自动化长程任务(代码生成、DevOps、科学工作流)需求强烈,可靠的终端 agent 能直接提升研发效能,故该方向兼具学术挑战和产业价值。
行业类比
类似于自动驾驶的端到端策略训练,需要同时解决长序列决策的信用分配、训练与部署的分布一致性,以及高成本仿真环境的吞吐效率。
核心洞察
- TITO(Token-In, Token-Out)与 rollout routing replay 结合,从根源上消除了 MoE 模型在强化学习中的训练-推理不匹配。以往方法通常忽略 token 重新编码导致的概率漂移或仅修正损失掩码,而 T1 通过保留前缀避免 re-encoding drift,同时重放采样时的 expert routing 决策,使训练与推理的 log-prob 差从 0.021 降至 0.013,且 loss 区域内 token drift 严格为零,为大规模 MoE 的 RL 稳定性提供了可复现的工程方案。
- Dense verification reward 将终端任务的稀疏成功信号转化为逐验证点的稠密过程奖励。传统做法常以最终 exit code 或单一测试通过作为奖励,信号稀疏且 credit assignment 困难;T1 对每个 assertion 或测试用例独立评分,并以通过数量作为轨迹分数,使策略能在长程任务中获得持续梯度,避免探索陷入无效分支,同时通过数据过滤和奖励尺度设计抑制 reward hacking,提升了长程任务的样本效率。
- 训练语料通过递归合成与种子隔离构建,确保与 Terminal-Bench 2.1 完全不相交,从而验证模型能力是真实泛化而非基准记忆。这一设计直接回应了 agent 评测中常见的 benchmark overfitting 问题:通过隔离数据来源并采用 out-of-distribution 任务,T1 从基座 43.8% 提升至 64.0% 的结果可被视为可靠的终端操作能力提升,而非对特定测试集的过拟合。
方法
输入与训练数据
输入为终端任务(描述 + 可执行验证器)。任务通过递归合成生成,使用隔离种子与合成任务构建 38k 规模的分布外训练集,确保不依赖 Terminal-Bench 2.1 泄漏。
关键模块
稳定 MoE 强化学习 是核心,分为两个组件:
- TITO (token-in, token-out):训练时保留前缀防止重编码漂移,在轮次边界修复 token 标识符偏移;通过损失掩码拼接采样流,实现零漂移。
- R³ (rollout routing replay):记录采样器在每层 MoE 的专家选择并在训练中重放,消除训练-推理 log-probability 差(从 0.021 降至 0.013)。
密集验证奖励设计 将稀疏结果转化为逐断言奖励:对每个测试用例的通过/失败给出过程奖励,并按测试计数归一化;通过数据侧过滤、奖励尺度控制与洗牌策略防止奖励黑客。
Critic 稳定性 包括 critic 预热、价值目标条件化及 actor-critic 共置的容量建模。
输出
训练得到的 T1 模型能在云沙盒中执行 300+ 工具调用轮次的长时程任务,在 Terminal-Bench 2.1 上从 43.8% 提升至 64.0%,Long-Horizon Terminal Bench 达 27.9%。
与同类工作的差异点:显式针对 MoE 架构的 actor-critic 训练-推理失配,通过 TITO 与 R³ 保证 token 级对齐,而非仅靠通用 RLHF 流程。
实验
实验设计
- 训练数据:RST-38k 递归合成任务、TMax-15k 二元 reward 基线、T1-15k dense reward 后 checkpoint。
- 评估基准:Terminal-Bench 2.1 与 Long-Horizon Terminal Bench。
- 训练流程:从 SFT checkpoint 出发,先 binary reward 于 TMax-15k,再 dense reward 于 RST-38k,最后 Critic Warm-Up 后 dense reward 于 T1-15k。
- 稳定性消融:TITO 与 R3 联合将训练-推理 log-prob 差从 0.021 降至 0.013,损失区 token drift 为零。
关键发现
- 模型从 base 的 43.8% 提升到 64.0% resolved on Terminal-Bench 2.1。
- Long-Horizon Terminal Bench 达 27.9%,超越 GPT-5.4 和 GLM-5.1。
- 收益主要来自 Medium 难度任务;更高成功伴随更多交互轮次;失败案例暴露低效搜索。
- 工程启示:MoE RL 训练中 token 级对齐和路由重放是稳定收敛的关键,对长 horizon 任务尤其重要。
与基线对比解读
- 相对 base model +20.2 个百分点,证明 out-of-distribution 训练数据带来真实迁移而非 benchmark overfitting。
- 超越 GPT-5.4 / GLM-5.1 说明专用 terminal RL 训练在长程任务上优于通用大模型,尽管绝对分数仍低,提示 verifier 完整性和 horizon 扩展仍是瓶颈。
行业影响
落地场景
T1 作为可操作真实 shell 的长程终端代理,可直接用于云开发环境、CI/CD 流水线和自动化运维平台。核心场景包括:
- 企业服务:自动响应 GitHub Issue,在沙箱中调试代码、安装依赖、运行测试并提交 PR,减少人工介入。
- 电商平台:自动维护商品价格监控脚本、更新库存数据库 ETL 流程、处理促销活动配置脚本,每任务可执行 300+ 工具调用轮次。
商业价值
- 降本:将资深工程师从重复性终端操作中释放,降低长尾任务的人工成本,尤其在夜间或跨时区支持中体现明显。
- 增收:加速软件交付周期,提升研发吞吐量,使产品迭代更快上线,直接转化为市场响应速度。
- 体验提升:提供 7×24 自动化执行,终端任务成功率从 43.8% 提升至 64.0%(Terminal-Bench 2.1),减少失败重试带来的等待时间。
与现有产品/工作流的接口
T1 可以 API 形式嵌入既有平台:
- 通过
sandbox容器执行任务,输出结构化结果与完整日志。 - 与 Jenkins、GitLab CI、Argo Workflows 等集成,作为自定义
executor节点。 - 利用任务自带
verifier对接现有测试套件,将完成判定自动化。
关键集成点:基于 TITO 与 R3 稳定训练后的模型,可安全地在生产环境中与用户自有
verifier交互,无需改动底层基础设施,训练-推理 log-prob 差从 0.021 降至 0.013。
局限
- **条件精确性局限**: TITO 保证“token-in, token-out”在损失区域零漂移,但模型最终仍只能对“重分词后的历史”做到精确条件,一旦推理与训练分词不一致仍存在潜在偏差;此外,作者明确表示尚未进行单轴奖励消融(如 dense vs. sparse、per-assertion 权重),难以分离各奖励设计的独立贡献。
- **奖励可被利用与验证器完整性**: 验证器完整性目前只是数据侧过滤、非运行时强制,模型可能仍通过生成大量低质量 turn 来“刷过”断言;过滤不掉的任务依然存在可被利用的奖励漏洞,因此 dense reward 在开放环境中的可靠性尚未闭环。
- **可扩展性与迁移范围**: TITO + R3 需记录每个 MoE 层每 token 的专家选择,存储与重放成本高;基础设施依赖共置 actor-critic、上下文并行和小时级 step 的 liveness 工程,普通团队难以复现;此外 LHT 上 27.9% 的绝对成功率仍低,且评测集中于 verifier 定义清晰的 terminal 任务,向开放式真实终端工作流的迁移有待验证。