论文

Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments

大语言模型(LLMs)的进步推动了其作为交互智能体的部署,能够进行推理、规划和工具使用。然而,在现实随机且不完美的环境中,这些智能体常出现显著性能下降。我们认为,这种差异源于理想化训练环境与现实交互动态的根本不匹配——当前范式依赖精心设计的任务指令与稳定可控的环境。 为弥补这一差距,我们提出 NoisyAgent,一种将环境缺陷显式融入智能体学习过程的训练框架。我们识别了现实场景中两类主要交互噪声:用户噪声(反映用户交互的模糊性与变异性)和工具噪声(反映工具执行中的失败与异常)。通过在训练流水线中修改用户交互模式并模拟工具执行结果,我们将此类扰动引入训练。为稳定训练并鼓励智能体应对日益严峻的缺陷,噪声仅应用于部分 rollout 序列,并随着模型适应当前噪声水平逐步增加难度。 大量实验表明,该方法在噪声和动态环境下持续提升智能体鲁棒性。分析显示,噪声条件下的训练也能在理想基准上带来性能提升,表明受控的噪声暴露促进了更通用的推理与决策行为。我们的发现强调了建模交互缺陷对于弥合智能体训练与现实部署之间差距的重要性。

论文精读

TL;DR NoisyAgent 在训练中注入用户与工具噪声来模拟环境不完美,使 LLM 智能体在随机现实中更鲁棒,且意外地在理想基准上也获得了泛化增益。

问题

问题背景

大语言模型 (LLM) 驱动的交互式智能体 (agent) 在推理、规划、工具调用等任务上进步迅速,正从标杆测试走向真实部署。然而,当前训练范式严重依赖 理想化仿真环境——指令清晰、工具稳定、交互确定性,与真实场景的 随机性和不完备性 构成根本矛盾。

现有方法局限

现有 agent 训练多沿用监督微调或 Agentic RL,但存在明显缺陷:

  • 环境建模过于简化:训练环境假设用户输入总是明确且一次到位,工具调用必定返回正确结果,忽略了人类交互的歧义、遗漏、语义模糊,以及工具侧的网络超时、结果异常、执行失败等噪声。
  • 鲁棒性负优化:若不刻意引入噪声,模型在理想化轨迹上会过度自信,一旦遇到扰动就产生级联错误,泛化能力弱。
  • 噪声注入缺乏体系:已有工作或仅在推理时使用少量扰动,或采用固定强度噪声,未将 用户噪声工具噪声 作为训练通路的有机组成部分,更没有适配课程式难度调度。

为什么这个问题难/重要

真实交互的 噪声分布难以穷举,且注入不当会破坏训练稳定性。关键挑战在于:

  1. 噪声建模:需同时覆盖用户侧(如指令含混、意图省略)和工具侧(如 API 返回空值、异常超时)的多模态噪声,并保持语义合理性。
  2. 训练效率:噪声引入会增加探索难度,如何在不削弱基础能力的前提下逐步加大噪声,让 agent 适应而不失能,是一个微妙的平衡。
  3. 业界紧迫性:从客服机器人、代码助手到自动驾驶人机交互,agent 一旦部署,其可靠性直接关乎生产环境和用户体验,解决鲁棒性问题已从“可选项”变成“必选项”。

行业类比

这类似于 自动驾驶感知系统 只在晴好天气训练,却直接部署到雨雪雾夜场景中——必须通过注入 传感器噪声天气退化模型 来让系统学会应对不确定性,Agent 训练与此异曲同工。

核心洞察

  • 噪声环境训练本质上是一种面向交互 Agent 的数据增强策略,通过模拟用户输入模糊性与工具执行失败,将静态数据集训练转化为动态环境下的鲁棒策略学习。不同于以往仅依赖干净指令或事后防御的工作,该方法从训练源头引入任务相关的扰动,使模型学到更泛化的决策行为。
  • 自适应噪声调度机制在训练稳定性与难度提升间取得平衡:仅在部分 rollout 中注入噪声,并随模型适应度逐步增大噪声强度,避免了完全随机噪声导致的训练崩溃。这一设计类似课程学习,为 LLM Agent 的增量鲁棒性训练提供了可复用的范式。

方法

NoisyAgent 在标准 agentic reinforcement learning 流程中注入环境噪声,提升真实部署鲁棒性。

输入:典型 LLM agent 的训练环境,包含任务描述、用户指令、工具接口及对应执行结果。与常规训练不同,NoisyAgent 会主动扰动这些交互元素。

关键模块

  1. 自动噪声注入:识别两类现实噪声来源——用户噪声工具噪声。用户侧通过改写指令文本、引入歧义或冗余信息来模拟人类交互的不确定性;工具侧则对工具返回结果随机插入异常(如超时、错误码、格式错误),反映外部 API 或执行器的不可靠性。注入在 rollout 采样时动态执行,每个样本可能仅部分交互步骤被扰动。
  2. 自适应噪声训练:为避免直接引入高强度噪声导致训练崩溃,采用混合训练,即仅对部分 rollout 施加噪声,其余保持干净,以稳定优化。同时设计噪声调度:噪声强度与覆盖比例随模型能力提升逐步增加,形成课程式学习——初期在低噪声下掌握基本策略,后期适应更苛刻的不完美环境。

输出:一个经过噪声淬炼的策略网络,在下游任务中能稳健应对用户表述变化和工具故障,不依赖于理想化假设。训练后的模型不仅在含噪基准上显著提升,在干净基准上也表现出更通用的推理能力。

与仅依赖数据增强或对抗训练的 Robustness 方法不同,NoisyAgent 从交互源头显式建模用户与工具两端的不完美性,并通过自适应课程动态调控噪声难度,在训练稳定性和泛化性之间取得平衡。

实验

实验设计

NoisyAgent 在 agentic 强化学习训练流程中注入两类环境噪声:用户噪声 模拟真实用户交互的歧义与多变(如指令改写、缺失信息),工具噪声 模拟工具执行异常(如失败、超时)。噪声仅施加于部分 rollout,并采用自适应噪声调度:初始低噪,随模型适应逐步提升难度,以稳定训练。评估覆盖理想化基准及多种噪声变体,系统检验训练噪声对鲁棒性和泛化性的影响。

关键发现

噪声感知训练一致提升 agent 在随机和动态环境下的鲁棒性;即使在无噪声的理想化基准上,经过噪声训练的 agent 也获得性能增益,表明受控噪声暴露可促进更泛化的推理与决策行为,类似一种环境正则化。分析显示,训练引入噪声改变了 agent 的交互模式,使其更加谨慎且能主动修复错误。

与基线对比

与仅在纯净环境中训练的模型相比,NoisyAgent 在不同噪声强度和类型下性能衰减显著更低,同时在理想场景下成功率更高。这挑战了“纯净训练最优”的传统假设,说明刻意引入环境不完美是缩小 agent 训练与真实部署之间差距的关键手段。

行业影响

落地场景

NoisyAgent 框架直接赋能所有依赖 LLM-based 交互式 Agent 的商业系统,尤其是对鲁棒性要求苛刻的领域:

  • 智能客服与对话系统:用户输入常带歧义、错别字或省略(用户噪声),后端 API 调用(查库存、物流)可能超时或返回异常(工具噪声)。训练时注入此类噪声可使 Agent 在线处理时更平稳。
  • 金融自动化:量化交易 Agent 需应对市场数据缺失、撮合失败等工具噪声,以及交易指令的模糊性;风险合规 Agent 则需处理不完整的政策文档。
  • 企业级 RPA 与自动化平台:在软件操作中,UI 元素变化、网络波动均属工具噪声,用户下发的自然语言指令也可能不精确。
  • 自动驾驶与人机协同:决策 Agent 接收传感器噪声(工具噪声)和乘客模糊指令(用户噪声)。

商业价值

  • 降本:减少因 Agent 脆断引发的人工兜底成本。电商场景中,即使 10% 的误转人工率下降,也能显著节省人力。
  • 增收:Agent 在噪声环境下仍能完成复杂任务(如订单处理、投资决策),直接提升转化率和交易成功率。
  • 体验提升:用户感知不到工具异常或自身输入缺陷造成的系统崩溃,获得更流畅、可靠的智能服务,从而增强粘性。
  • 加速交付:采用 噪声注入+自适应训练 的方法,无需为每个真实环境反复收集异常数据,缩短 Agent 从实验室到生产的周期。

与现有产品 / 工作流的集成

NoisyAgent 可作为训练阶段的插件,无缝嵌入现有 Agent 开发流水线:

  • 强化学习 (RL) 或监督微调 (SFT) 环节,对 rollout 轨迹按比例注入用户 / 工具噪声,并采用 噪声调度 (Noise Scheduling) 逐步提升难度。
  • 对于 LLM-as-Agent 框架(如 LangChain、AutoGPT),可在仿真环境中劫持 Tool 返回结果,或对 User Prompt 进行扰动,生成带噪声的训练样本。
  • 部署后可结合 在线监控,当检测到环境噪声加剧时,回传噪声样本至数据湖,触发下一次模型迭代。

具体落地用例

  1. 电商智能导购 Agent:训练时,将“我想买一件适合跑步的透气上衣”随机替换为“跑步 透气 上衣”(省略噪声),同时将商品搜索 API 返回结果以一定概率置为空列表(工具噪声)。经 NoisyAgent 训练后,Agent 学会追问细节或尝试推荐相近品类,而非直接回复“未找到”,大幅降低对话中断率。
  2. 金融研报自动撰写 Agent:撰写报告需调用多个数据源(行情、财报、新闻)。训练时模拟 API 超时或返回脏数据(工具噪声),并模糊化“请分析该公司最近季度表现”为“看看上季度咋样”(用户噪声)。训练后的 Agent 能在数据缺失时主动使用缓存数据或注明数据源不可用,保障报告输出完整,避免人工重写。

局限

  • 论文承认的噪声类型仅涵盖**用户噪声**和**工具噪声**,但真实交互中还存在**环境延迟**、**动态分布偏移**、**多模态对抗干扰**等更复杂的扰动,当前框架可能无法覆盖。实验主要在封闭的模拟基准上进行,缺乏在开放域真实部署中的验证,噪声设置在多大程度上逼近实际场景仍未明确。此外,**噪声调度**依赖手动调节,最优策略可能随任务变化,欠缺自适应性。
  • 从方法设计看,噪声注入方式较简单(如随机修改指令、返回错误工具结果),尚未建模噪声间的依赖关系或时序相关性,可能无法捕捉真实世界**级联失败**模式。**混合训练**虽能缓解训练不稳定,但引入了额外超参数(噪声比例、难度增量),对调参敏感。对于某些**安全关键型任务**,引入错误的工具执行结果可能带来风险,训练时需谨慎设计回滚机制。
  • 与**鲁棒强化学习**、**领域随机化**等成熟范式相比,NoisyAgent 在思想层面的创新性有限,更多体现在将现有思路迁移到LLM Agent场景。实验未与**对抗训练**、**回放记忆增强**等强基线进行深度对比,也未分析噪声训练对模型**基础能力**(如推理一致性)的潜在负面影响,这限制了其对复杂agent系统设计的指导价值。
论文Yuxin Chen2026-05-26原文

相关内容