CAST: 面向可靠长程工具调用智能体的批判感知监督训练
大语言模型(LLM)智能体正越来越多地部署于长程、交互式且有状态的环境中。在此类场景下,单一错误动作(如退款错误商品)可能导致不可逆的任务失败,必须在执行前予以拦截。此类失败并非每次运行都会出现,却可能在重复试验中逐渐暴露,因此跨步骤与跨试验的可靠性至关重要。然而,确保智能体可靠性颇具挑战:即使前沿 LLM 也难以解释某个动作为何错误,尤其是在由领域特定策略约束的长而交织的轨迹中。近期工作多依赖基于提示的批判智能体,而基于优化的方法缺少系统化的途径来生成丰富的验证推理用于训练。 针对这一空白,我们提出 CAST,一种批判感知训练框架,将稀疏的任务结果转化为动作级监督,用于批判学习与策略优化。CAST 分析智能体轨迹,综合生成结构化推理,解释在部分可观测性下的动作有效性。由此得到的批判模型被用于构建批判感知训练数据,以优化策略模型。通过在动态工具调用基准上微调 Qwen3 系列模型,CAST 提升了各领域的可靠性,在零售任务上超过 GPT-OSS-120B 超过 10% 的 pass^4 指标,并在跨领域环境中于远程医疗任务上额外提升 9%。这些结果表明,批判感知训练能够提升 LLM 智能体在真实动态环境中的鲁棒性。
论文精读
TL;DR CAST 将稀疏任务结果转化为动作级 critique 监督,训练 critique 模型并优化策略,显著提升长程工具调用 Agent 在动态环境中的可靠性,超越 GPT-OSS-120B。
问题
问题背景
当前 LLM 智能体逐渐被部署到长程、交互式、有状态的工具调用环境中,例如客服退款、订单修改等。这类任务要求智能体连续执行多个动作,每个动作都依赖于之前的观察和状态变更。
现有方法局限
现有方案主要分为两类:
- 基于提示的批评智能体:依赖 LLM 自身对动作进行事后审查,但这类方法在长轨迹、部分可观测场景中表现不稳定。提示工程难以覆盖所有领域特定策略,且批评质量高度依赖模型预训练能力,无法针对具体环境进行优化。
- 基于优化的方法:如强化学习或监督微调,虽然能根据任务结果调整策略,但缺乏系统性方式从稀疏的最终成功/失败信号中提取动作级别的验证理由。这导致训练数据无法提供细粒度的批评监督,模型难以学到“为什么某个动作在特定状态下是错误”的深层知识。
为什么这个问题难且重要
- 技术挑战:长程任务中,一个错误动作(如错误退款)可能造成不可逆后果,且这类错误不一定在每次运行中都出现,而是跨多次试验才暴露。因此,可靠性必须同时体现在单步动作正确性和多试验一致性上。
- 核心难点:部分可观测环境下,判断动作有效性需要结合领域特定策略和整条轨迹的上下文。即使前沿 LLM 也难以明确解释动作为何错误,这阻碍了可靠的自我纠正和训练信号生成。
- 业界关注度:随着 LLM 智能体从演示走向生产,银行、电商、医疗等领域的容错率极低。业界迫切需要一种能系统性地将稀疏结果转化为动作级批评监督的训练框架,以提升长程可靠性。
行业类比
这类似于自动驾驶中的安全关键决策:系统必须在执行不可逆操作前,利用可靠的内在批评机制主动拦截潜在错误,而不是依赖事后的事故回溯。
核心洞察
- CAST 将稀疏的任务级结局转化为动作级结构化理由,为策略优化提供可验证的监督信号。此前 prompt-based 批判代理只能给出粗粒度反馈且难以系统优化;optimization-based 方法又缺乏生成细粒度验证理由的机制。CAST 通过分析轨迹并合成关于动作有效性的结构化解释(尤其在部分可观测环境下),直接填补了这一空缺,使细粒度可靠性训练成为可能。
- CAST 构建了一个「批判模型 + 策略模型」的联合训练闭环:批判模型从轨迹中学习生成动作级验证理由,再用这些理由构造批判感知的训练数据来优化策略模型。与独立使用外部批判器或仅做结果奖励的 actor-critic 变体不同,CAST 将批判能力内化为可训练组件,并在动态工具调用基准上验证了跨域鲁棒性——在 Retail 任务上超越 GPT-OSS-120B 超过 10 个百分点的 pass^4,且在未见过的 Telehealth 域额外提升 9%,表明这种闭环训练显著提升了长周期任务中的行动可靠性。
方法
输入与目标
CAST 接收 LLM agent 在长程、有状态工具调用环境中的完整轨迹,包括每一步的动作、观察以及最终的稀疏任务结果(成功或失败)。核心挑战在于稀疏结果难以反推出具体是哪一步动作导致失败,尤其在轨迹相互交织且部分可观测的条件下。
关键模块
- Agentic Verification:对轨迹进行反向分析,将稀疏结果转化为 动作级结构化 rationale。该模块在部分可观测下判断每个动作的 validity,生成自然语言解释,说明动作是否违反领域 policy、是否引发不可逆失败等。
- Critique Model Learning:以上述 rationale 作为监督信号,训练一个 critique model,使其能对任意给定轨迹生成动作级批评。训练目标是与标注 rationale 对齐,通常采用监督微调的方式。
- Critique-Aware Policy Optimization:利用训练好的 critique model 为策略模型构造训练数据。具体做法是:对 policy 采样产生的动作或轨迹,critique 给出质量评分与修正建议,据此构建偏好对或加权 SFT 数据,再对 policy model 进行优化,使其在训练中更加关注易错动作。
输出
最终得到两个模型:可靠的 critique model 与经过 critique-aware 优化后的 policy model。后者在动态工具调用 benchmark(如 τ-bench / τ-trait)上显著提升了 reliability 指标 pass^4。
与 prompt-based critique 方法不同,CAST 将验证 rationale 直接用于策略优化,而非仅作推理时参考;与 actor-critic 文本监督相比,CAST 系统化地从稀疏结果提炼动作级解释,缓解了部分可观测下的验证困难。
实验
实验设计
CAST 在动态工具调用基准 τ-bench(Retail 域)和 τ-trait(Telehealth 域)上微调 Qwen3 系列模型。框架首先生成动作级结构化理由训练 critique model,再利用 critique-aware 数据优化 policy model。评估指标为 pass^4,即连续四次试验全部成功的概率,直接衡量长时程代理的可靠性。
关键发现
- CAST 在 Retail 任务上
pass^4超过 GPT-OSS-120B 超过 10%。 - 在域外 Telehealth 设置下,CAST 额外获得 9% 的提升,显示跨域泛化能力。
- 微调后的模型在多次试验中保持稳定,说明动作级监督有效拦截了不可逆错误。
对比解读
相比纯提示式 critique agent,CAST 通过优化而非仅推理来注入验证能力,使得策略模型能内化动作合法性判断。在长时程、部分可观测环境下,GPT-OSS-120B 这类大模型可能因缺乏领域策略理解而犯错,而 CAST 显式学习结构化理由,使小模型(Qwen3)在特定工具调用任务上超越更大模型。这为工程实践提供了新思路:动作级验证监督的数据生成与训练是提升代理可靠性的可行路径,尤其适合需要策略合规且不可逆操作的场景。
行业影响
落地场景
长程工具调用代理是需要高可靠性的场景:电商售后、金融交易、医疗预约、企业服务台等。单步错误动作(错误退款、错误下单、错误修改处方)不可逆,且可能在多轮交互后才暴露。CAST 的 critique-aware training 将稀疏结果转化为动作级监督,适合训练此类系统中的 critique 模型 与 策略模型。
具体 use case:
- 电商售后机器人: 处理退款/换货,执行前由 critique 模型验证动作是否符合平台政策,拦截误操作。
- 医疗预约系统: 自动修改预约、发送提醒,错误操作可能影响病人健康,需在动作执行前给出结构化合理性判断。
商业价值
主要价值在降本与体验提升:
- 减少人工审核成本: 通过 critique 模型自动拦截高风险动作,避免人工事后补救;
- 提高自动化率: 在保证可靠性(如
pass^4指标)前提下,扩大代理可自动执行的任务范围; - 降低错误损失: 减少因误操作导致的退款、赔偿或合规风险,直接保护收入。
与现有产品/工作流接口
CAST 可作为现有 LLM agent 流水线中的 critique 模块 或对策略模型进行 critique-aware fine-tuning。集成方式:
- 将 CAST 训练的 critique 模型部署为工具调用前的 验证器,与现有工具调用中间件(如 LangChain、AutoGen)结合;
- 利用已有轨迹数据与稀疏结果标签生成 action-level rationales,无需额外人工标注,降低数据获取成本;
- 与 RAG、策略库等组件协同,在部分可观测环境下提供更可靠的决策支持。
局限
- CAST 的一个重要局限在于它依赖高质量的轨迹分析和结构化理由合成。在部分可观测、领域策略复杂的动态环境中,从稀疏任务结果推导行动级监督的准确性可能下降,导致批评模型产生噪声标签,进而影响策略优化的稳定性。论文实验仅涵盖 Qwen3 家族模型(如 Qwen3-8B),缺乏对更大规模模型(如 70B+)或其他开源/闭源架构的验证,跨域泛化也只在 Telehealth 一个任务上测试,说服力有限。此外,方法需要构建专门的验证数据,标注成本较高。
- CAST 的训练流程需先训练批评模型,再生成批评感知数据来微调策略模型,这增加了端到端训练时间和计算开销。在实际工程中,多阶段数据处理可能导致维护复杂度和错误累积。评估使用的 pass^4 指标要求四次独立重试才能判定成功,这在实时交互场景下会引入显著延迟,且批评模型在每一步决策时额外调用也会降低响应速度。对于需要低延迟、高吞吐量的生产环境,这种多次采样和批评推理的成本可能难以接受,限制了方法的直接部署可行性。
- 与既有工作相比,CAST 依然以预训练大模型的文本生成能力为基础,批评模型可能继承基础模型的幻觉、推理偏差或策略理解不完整等问题。尤其在训练数据未覆盖的策略拐角处,批评模型可能给出错误验证,导致策略模型盲目置信。论文未深入分析批评模型的错误模式和可解释性,缺乏对失败案例的系统诊断,使得工程师难以信任和调试系统。此外,相比纯提示型批评代理,CAST 虽能提升性能,但带来了额外的模型训练和部署负担,在轻量级或快速迭代场景下可能缺乏优势。