评估受监管 agentic AI 中的有界自主性:一个集成宪法奖励、升级标签与运行时治理的诊断 harness
我们提出 RegLLM,一个面向受监管 agentic 工作流中有界自主性的诊断 harness。它测量六类可信度信号:引用有效性、来源支撑、schema 合规、升级正确性、宪法对齐与不安全动作率。这些信号按监督来源区分:程序化验证器、任务级 escalation 标签,或 AI 评审打分。一个确定性的 runtime supervisor 会阻断无依据回答并强制升级,同时记录干预。 同一份领域 constitution 同时作用于评估、训练奖励与服务端 guardrails。任务级 should-escalate 标签让「执行还是推迟」的决策成为可度量的训练信号。我们在 smoke 规模下演示该 harness:一次离线参考运行(n=12)在启用治理后,把 escalation recall 从 0 提升到 0.67,并把 不安全动作率 从 0.33 降到 0.08。 两个单卡 Qwen2.5-3B LoRA/DPO 试点(n=8,相同随机种子与评测划分)暴露出显著波动:名义上相同的 RL-base 配置,任务成功率为 0.25 对 0.12,escalation recall 为 1.0 对 0.5。答案质量 adapter 在 Run A 中把 recall 从 1.0 变为 0.5,但在 Run B 中从 0.5 变为 1.0;escalation-aware 变体在 Run B 中未带来可测变化。这些小规模试点不足以确立可靠的 adapter 效应或生产可用性;其贡献是诊断性的:配置方差可能压过调参带来的表面效应,因而需要更大的评测集与重复运行。
论文精读
TL;DR RegLLM 是一个诊断框架,用宪法奖励、任务级升级标签和运行时监督量化受监管 agent 的受限自主性,将该不该升级变成可训练信号;但其小规模实验发现配置方差可能盖过调优效果,警示需更大评测集。
问题
问题背景
受监管的智能体工作流(如金融合规、医疗文书处理)中,有界自主性已成为核心关切:系统需要在可审计的约束下自主执行高风险任务,同时把不可靠的决策升级给人类。业界对 agent 可信度的要求正在从“能完成任务”转向“可验证、可训练、可审计”。
现有方法局限
当前对 agent 可信度的评估往往依赖手工阈值或事后日志,缺乏系统性的诊断框架。主要问题包括:
- 监督信号来源未区分:引用有效性、来源接地、模式合规等信号的可信度来源不同(程序验证器、任务标签、AI 裁判),但现有工作通常混合处理,导致无法定位故障根因。
- act-versus-defer 决策不可训练:模型何时自主作答、何时升级人工,通常由固定规则决定,没有作为可优化的训练目标。
- 配置敏感性被掩盖:相同 RL 配置在小规模测试中可能产生显著不同的指标(如任务成功率 0.25 vs 0.12),但缺乏工具暴露这种方差,导致调优结论不可靠。
为什么这个问题难且重要
在受监管场景,一个错误答案可能意味着监管罚款、客户受损或漏掉义务。因此需要可验证奖励、任务级应升级标签和运行时治理,但将这些信号整合到统一框架中面临技术挑战:如何设计混合奖励以平衡宪法对齐与任务成功?如何在服务时用确定性监督器阻断不接地答案,同时保留必要自主性?业界对 AI 治理和审计的要求持续上升,需要可复现的诊断工具,而非单点指标报告。
行业类比
类似自动驾驶中的最小风险状态触发逻辑,或医疗 AI 的自动转诊决策:模型必须在信心不足时把控制权交回人类,而不是输出不可靠的结果。
核心洞察
- 将 act-versus-defer 决策本身转化为可验证训练信号,而不是依赖硬编码阈值。已有工作通常把升级判断当作推理后的置信度规则,或用规则拦截,但 RegLLM 引入任务级 should-escalate 标签和宪法奖励,使模型能在训练中直接学习何时行动、何时升级。这个角度独特在于把治理行为从后处理逻辑变为可优化的策略目标,从而让有界自主性可测量、可训练、可审计,避免了手工阈值在不同场景下失效的问题。
- 同一领域宪法作为单一工件同时驱动评估、训练奖励和运行时 guardrails,统一了规范来源。通常训练奖励、评估指标和服务拦截逻辑来自不同文档或代码,容易产生不一致甚至冲突。RegLLM 用一份宪法贯穿全流程,减少了规范漂移,提高了审计一致性。这使得合规代理的治理逻辑不再散落多处,而是收敛到一个可版本化、可审查的声明式规格上,为受监管 AI 的工程化落地提供了清晰路径。
- smoke-scale 实验的核心发现是配置方差主导了表面调优效果。两个名义上相同的 RL-base 配置在任务成功率和升级召回率上出现显著差异,且回答质量适配器在不同运行中产生相反方向的影响。这警示在极小样本下单个适配器的增益完全可能被随机性淹没。独特价值在于把诊断重点从“提升指标”转向“评估协议稳定性”,强调重复运行和更大评估集是判断任何治理机制真实效果的前提,对受监管场景尤其关键,因为不可复现的改进比没有改进更危险。
方法
RegLLM 以受监管的代理工作流中的用户查询、候选引用与源文档、以及领域宪法为输入;任务级 should-escalate 标签作为 ground truth 标注。
关键模块
- 六项信任信号:引用有效性、来源接地、模式合规、升级正确性、宪法对齐分数、不安全动作率。按监督来源分为三类:程序验证器(确定性检查)、任务级升级标签(可验证人工标注)、AI-judge 评分(模型判断)。
- 确定性运行时监管器:在服务阶段拦截未接地或无依据的回答,强制模型升级(escalate)而非直接回答,并记录每次干预日志,形成可审计轨迹。
- 混合奖励:软奖励项由宪法对齐度(constitutional-alignment score)计算,硬信号来自
should-escalate标签,使 act-versus-defer 决策成为可训练目标。 - 训练配置:使用 DPO 微调 Qwen2.5-3B LoRA 适配器,两个 pilot run 采用相同 seed 和 eval split 以观察方差。
输出
输出诊断指标:任务成功率、升级召回率、不安全动作率等,以及监管器干预日志,用于量化有界自主性(bounded autonomy)的表现。
跟同类方法的差异点:与依赖手工阈值的传统护栏不同,RegLLM 将 act-versus-defer 决策本身转化为可验证训练信号,并通过共享宪法统一评估、训练与服务环节。
实验
实验设计
RegLLM 在 smoke-scale 规模验证:离线参考 n=12 用弱基线 agent,对比启用/不启用 确定性运行时监督器(强制阻断未 grounded 回答并升级)。监督器将 escalation recall 从 0 提升到 0.67,unsafe-action rate 从 0.33 降至 0.08。两个单 GPU pilots(n=8,同 seed 同 eval split)用 Qwen2.5-3B LoRA/DPO 训练 agent,评估同一循环。配置相同但结果分化:task success 0.25 vs 0.12,escalation recall 1.0 vs 0.5;answer-quality adapter 在 Run A 将 recall 降到 0.5,在 Run B 却提升到 1.0;escalation-aware variant 在 Run B 无变化。
关键发现
- 方差是主要发现:名义上相同的 RL-base 配置两次运行产生显著不同的指标,小样本下 adapter 效果方向不稳定。
- 运行时治理有效:离线参考显示,无需训练即可通过强制升级和阻断提升安全指标。
- 训练信号可测量:task-level should-escalate labels 让 act-versus-defer 决策成为可验证训练目标,但当前规模无法证明 DPO 训练收益。
与基线的深度解读
离线参考的基线是无治理的弱 agent,治理后安全指标改善明显,说明 运行时 guardrails 比训练优化更直接。训练 pilots 的基线是相同配置的不同运行,差异表明 评估方差 可能掩盖调优效果。对实际工程的启示:在合规等高风险场景,优先部署确定性的运行时约束,而非依赖小样本 RL 微调;若需训练,应扩大评估集并多次重复,否则配置差异会误导调优决策。
行业影响
落地场景
该 harness 主要面向受监管的 agentic 工作流,如金融合规、医疗辅助、合同审核等。一个具体场景是电商平台商品合规 agent:自动审查商品描述是否违反平台规则(如夸大宣传、违禁词),当置信度低时升级人工,并将升级决策作为训练信号。另一场景是金融 KYC/AML 监控 agent:自动核验客户资料、标记可疑交易,运行时强制升级高风险案例,避免误放行。
商业价值
- 降低风险成本:论文中运行时治理将
unsafe-action rate从 0.33 降至 0.08,直接减少合规罚款与客户损失。 - 优化人机协作:task-level
should-escalatelabels 使“是否升级”可训练,提升escalation recall的同时避免过度升级,降低人工审核成本。 - 审计可追溯:deterministic
runtime supervisor记录每次干预,满足监管审计要求,减少解释与法务成本。
与现有 stack 集成
可将 RegLLM 作为运行时中间件接入现有 LLM agent 推理路径:通过 domain constitution 定义领域规则,在输出生成后由 runtime supervisor 拦截不合规答案并强制升级。训练侧复用同一 constitution 生成 DPO/RL 奖励,使模型对齐治理目标;评估侧使用相同 trustworthiness signals 持续监测配置漂移。该方案与 LangChain、LlamaIndex 等 agent 框架兼容,可作为独立 guardrail 模块部署。
局限
- **样本规模与统计效力不足**。论文明确将实验定位为 smoke-scale:离线参考运行仅 n=12,两个 GPU pilot 各 n=8,且作者在 Discussion 中强调这些小规模 pilot 不能建立可靠的 adapter 效应或生产就绪性。配置方差(不同 run 之间 task success 0.25 vs 0.12,escalation recall 1.0 vs 0.5)主导了表面上的调整效果,说明当前证据不足以支撑任何关于 bounded-autonomy 指标稳健改进的结论。这限制了该方法在真实受监管 agentic 系统中的可推广性,需要更大评估集和多次重复运行才能验证。
- **模型与评估覆盖面的局限性**。仅使用 Qwen2.5-3B 这类小参数模型进行 LoRA/DPO 微调,未探索更大规模或不同架构的模型;六个 trustworthiness signals 中的 AI-judge score 依赖于 LLM 自身判断,可能引入系统性偏差,且缺少人工评估基线来校准。程序化验证器虽然确定性强,但只能覆盖封闭域、结构化程度高的任务(如引文格式、模式合规),难以扩展到语义模糊或开放域的合规场景,限制该 harness 作为通用诊断工具的适用性。
- **与已有框架相比创新有限**。RegLLM 的核心组件——宪法驱动奖励、运行时 supervisor、升级标签——分别借鉴了 Constitutional AI、RLHF、agent guardrails 等领域已有思想,贡献主要在于将它们集成到一个可审计的诊断框架中,而非提出新的算法或理论。论文未与现有 Constitutional AI 或安全护栏框架进行系统 benchmark,也未展示在真实金融合规任务上的对比结果,因此相对优势尚不清晰,更接近渐进式工程整合而非突破性方法。