论文

DAR: 使用 Agentic Harnesses 的道义推理

DAR: 使用 Agentic Harnesses 的道义推理

道义推理 是通过将明确的规则和政策应用于具体事实来回答问题,例如根据法规计算税务责任或确定移民上诉结果。对于基于大型语言模型的道义推理,一个关键技术挑战是相关规则集可能冗长且相互引用,导致模型难以定位特定推理步骤所需的规则。 我们提出 Deontic Agentic Reasoning (DAR),一种代理性推理设置,其中模型按需与法规交互。我们在 DeonticBench 的困难子集上使用多种 harnesses 评估 DAR。结果表明,代理性 harnesses 可以推动道义推理任务的前沿,但改进并不均匀:较弱模型在数值任务上往往性能下降,同时消耗更多令牌。

论文精读

TL;DR DAR 通过智能体 harness 让 LLM 动态检索法规文本,解决长规则集下的义务推理难题,但性能提升因模型而异:强模型受益,弱模型在数值任务上退步且 token 消耗剧增。

问题

问题背景

LLM 在高风险规则推理领域(如税法、移民法、合规审查)的应用日益广泛,但要求模型严格遵循明确的规则文本(statutes),实现可解释、零幻觉的道义推理(deontic reasoning)

现有方法局限

标准做法是将完整规则集、案件事实和问题一次性塞入提示(direct prompting),让模型单次前向检索并应用相关规则。这一静态策略存在三方面硬伤:

  • 检索失效:规则集动辄数百页,大量条款通过交叉引用互相关联,模型无法精准定位当前推理步骤所需的特定定义或例外条款。
  • 上下文干扰:冗余信息充斥提示,分散注意力,导致关键规则被淹没。
  • 不可扩展:面对需要多步调用的复杂案件,模型缺乏与环境动态交互的机制,无法按需获取缺失信息。

为什么这个问题难且重要

  • 技术挑战:规则文本通常高度结构化、充满嵌套例外与数值计算,要求模型既具备长程依赖检索能力,又需精确执行符号推理。传统 LLM 容易产生沉默假设或幻觉,在税务计算等数值任务中尤其脆弱。
  • 业界关注度:自动化审计、法律研究和政策合规是价值数千亿美元的市场,对推理可靠性要求苛刻,错误可能导致法律或财务后果。因此,提升规则感知推理能力是推动 LLM 走向可信落地的关键瓶颈。

行业类比

就像 AI 编程助手不能仅凭记忆写代码,而需要实时查询 API 文档一样,法律科技中的模型也必须具备“按需查阅法典”的能力,才能避免张冠李戴的错误。

核心洞察

  • Agentic search 对长程规则推理的有效性高度依赖基座模型的指令遵循与推理能力,形成“阶梯式”收益分布。 与简单在 prompt 中塞入全部法规的做法相比,DAR 让模型按需检索相关条款,但实验显示只有强模型(如前沿闭源模型)能从这种交互中稳定获益;弱模型在数值密集型任务上反而退化,暴露出智能体工作流对模型自身能力的“放大”而非“补偿”特性。这为设计 agentic 系统提供了重要参考:工具调用的附加值存在显著的能力门槛,盲目引入检索可能增加 token 开销而无实际收益。
  • 将法律推理形式化为 agent 与法规的动态交互,更贴近人类律师的实际判案流程,但也引入了新的评估维度—检索精准度与推理延展性的平衡。 以往 DeonticBench 的评估假设模型一次性吸收所有规则,属于“封闭书”考试;DAR 则模拟“开卷”查阅,模型需要自主判断何时、何地检索哪些条款,这不仅考核推理能力,还测量其信息检索策略。这一范式转变对 AI 在高风险合规领域的部署有直接启示:系统不应被动接收长上下文,而应具备主动定位关键规则的能力,但当前开源模型在数值推理任务上的退化也显示,简单的 agentic harness 可能破坏原有的推理连贯性。

方法

输入与任务定义

义务推理(Deontic Reasoning)要求模型根据明确规则集(如税法、移民条例)与个案事实,回答合规性或计算性问题。传统设定将完整法规文本、案件事实及问题一次性输入模型,期望其直接检索并应用相关条款。然而,法规通常冗长且含大量交叉引用,单次处理的检索压力极大。

DAR 核心架构:按需交互的 Agentic 流水线

Deontic Agentic Reasoning (DAR) 将推理重构为 agent–法规交互过程:

  1. 触发机制:模型不再被动接收全部法规,而是在推理过程中自主决定何时需要查阅特定条款。触发信号可由内部推理(如 CoT 中标记“需要查阅”)或外部 harness 的规则(如当遇到未决的法律概念时自动检索)生成。
  2. 法规检索与交互:每次触发后,harness 调用检索函数(如基于关键词、节号或语义搜索)从法规库中获取相关片段,并将其注入模型的当前上下文。不同 harness(如 Terminus-KIRA、Claude Code、Codex CLI)提供不同风格的检索策略与上下文管理。
  3. 迭代推理:模型在获得新法规信息后继续推理,可多次触发检索,直到形成最终答案。这种“思考–检索–思考”循环将推理与信息获取解耦,允许模型逐步构造依据链。
  4. 答案生成:最终输出为给定案件下的义务判断或数值结果(如应缴税额)。

评估与关键发现

DeonticBench 的困难子集上,DAR 在前沿模型(如 GPT-4、Claude 系列)上显著超越单次推理,尤其在需要跨章节引用的场景中。但开源模型(如 Qwen)在相同 harness 下可能退化,尤其在数值计算任务中,因检索噪声和频繁上下文切换导致性能下降,同时消耗的 token 量成倍增加。这揭示了 agentic 收益的模型能力门槛

与同类工作的差异

不同于仅扩大上下文窗口或静态分块检索的方案,DAR 将 决策权部分交予模型,使其能动态、主动地寻求所需规则,从而更贴近人类法律推理的按需查阅过程。其核心创新在于通过 harness 设计将规则获取转化为可控的 agent 动作,而非被动的信息堆砌。

实验

实验设计

本文提出 Deontic Agentic Reasoning (DAR),一种让模型按需与法规文本交互的代理推理范式。基线为标准的 直接推理,即将整个规则集、案件事实与问题一次性注入提示。实验在 DeonticBench 的困难子集上进行,覆盖需要长程引用和复杂规则组合的题目。代理执行层(harness)选择了多种架构,包括 Claude CodeCodex CLITerminus-KIRA 等,并测试了多个前沿模型(如 GPT-4o、Claude)与开源模型(如 Qwen 系列)。

关键发现

  • 代理式 Harness 能够提升道义推理前沿模型的性能,但提升不均匀
  • 对于强模型,按需检索法规可获得一致增益;较弱模型在数值推理任务上反而退化,同时消耗更多令牌。
  • 不同 Harness 对模型的支持力度差异显著:Terminus-KIRA 对前沿模型最优,而 Claude Code 对开源 Qwen 模型提供了有效 scaffold。
  • 总体上,DAR 将模型从单次推理扩展为迭代搜索与规则组合,但推理成本(令牌量)显著增加。

与基线对比的解读

相较直接将完整规则集塞入提示的直接推理,DAR 允许模型选择性访问相关条款,缓解了长上下文迷航问题。前沿模型从这一环境受益,表明其具备利用工具进行自主检索的能力;而弱模型则可能因代理交互引入的决策分支而过拟合或分心,在需要精确计算的数值题上暴露不足。这提示代理框架设计需与模型能力匹配:强模型配灵活搜索,弱模型配更结构化的引导,否则反噬性能。未来工作需探究在不同难度与领域下,代理推理的性价比边界。

行业影响

落地场景

DAR 直接适用于任何需要依据长篇、交叉引用的法规文件进行自动化推理的场景,典型产品包括:

  • 法律科技:移民申请结果预测、合同条款合规性检查
  • 税务软件:复杂税法下的应纳税额计算,尤其涉及多条款依赖与例外处理的场景
  • 保险理赔:根据保单条款与当地监管规则自动计算赔付金额
  • 企业合规:自动比对内部政策与外部法规(如 GDPR、HIPAA)的差异

商业价值

传统方案依赖人工解读法规,流程慢、成本高且容易遗漏。DAR 通过让模型按需动态检索法规原文,可显著提升自动化水平:

  • 降本:减少人工审核投入,适用于大流量案件(如退税、小额理赔)的批量处理
  • 增效:缩短案件周转时间,提升系统吞吐,例如在移民服务机构中快速生成初步裁定建议
  • 体验提升:用户获得即时、可追溯的法规引用决策解释,增强结果可信度

与现有产品/工作流的接口

DAR 的代理式架构易于嵌入现有 AI 栈,无需重构全部流程:

  • 工具型集成:将法规检索封装为 function calling 工具,与目前主流的 LLM 应用框架(LangChain、Semantic Kernel)直接对接
  • RPA 增强:在 RPA 工作流中插入 DAR 模块,为自动化决策步骤提供法规依据输出
  • API 微服务:对外暴露推理端点,接受案例事实与法规库标识,返回结构化结果,与现有决策引擎并联运行

具体落地用例

  1. 全球电商平台的跨境税务计算 用户下单时,系统根据发货国、收货国及商品类别,动态检索对应税法文件,通过 DAR 实时计算增值税、关税等。代理模式可应对频繁更新的税率表与复杂的贸易协定交叉引用,相比静态规则引擎更灵活,降低人工维护成本。

  2. 金融科技反洗钱(AML)合规审查 在交易监控系统中,当检测到可疑行为时,调用 DAR 根据最新的《反洗钱法》及监管指引,自动比对交易模式与法规中的指标性条款,生成合规分析报告与建议处置等级。这减轻了合规官逐条查证法规的负担,并确保引用的规定总是最新版本。

局限

  • - **成本与效率局限**:论文发现,对于较弱模型(如开源模型),agentic harness 不仅未能提升性能,反而在数值类义务推理任务上导致准确率下降,同时 token 消耗量大幅增加;这直接限制了 DAR 在大规模实际部署中的成本效益与可扩展性,使其仅对前沿模型有显著增益。
  • - **评估覆盖面有限**:实验仅在 DeonticBench 的 hard subsets 上进行,基准数据集主要覆盖税法、移民等少数法规领域,且使用的 harness 种类较少(Claude Code、Codex CLI、Terminus-KIRA),无法全面反映真实世界中法规类型的多样性及不同 agentic 设计空间下的鲁棒性,泛化结论的可信度受限。
  • - **方法原创性不足**:DAR 本质上将现有的 agentic 搜索框架(如 Claude Code、Codex CLI)直接应用于义务推理,未提出新的搜索策略或交互机制;其贡献更多在于系统性的实证评估,且缺少与更轻量的检索增强方法(如 RAG)的对比,难以凸显 agentic 范式在义务推理任务上的独特优势。
论文Guangyao Dou2026-06-03原文

相关内容