论文

Omni-Decision: 证据账本规划的多模态智能体

Omni-Decision: 证据账本规划的多模态智能体

Omni-Decision 是一个面向全模态智能体的规划框架,其核心思路是证据账本式规划(evidence-ledger planning)。 问题: 全模态智能体需要在视频、音频、网页与计算等多种来源中寻找证据。其瓶颈在于规划:嘈杂的多模态观测不断累积进对话历史,干扰后续决策;而多模态模型本身的多步规划能力有限。控制变量式的后端替换实验支持这一诊断——替换规划器造成的性能损失远大于替换感知后端。 方法: Omni-Decision 用显式的证据账本取代不断增长的对话历史,账本记录尚缺哪些证据、已确认哪些内容、以及哪些记录存在冲突。一个 critic 读取每个嘈杂观测,只把可用内容写入账本,其余丢弃,使规划器在整个任务中始终在紧凑上下文中工作。每次运行都记录每一步的状态、动作与判定(verdict),并基于这些轨迹做监督微调与决策级强化学习,进一步提升规划器。 结果: Omni-Decision 在 OmniGAIA 上取得 81.4% 的准确率(当前最佳),单题成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解上达到 65.0% ,与最强的端到端模型持平。

论文精读

TL;DR Omni-Decision 用显式证据账本替代不断增长的对话历史,由 critic 过滤噪声后仅保留有用证据,让全模态智能体规划器在紧凑上下文工作;在 OmniGAIA 上以约 43% 成本达到 81.4% SOTA,WorldSense 65.0% 持平最强端到端模型。

问题

问题背景

多模态智能体正在从封闭式感知理解转向开放环境下的证据搜寻式问答,需要跨视频、音频、网页和计算等多源异构数据主动收集证据。

现有方法局限

现有智能体普遍将每步多模态观察直接追加到对话历史,导致上下文快速膨胀并混入噪声;多模态模型的多步规划能力有限,长上下文中的无关信息会干扰后续决策。作者通过后端替换实验发现:替换感知后端带来的性能损失远小于替换规划器,表明瓶颈在规划而非感知。具体表现为:缺乏对证据状态的显式建模,无法区分“已确认”“缺失”“冲突”等状态,导致重复检索或错误终止;同时,噪声观测未经过滤直接参与决策,降低了规划的稳定性。

为什么难/重要

技术上,证据状态是跨步骤动态累积的,需要结构化记忆与噪声过滤机制;多模态观测的噪声率远高于纯文本,且上下文预算有限,必须在信息保真与长度控制之间权衡。业界关注点在于多模态智能体在真实任务中的可靠性与成本效率,Omni-Decision 在 OmniGAIA 上以约 43% 的成本达到 81.4% 准确率,验证了规划优化的价值。

行业类比

类比 RAG 系统中用结构化查询状态替代无脑追加检索结果,将“证据链管理”引入智能体规划。

核心洞察

  • 将证据账本作为显式任务状态,替代不断增长的多模态对话历史,从根源上缓解了智能体后续规划被噪声观察干扰的问题。与现有依赖长上下文窗口或简单记忆摘要的做法不同,Omni-Decision 的账本只记录缺失证据、已确认事实和冲突项,并由 critic 对每条观察进行筛选,只保留可用内容。这种结构化状态使规划器始终在紧凑且高信噪比的上下文中工作,同时保留冲突信息以支持审慎决策,是规划瓶颈下的一种工程化解耦。
  • 在决策层面而非感知层面训练规划器:通过记录每一步的状态、动作与裁决,构建轨迹并用 SFT 和 closure-aligned RL 优化规划策略。其独特性来自论文先通过后端替换实验证明规划器是主要性能瓶颈,再针对性地对规划器做决策级强化学习,而非普遍微调多模态感知模型。这种训练配方与账本状态配合,使模型学会何时关闭证据收集、如何化解冲突,最终在 OmniGAIA 上以约 43% 的 Gemini-3.1-Pro 成本取得 81.4% 的 SOTA 精度。

方法

Omni-Decision 的核心思路是用显式证据账本替代不断增长的对话历史,将多模态智能体的规划过程从原始噪声中解耦。整体流程为:多模态问题输入 → 感知后端处理观察 → Critic 去噪 → 证据账本更新 → 规划器决策 → 执行动作 → 循环直至给出最终答案。

输入与初始化

  • 输入:用户提出的跨模态问答任务,涉及视频、音频、网页、计算等多种证据来源。
  • 系统初始化一个任务域证据账本,初始为空或只含问题描述。

关键模块

  1. 证据账本 (Evidence Ledger)

    • 结构化管理三类信息:缺失证据(还需查找什么)、已确认证据(已核实的内容及其来源)、冲突记录(不同来源互相矛盾之处)。
    • 账本始终保持紧凑,读取时只取当前任务相关的切片,避免上下文无限膨胀。
  2. Critic(去噪器)

    • 对感知后端返回的原始多模态观察进行过滤,只将可用内容写入账本,丢弃噪声片段。
    • 可视为一个轻量级的观察质量评估器,降低后续规划器被干扰的风险。
  3. 规划器 (Planner)

    • 基于当前账本状态决定下一步动作(如调用哪个工具、查询哪个视频片段、打开哪个网页)。
    • 工作上下文固定且精简,因此比直接使用完整对话历史的多模态模型有更强的多步规划能力。
  4. 执行与回路

    • 每个步骤都会记录 state(账本状态)、action(规划器决策)、verdict(该步骤结果量化评估)。
    • 这些三元组形成轨迹,用于后续训练。

输出与训练

  • 输出:通过多次迭代后,规划器给出最终答案,并附带证据链。
  • 训练配方:
    1. 状态级监督微调 (state-SFT):教规划器根据账本状态生成正确动作。
    2. 决策级强化学习 (closure-aligned RL):使用轨迹中的 verdict 作为奖励信号,优化规划器在任务闭环中的长期决策质量,而非单个动作的即时正确性。

与同类工作的差异点:Omni-Decision 把“规划上下文”从原始对话历史显式抽象为证据账本,并引入独立的 Critic 模块对观察进行去噪,使规划器只面对结构化、与任务直接相关的信息,从而在相同多模态后端下显著提升规划稳定性。

实验

实验设计

在 OmniGAIA 和 WorldSense 两个基准上评估 Omni-Decision。通过控制变量后端替换实验,对比替换规划器与替换感知后端对性能的影响,验证规划瓶颈假设。执行状态消融,比较有无 evidence ledger 的效果。训练流程基于 agent 轨迹进行监督微调(SFT)和决策级强化学习(RL)。

关键发现

Omni-Decision 在 OmniGAIA 上取得 81.4% 准确率,成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解上达到 65.0%,与最强端到端模型持平。后端替换实验显示,替换规划器造成的性能损失远大于替换感知后端,证实多步规划是 omni-modal agent 的主要瓶颈。

与基线对比深度解读

与 Gemini-3.1-Pro 相比,Omni-Decision 以显著更低的成本实现了更高精度,说明显式证据账本与紧凑规划上下文能有效提升效率。WorldSense 结果达到端到端模型水平,表明 agent 训练范式可以弥补与专用模型的差距,而无需依赖更大规模端到端预训练。该工作强调了在 omni-modal agent 架构中,规划组件的设计与优化优于单纯提升感知能力。

行业影响

落地场景

Omni-Decision 的证据账本规划适合需要跨模态取证的多步推理任务。例如:

  • 电商合规审核:商品上架需核验视频演示、详情页图片、检测报告等,现有 RAG/对话式代理容易在长上下文累积噪声,导致漏检关键证据。证据账本显式跟踪“缺失/已确认/冲突”,提升审核准确率。
  • 内容平台长视频理解:自动生成标签、亮点摘要或风险片段定位,WorldSense 65.0% 表明可对标最强端到端模型,但成本更低。

商业价值

  • 降本:OmniGAIA 上成本约为 Gemini-3.1-Pro 的 43%,token 使用更高效;critic 过滤噪声后,planner 输入更短,推理延迟和费用下降。
  • 增收/体验:准确率 81.4% 达到 SOTA,可进入高价值场景(如金融研报多源核验、医疗多模态辅助决策),减少人工复核,提升自动化水平。

与现有产品/工作流的接口

可直接嵌入主流 agent 框架(LangGraph、AutoGen、CrewAI)中的 planner 与 memory 模块:

  • 证据账本 作为结构化 state 存储,替换 conversation history 或 vector memory 的部分职责。
  • critic 可作为独立的 observation filter 节点,连接任意多模态感知后端(GPT-4o、Gemini、Qwen-VL 等),无需更换模型。
  • 训练轨迹(state-action-verdict)可用于企业私有数据的 SFT 与 RL 微调,适配特定业务术语和证据规则。

无需改动现有工具调用协议,只需将 Omni-Decision 的决策循环封装为服务,供业务编排层调用。

局限

  • **证据账本依赖 critic 过滤质量**:账本只记录 critic 认为“可用”的内容,但 critic 本身是多模态模型,在噪声大或证据模糊时可能误过滤关键线索或错误保留冗余信息。论文未充分讨论 critic 失效时的鲁棒性,且一旦错误写入账本,后续 planner 难以回到原始观察进行纠正,与完整对话历史相比存在信息丢失风险。
  • **实验覆盖范围有限**:仅在 OmniGAIA 和 WorldSense 两个基准上验证,OmniGAIA 侧重问答式证据搜寻,WorldSense 侧重长视频理解,未涉及更广泛的 agentic 任务(如开放式交互、多轮工具编排、真实世界检索)。成本对比只与 Gemini-3.1-Pro 单模型比较,未与开源多模态 agent 框架(如基于 LLaVA 或 InternVL 的方案)全面对照,SOTA 结论的泛化性待验证。
  • **训练数据自举可能引入分布偏差**:方法用自身运行轨迹做 SFT 和决策级 RL,轨迹高度依赖当前工具集和后端配置,可能导致 planner 过度适应特定 API 与任务分布,换到新工具或未见环境后性能下降。RL 采用规则化 rubric reward,可能鼓励表面正确的答案格式而非深层推理,且论文未披露训练算力与数据规模,实际落地时训练成本可能抵消推理成本优势。
论文Ming Ma2026-09-24原文

相关内容