面向可验证多模态深度研究:用于交错报告生成的多智能体框架 Ptah
大型语言模型 (LLMs) 推动了自主智能体从深度搜索 (deep search,检索简洁事实答案) 向深度研究 (deep research,将分散证据综合成长篇报告) 的演进。然而,可验证的多模态深度研究仍面临挑战:开放性综合缺乏确定性真值,且需要将文本论证与视觉证据交错呈现。 我们提出 Ptah,一个用于交错报告生成的多智能体框架。Ptah 通过规划、研究和撰写三个阶段协调从用户查询到渲染网页报告的完整生命周期。其中,专门智能体构建视觉感知计划、收集基于主张的 (claim-grounded) 证据、在 Visual Working Memory 中维护与来源对齐的图像,并通过声明式多模态工具使用撰写报告。验证器智能体 作为框架的接受函数,在整个工作流中强制执行事实基础、引用忠实性和跨模态一致性。 我们进一步引入 PtahEval 评估协议,在现有基准上增加图像级别和呈现级别评估。在深度研究基准上的实验表明,与强基线相比,Ptah 能生成更可靠、视觉信息更丰富且面向用户可用的多模态报告。
论文精读
TL;DR Ptah 通过多智能体协同与验证器,在规划、研究、写作阶段植入事实核查与图文一致性约束,生成可靠、可引证的多模态深度研究报告。
问题
问题背景
从 deep search 到 deep research ,LLM 智能体正从简短事实检索转向长篇幅、多源信息的综合报告生成。业界日益关注如何自动产出面向人类的、图文并茂的深度研究报告(如市场分析、技术综述),其中文本论证与视觉证据需有机交错呈现,且报告内容必须可验证——每一条断言都有可追溯的引用支撑。
现有方法局限
当前主流的检索增强生成(RAG)或搜索智能体大多输出纯文本,即便穿插图片也仅作为装饰或链接,缺乏图文逻辑关联。更关键的是,现有系统普遍缺少跨模态校验机制:
- 文本生成的引用可能出现幻觉,与原始来源脱节;
- 图像选择常与论点无关,甚至误导;
- 没有机制保证“一段文字对应一张图”的一致性,导致报告可信度低。
技术挑战与重要性
多模态深度研究的核心难点在于:
- 开放域合成无确定性真值——报告的好坏没有单一参考标准,评估只能依赖多维度的质量指标;
- 跨模态一致性——文本论述、引用、图像必须相互对齐,任何不一致都会损害可信度;
- 工程复杂性——需要规划、搜索、写作多阶段协同,且每个阶段都要引入验证闭环。 这一问题对于金融、科研、医疗等高风险领域尤为关键,因为错误的信息或误导的图表可能导致错误决策。
行业类比
这类似于要求 AI 自动生成一份附带准确图表与参考文献的行业研报,且每张图表与每条论断都可一键溯源至原始出处,杜绝“看图说话”式的幻觉。
核心洞察
- 将验证代理(Verifier Agent)作为多智能体框架的“接受函数”,在规划、研究和写作三个阶段持续检查事实依据、引用准确性和图文一致性,使得长式多模态报告生成首次具备端到端的可验证性。这与以往仅依赖最终输出进行后验评分或仅关注文本一致性的方法形成根本差异,Ptah 将验证内化为工作流的核心组件,显著提升了可信度。
- 视觉工作记忆(Visual Working Memory)和声明式多模态工具的使用,让图像证据在生成过程中保持与文本声明严格的来源对齐,图像不再是事后插入的装饰,而是与文字同等对待的一等公民。这种方式区别于简单地检索图片并镶入报告的基线,确保了视觉信息的可靠性,并产生更富信息量的报告,对工程实践中构建可审计的多模态生成系统具有直接启示。
方法
Ptah 是一个多智能体系统,旨在生成立即可验证、视觉信息丰富的多模态深度研究报告。 输入为用户自然语言查询,输出为可渲染的网页报告。其核心架构分为三个有序阶段:规划、研究与写作,并由一个跨阶段验证智能体全程监督。
规划阶段:基于查询,规划智能体构建视觉感知研究计划,明确需要收集的证据类型及潜在的信息来源,初始化研究状态。
研究阶段:多个研究智能体并行检索并收集事实声明。关键创新是 Visual Working Memory (VWM,视觉工作记忆),它存储与文本声明对齐的图像,确保每张图像都附有源信息及引用编号,实现图文证据的联合追踪。
写作阶段:写作智能体采用声明式多模态工具调用,根据研究状态和 VWM 中的证据,交错生成文本论点和视觉图证,自动嵌入图像并添加引用标记。该阶段支持测试时扩展 (Test-Time Scaling,推理时间扩展),通过增加计算资源提升报告质量。
验证智能体作为贯穿所有阶段的 "验收函数",在每个步骤后自动执行三项检查:事实基础验证(声明是否有依据)、引用保真度检查(引用是否准确指向来源)、跨模态一致性审核(图像与文本是否匹配)。任何未通过验证的中间产物将被退回修正,形成闭环。
与现有深度研究方法相比,Ptah 的差异在于首次将多模态交织报告生成与形式化验证机制结合,通过专用的视觉工作记忆和测试时扩展,实现图文协同推理与可追溯的事实支撑。
实验
实验设计
在 DeepResearch Bench 和 DeepConsult 两个深度研究数据集上进行评估,覆盖多领域开放查询。引入 PtahEval 协议,增加图像内容质量与跨模态呈现质量评估维度。基线包括 GPT-4o、Claude 等强多模型代理系统。除自动指标外,还进行了用户面向的人工评估,并设计消融实验验证验证器代理与测试时缩放的效果。
关键发现
Ptah 生成的报告在事实可靠性、视觉信息量和可用性上显著超过基线。验证器代理有效抑制了幻觉与引用错误,跨模态一致性大幅提升。测试时缩放(增加写作阶段的迭代次数)可进一步改善图文交织的连贯性。消融显示,移除视觉工作记忆或验证器会导致图像与论点脱节、引用失信。
基线对比解读
相比仅依赖单次生成或简单检索拼接的基线,Ptah 的多阶段多代理流水线实现了从计划到渲染的全链路验证。其显式维护的 Visual Working Memory 确保了图像与声明始终对齐,避免了现有方法中常见的“图不对文”现象。然而,系统复杂度的引入也带来效率折衷,尤其在大规模部署时需权衡验证成本与输出质量。
行业影响
落地场景
Ptah 可直接嵌入需要生成图文交织、证据可追溯的长篇报告的产品与业务。典型场景包括:
- 企业知识管理与竞争情报:自动生成技术趋势报告、竞品分析,图表与文字均附原始来源链接,降低分析师手工整理成本。
- 内容平台与新闻自动化:为深度报道、财经摘要、科技评测生成带数据图表和引用链接的初稿,编辑只需审核而非从零撰写。
- 金融与咨询行业:快速产出行业研究报告、ESG 分析,确保每个主张都可回溯到底层数据,满足合规与审计需求。
- 教育与科研辅助:为学习者自动构建图文并茂的综述材料,每张图、每个论点均关联原始论文或数据集,提升自学效率。
商业价值
- 降本增效:将长报告的生产从数天压缩至分钟级,释放人力去处理更高价值的分析;多智能体并行证据收集与验证减少反复修改的成本。
- 体验与信任提升:Visual Working Memory 与 Verifier Agent 保证图文一致性和引证忠实度,用户可一键溯源,增强对AI输出的信心,降低事实错误引发的品牌风险。
- 增收机会:对咨询公司、媒体平台而言,可规模化提供定制化深度报告服务,开辟新的订阅或按次付费模式。
与现有产品/工作流的接口
Ptah 设计为多智能体总线,可以工具/API形式集成到现有Stack:
- 对接内部知识库与检索系统:通过插件化的工具接口,将 Research Agent 连接到企业自己的 Elasticsearch、Snowflake 或向量数据库,复用已有数据资产。
- 嵌入内容生产流水线:作为CI/CD for content的一环,输出带标注的Markdown/HTML,直接导入CMS或协作平台,与人工审校工作流无缝衔接。
- 与现有LLM网关组合:Planning、Writing等Agent可替换为不同基座模型,通过统一调度层融入现有模型治理框架,避免重复建设。
具体落地用例
- 电商商品深度评测:一家全球电商平台用 Ptah 根据用户搜索词自动生成多款商品的对比报告,每项参数(如续航、屏幕)附测试截图和数据来源,增加购买转化率同时减少退货。
- 金融服务自动化研报:某资产管理公司接入 Ptah,输入“2025年全球半导体供应链风险”,系统从内部投研库和公开财报中抓取信息,生成包含产业分布图、财务表格和引述的分析初稿,分析师仅需校验和添加投资结论,将研报产出周期从5天缩短到半天。
局限
- **验证可靠性受限于评估协议与底层 LLM 能力**。Ptah 通过 **Verifier Agent** 执行事实核查、引用一致性与跨模态一致性检查,但该 agent 本身仍基于 LLM 推理,无法保证生成报告的绝对准确性,尤其是在知识密集型、需要专业经验判别的领域。此外,**PtahEval** 虽从图像质量和多模态呈现两个维度扩展了评估,但其评分仍依赖 LLM 判别,缺乏客观真值对比,对幻觉或误导性视觉信息的检测能力有限。
- **系统复杂度与计算开销偏高**,实际部署门槛较高。Ptah 涉及 **Planner、Researcher、Writer、Verifier 等多个 agent**,以及并行证据收集、**Visual Working Memory** 等模块,整套流程需多次调用 LLM 与检索工具,推理成本显著高于单次生成式基线。论文未提供详细的延迟与费用分析,在实时或大规模应用场景下的可行性存疑。
- **实验覆盖领域较窄,泛化性未充分验证**。所用数据集 **DeepResearchBench** 和 **DeepConsult** 主要围绕维基百科类知识与通用 web 报告生成,缺乏对金融、医疗、法律等高风险、高专业性领域的评测。此外,虽然系统支持图像证据,但从案例来看,图像多为网页快照或示意性图表,对复杂科学图表、数理可视化等多模态信息的生成与对齐能力尚不明确。