InSight-doc: 面向长文档理解的智能体视觉感知
长文档理解通常需要对大量视觉丰富的页面进行推理,导致推理成本高昂且易出现上下文退化(context rot)。为此,我们提出 InSight-doc,一种智能体视觉感知框架,将视觉分辨率视为自适应推理时资源。该框架从低分辨率开始,选择性放大高分辨率区域以获取更精细的证据,无需依赖任何外部检索器。 为训练该智能体,我们构建了包含 17.9K 高质量 SFT 示例的主动感知语料库,并配有区域级放大轨迹,同时提供 19.2K 困难 RL 示例。通过 SFT+RL 训练,InSight-doc-8B 在文档 VQA 基准上较基线提升 4.3–16.4 个准确率点。在长文档上,它减少了 40% 以上的幻觉,并将推理延迟降低 41%–68%,同时保持准确率优势。代码、数据集和模型已开源。
论文精读
TL;DR InSight-doc 把视觉分辨率当作自适应推理资源:低分辨率全局理解,按需局部放大关键区域,无需外部检索器;经 SFT+RL 训练后文档 VQA 提升 4.3–16.4 点,长文档幻觉减少超 40%,延迟降低 41–68%。
问题
问题背景
长文档理解(如多页财报、学术论文、扫描合同)要求模型在大量视觉富集页面上进行跨页推理,是当前多模态大模型(VLM)的核心能力之一。业界关注在有限上下文与算力预算下,如何维持高精度并降低推理成本。
现有方法局限
现有方案主要分为 端到端全分辨率输入 和 视觉检索式 两类,各有明显短板:
- 端到端全分辨率输入 将所有页面高分辨率编码后送入大模型,导致视觉 token 数量爆炸、GPU 显存占用高、延迟显著上升。更严重的是长序列下的 context rot——模型对中间页或靠后页的关键细节注意力衰减,产生幻觉或遗漏。
- 视觉检索式 依赖独立检索器先筛选页面或区域,但检索与推理模块分离,无法根据推理过程中的不确定性动态调整视角。固定粒度的检索经常遗漏细小但关键的视觉元素(如表格中的特定数字、图表异常点),且检索错误直接传导至生成阶段。
- 部分 粗到细(coarse-to-fine) 方法采用预定义的分辨率调度,但缺少面向推理目标的、可学习的视觉注意力分配策略。
为什么这个问题难 / 重要
技术挑战在于视觉信息分布极不均衡:关键证据常只占极小页面区域,而无关内容占据大量像素。推理过程中的信息需求是动态的,模型需要在“看向哪里”和“何时停止放大”之间做出序列决策,这与传统单步视觉编码范式有本质区别。同时,长文档自动化在合同审查、财报分析、文献综述等场景需求强烈,对推理延迟和成本高度敏感。因此,亟需一种能在保持精度前提下主动降低视觉冗余的 agentic 视觉感知 方案。
行业类比
类似 RAG(检索增强生成) 从一次性检索走向 迭代式 agentic retrieval——在生成过程中不断发起查询以补充信息。InSight-doc 将这种思想迁移到视觉感知层:让模型自主决定何时对哪个页面区域进行高分辨率放大,实现推理驱动的选择性观察。
核心洞察
- **将视觉分辨率视为推理时自适应资源**:InSight-doc 不依赖外部 retriever,而是让模型在低分辨率全局视图下自主决定对哪些区域执行 `region-level zoom-in`。这一做法区别于传统 coarse-to-fine 流水线——固定两阶段或由独立检索器选择区域,InSight-doc 把 zoom-in 决策嵌入同一个推理循环,通过 SFT+RL 端到端优化,更贴合长文档中证据分布稀疏且动态变化的特点。
- **用轨迹级主动感知语料训练 zoom-in 策略**:论文构建 17.9K SFT 样本和 19.2K RL 样本,每条都包含区域级缩放轨迹,而非仅最终答案。相较于只给问答对的方法,模型学会在高分辨率与 token 成本之间权衡,从而在长文档 VQA 上实现幻觉降低超 40% 且推理延迟减少 41%–68% 。这意味着分辨率分配本身可被学习,而不靠启发式或外部检索。
方法
输入与整体流程
InSight-doc 接收多页视觉丰富文档,以低分辨率全局视图作为初始输入。模型内部是一个 视觉感知代理,在推理循环中动态决定是否需要对特定区域执行 region-level zoom-in(区域级放大)。每次放大获取该区域高分辨率特征,作为附加证据融合进上下文,再进行下一轮推理,直到输出最终答案。
关键模块
- 自适应分辨率分配:将视觉分辨率视为可消耗的推理时资源,通过代理决策控制何时、何处放大,避免对所有页面统一高分辨率处理。
- 轨迹生成与训练数据:作者构建 主动感知语料,包含 17.9K 条 SFT 样本,每条带有专家生成的区域缩放轨迹(使用多模态 CoT 生成);另有 19.2K 条 RL 样本作为困难负例或调整信号。
- 两阶段训练:先使用 SFT 让模型模仿专家放大策略与推理路径,再通过强化学习(RL)在长文档任务上优化决策,降低幻觉与延迟。
输出
模型输出答案,可附带推理过程中的缩放位置与顺序。在评测中,InSight-doc-8B 在文档 VQA 上提升 4.3–16.4 个准确率点,长文档上幻觉降低 40% 以上,推理延迟降低 41%–68%。
与同类方法的差异点:相比依赖外部检索器或固定高分辨率输入的方案,InSight-doc 将区域放大作为模型自身可学习的动作,不引入外部检索模块,实现端到端的自适应视觉感知。
实验
实验设计
InSight-doc 采用 SFT+RL 训练流程,基于 17.9K 高质量 SFT 示例与 19.2K 困难 RL 示例,训练 agentic 视觉感知策略。评估覆盖 document VQA benchmarks 与 long-document 场景,对比 baseline 模型及 coarse-to-fine 方法,重点验证 agentic 分辨率分配对精度、幻觉与延迟的影响。
关键发现
- 准确率:InSight-doc-8B 在文档 VQA 上提升 4.3--16.4 个百分点。
- 幻觉:长文档场景幻觉减少超过 40%。
- 延迟:推理延迟降低 41%--68%,同时保持精度领先。
基线对比解读
InSight-doc 不依赖外部 retriever,将视觉分辨率视为推理期自适应资源,从低分辨率逐步 zoom-in 到高分辨率区域。相比固定高分辨率或检索式方法,它在降低 sequence length 与延迟的同时维持精度优势,有效缓解 context rot。该思路对工程实践的启示是:长文档 VLM 推理可按需分配视觉计算,而非全局高分辨率重编码。
行业影响
落地场景
InSight-doc 适用于需要从多页视觉丰富文档中提取证据的场景,例如金融研究中对数百页年报、招股书的图表与表格问答,以及企业合同审查中定位关键条款、比对印章与签名等。在电商领域,可支撑商品说明书、技术手册的交互式问答,帮助客服或买家快速获取参数细节;在医疗行业,能辅助解析病历、检查报告中的长文档影像。
商业价值
- 降本:自适应分辨率机制可削减 41%–68% 的推理延迟,并降低视觉 token 消耗,直接减少 GPU 成本与响应时间。
- 提质:在文档 VQA 基准上提升 4.3–16.4 个精度点,并将 hallucination 降低超过 40%,能提供更可靠的证据定位,减少人工复核成本。
- 体验:低延迟、高准确的文档理解能力适合嵌入实时交互产品,提升用户满意度与留存。
与现有工作流接口
InSight-doc 可作为视觉感知前端接入现有 RAG 或文档处理管线,替代“整页高分辨率 OCR + LLM”的粗放方案:先用低分辨率全局扫描,再由 agent 决策放大关键区域,输出结构化证据供后续生成模块使用。其训练数据与模型已开源,企业可基于 InSight-doc-8B 针对特定行业文档格式微调,或将区域缩放策略作为插件集成到 LangChain、LlamaIndex 等框架中。
局限
- **数据构建与训练成本高**。InSight-doc 需要大规模带有区域级 zoom-in 轨迹的 SFT 数据(17.9K 条)和专门设计的 RL 奖励信号(19.2K 条),数据生成依赖**高性能教师模型**(如 InSight-o3)或半自动流程,质量过滤与后处理步骤繁杂。这限制了方法在**新文档领域或语言上的快速迁移**,因为每次扩展都需要重新构建轨迹和调整 RL 环境,工程投入显著高于传统端到端或检索式方法。
- **低分辨率初始感知存在漏检风险**。虽然框架能在推理中动态分配分辨率,但初始阶段使用低分辨率输入,若关键证据只在高分辨率下可见(如极小字号、密集表格、图注细节),agent 可能因缺乏先验而**不主动放大对应区域**,导致错误传播。论文虽在 unanswerable questions 实验中展示了部分缓解效果,但未系统量化漏检率,且 agent 决策完全依赖当前上下文,缺少外部验证器或记忆机制来纠正错误缩放路径。
- **评测范围与泛化性有限**。实验主要基于 document VQA 和少量高分辨率 VQA 基准,文档类型偏学术论文和标准幻灯片,**未覆盖扫描质量差、多栏混排、多模态混排(如手写体 + 印刷体)等复杂真实场景**。此外,延迟降低与精度提升的结论基于 8B 模型和特定硬件配置,**未与更大规模模型或强检索增强方案进行全面对比**,开源代码尚未经过足够社区验证(GitHub stars=4),实际部署中的鲁棒性有待观察。