论文

FocusVTC:高效高性能的自适应分辨率视觉文本压缩

FocusVTC:高效高性能的自适应分辨率视觉文本压缩

长上下文推理 在大型语言模型中会带来巨大的计算与内存开销。视觉文本压缩(VTC)通过将文本渲染为图像来缩短输入长度,但固定分辨率渲染会造成压缩率与性能之间的权衡:低 DPI 节省 token 却牺牲可读性,高 DPI 则在无关内容上浪费 token。FocusVTC 通过自适应分辨率打破这一权衡,同时保留通用多模态能力:它结合压缩后的低 DPI 全局视图与选择性区域增强,并将增强视图融入正在进行的推理过程。 为支撑该机制,作者构建了 29.4K 条高质量的 Reasoning-Evidence Localization(REL) 思维链样本(REL-CoT),将推理轨迹与页面索引和边界框关联起来。多分辨率 REL 监督微调(REL-SFT)教会模型定位相关区域,而 Group Relative Policy Optimization 则学习何时提升分辨率以及如何使用由此获得的观测,且无需单独的持续预训练阶段。 在 RULER v1 上以 72 DPI 运行时,FocusVTC 在包含工具观测的 2.9 倍输入压缩下取得 87.4 分,而 Glyph 在 3.0 倍压缩下仅为 57.5 分。它在 LongBench 上超越其文本输入骨干(56.40 对 55.86),将 MRCR 宏平均提升 13.91 点,并在 VTCBench 上取得 51.19 的宏平均成绩。MRCR 延迟评测还显示相对纯文本有 2.79 倍 的在线端到端加速。通用多模态能力同样得以保留,MMMU 从 65.12 提升至 66.73,MME 从 2424.02 提升至 2457.62。

论文精读

TL;DR FocusVTC 通过自适应分辨率视觉文本压缩,结合低 DPI 全局视图与关键区域增强,在推理中动态定位证据,以 2.9 倍输入压缩在 RULER 上达 87.4,超越文本输入基线,同时保留多模态能力。

问题

问题背景

长上下文推理在 LLM 中带来显著计算与内存开销,视觉文本压缩(Visual Text Compression, VTC)通过将文本渲染为图像来缩短输入 token 数,正成为提升长上下文效率的可行路线。

现有方法局限

当前 VTC 普遍采用固定分辨率渲染,形成压缩与性能的硬性权衡:

  • 低 DPI(如 72 DPI)可减少视觉 token,但文字可读性下降,导致关键信息丢失;
  • 高 DPI 虽保留细节,却把大量 token 消耗在无关背景或空白区域,压缩收益被稀释。

此外,固定分辨率无法根据查询需求动态聚焦证据位置,模型缺乏“何时放大、放大何处”的决策能力。

为什么这个问题难/重要

要打破该权衡,模型需在推理过程中主动定位相关区域、决策是否调用高分辨率增强视图,并融合多分辨率观察结果。这涉及细粒度视觉定位与长期决策优化的双重挑战:一方面需要大量带有推理轨迹与边界框标注的数据来教会模型定位;另一方面需用 RL 优化分辨率调用策略,同时避免破坏通用多模态能力。业界对长上下文推理效率高度关注,压缩率与精度兼得的方法直接影响部署成本与吞吐。

行业类比

类似自适应视频编码中的感兴趣区域(ROI)编码:对关键区域分配更多码率,对背景降低码率,从而在相同带宽下提升主观质量。FocusVTC 在文本压缩场景做的是同一件事。

核心洞察

  • 自适应分辨率机制打破了视觉文本压缩中固定 DPI 的性能与压缩率矛盾。FocusVTC 将低 DPI 全局视图与选择性区域增强结合,把 token 预算从均匀分配变为按需投入,在相同压缩率下显著提升长上下文推理精度。与 Glyph 等固定分辨率 VTC 相比,FocusVTC 在 RULER v1 上以 2.9x 压缩达到 87.4 分,而 Glyph 在 3.0x 压缩仅 57.5 分,证明 token 分配策略比单纯提高 DPI 更有效。工程上类似 ROI 编码思想,将视觉压缩从整体缩放升级为内容感知的局部增强,为超长文本的多模态处理提供了新的算力优化路径。
  • 训练策略无需独立持续预训练阶段即可获得视觉定位与自适应决策能力。FocusVTC 通过 29.4K 条 REL-CoT 数据将推理轨迹与页码、边界框显式关联,用 REL-SFT 让模型学会定位关键区域,再用 GRPO 优化何时增强分辨率及如何利用增强观察。与以往需大规模多模态持续预训练的 VTC 方法不同,该流程直接利用指令微调与强化学习完成视觉定位和策略学习,大幅降低数据与算力门槛。同时 MRCR 延迟评估显示在线端到端提速 2.79 倍,且 MMMU、MME 等通用多模态指标不降反升,说明该训练策略在提升效率的同时保住了通用能力,适合快速迭代部署。

方法

输入与总体流程

FocusVTC 接收长文本,将其渲染为低 DPI 图像作为 全局视图,在推理过程中根据模型自己的决策对局部区域进行 选择性高分辨率增强,并把增强视图注入当前推理上下文。这一自适应分辨率机制打破固定 DPI 下的低 DPI 省 token 但可读性差、高 DPI 花 token 但含无关内容的权衡。

关键模块与训练

  1. REL-CoT 数据构建:收集 29.4K 条 Reasoning–Evidence Localization 链式思维样本,把推理步骤与页码、边界框关联,形成带定位监督的训练信号。
  2. REL-SFT 多分辨率监督微调:在多种分辨率下训练模型定位相关区域,使其学会在低分辨率全局图中找到需要增强的位置。
  3. GRPO 策略优化:Group Relative Policy Optimization 不依赖独立持续预训练,直接学习何时增强分辨率以及如何利用增强后的观察,以端到端方式优化压缩与性能的平衡。

输出与工程效果

模型输出仍为最终答案,但中间隐式地执行了自适应阅读:对关键页面/区域花费更多视觉 token,对无关内容保持低成本。在 72 DPI 下,RULER v1 得 87.4(2.9× 压缩),超过 Glyph 的 57.5(3.0× 压缩);LongBench 56.40 超过 text backbone 55.86;在线端到端延迟比纯文本快 2.79×。

与同类方法的差异:固定分辨率 VTC(如 Glyph)只能在压缩率与可读性之间做静态取舍,FocusVTC 通过 GRPO 学会了动态、证据驱动的分辨率分配,无需额外持续预训练阶段。

实验

实验设计

评测覆盖长上下文与多模态能力:RULER v1、LongBench、MRCR、VTCBench、MMMU 和 MME。主要对比 Text 骨干与 Glyph 等固定分辨率视觉文本压缩方法。核心设置为 72 DPI 初始渲染,结合自适应分辨率增强,工具观察计入总 token 成本。

关键发现

  1. 在 RULER v1 上,FocusVTC 取得 87.4,远高于 Glyph 的 57.5,且输入压缩比约 2.9 倍。
  2. LongBench 达到 56.40,超过文本骨干的 55.86,表明视觉压缩未损害长上下文推理。
  3. MRCR 宏平均提升 13.91 点,VTCBench 达到 51.19,证明检索与多跳推理能力增强。
  4. 端到端延迟上,MRCR 比纯文本快 2.79 倍,推理效率显著。
  5. 通用多模态能力保持甚至提升:MMMU 从 65.12 升至 66.73,MME 从 2424.02 升至 2457.62。

与基线对比解读

相比固定分辨率的 Glyph,FocusVTC 通过自适应分辨率打破压缩-性能权衡:低 DPI 全局视图负责效率,局部增强保证关键证据可读性,在相近压缩比下大幅提升准确率。相比纯文本输入,FocusVTC 在长上下文基准上实现不降反升,说明视觉渲染能捕获文本流中易丢失的空间与版面线索。训练策略上,REL-SFT 与 GRPO 联合优化,无需额外持续预训练阶段,验证了将定位与决策融入同一推理链的可行性。

行业影响

落地场景

FocusVTC 适用于长文档理解 与证据定位 类产品:法律合同审查、金融研报问答、医疗病历摘要、企业知识库检索、电商商品详情与用户评价分析。它把多页 PDF 或长文本渲染为低 DPI 图像,并对关键区域做选择性高分辨率增强,在保持证据定位能力的同时大幅减少视觉 token 消耗。典型 use case:法律科技平台处理数百页并购协议时,模型在低分辨率全局视图上快速定位条款,再对条款区域增强分辨率,输出引用的页码与边界框;金融投研工具解析年报和财报,降低长上下文推理时的显存占用和延迟。

商业价值

核心收益在降本 与体验提升 两条线:

  • 降本:2.9× 输入压缩下 RULER 达 87.4,相比 Glyph 的 57.5 有显著优势;端到端延迟比纯文本输入快 2.79×,可直接降低按 token 计费的 API 成本和 GPU 租赁成本。
  • 体验提升:在 LongBench 上超过其文本输入 backbone(56.40 vs 55.86),多模态能力不降反升(MMMU 66.73),意味着采用 VTC 不牺牲通用能力,甚至可能提升长上下文任务的稳定性。

与现有产品/工作流的接口

集成路径较清晰:

  1. 文档预处理层:在现有 RAG 或 Agent 工作流中,将 PDF/文本渲染为自适应分辨率图像,输入多模态大模型;不改变模型后端,只需替换文档解析与渲染模块。
  2. 模型微调层:若需端到端自适应分辨率,可使用 REL-SFT 和 GRPO 对现有 VLM 微调,或将 FocusVTC 的推理策略作为插件,输出增强视图给下游推理器。
  3. 评估与灰度:可用 RULER / VTCBench / MRCR 做回归测试,监控压缩率与精度变化。

该方案适合已有长文档理解产品、但受限于 token 成本和首字延迟的团队灰度引入。

局限

  • **训练与数据成本高**:FocusVTC 依赖 29.4K 条 REL-CoT 数据,需要通过推理轨迹定位页面和边界框,构造成本明显高于纯文本 SFT 数据。加上 REL-SFT 与 GRPO 两阶段训练,整体管线对算力和标注要求较高。工程落地时需要针对私有文档重建数据或开发动态渲染迁移策略,否则直接复用难度较大。
  • **推理阶段额外开销**:自适应分辨率要求模型在低 DPI 全局视图上先定位相关区域,再生成高分辨率增强视图,引入多次视觉编码和工具调用。虽然 MRCR 端到端延迟相对 Text 有 2.79 倍加速,但相比固定低 DPI 的 VTC 方法(如 Glyph)可能增加交互轮次,且在超低 DPI 初始条件下区域召回率不足时,压缩增益会被削弱。
  • **评估覆盖与泛化局限**:论文主要针对长上下文文本压缩场景,在 VTCBench、RULER、LongBench 上验证,但对真实扫描文档、图表混排、非文本视觉内容居多的任务覆盖不足。与同类工作仅对比 Glyph 等少数 baseline,缺乏与最新多模态长上下文模型的系统比较。对于需要保留版面结构或公式语义的专业文档,渲染为图像可能丢失可编辑性和结构化信息。
论文FangZhi Zhong2026-09-29原文

相关内容