MonkeyOCRv2 用像素级重建建立文档视觉记忆,受控实验领先 13.2 分
MonkeyOCRv2 通过像素级重建让模型记住文档细节而非依赖语言补全,颠覆了视觉编码器只是可替换前端的看法。
文档视觉语言模型常被当作通用视觉编码器加 LLM 的拼接,但 MonkeyOCRv2 的受控实验证明,仅替换视觉编码器就能带来两位数差距。其核心方法是用像素级重建约束视觉表示保留字符、布局等细节,而非只优化文字生成,从而建立一种可验证的“文档视觉记忆”。
正文摘录
从视觉压缩,到视觉记忆:MonkeyOCRv2 以重建保留文档页面证据 - sourcecompany: 机器之心 - bodymarkdown: .jpg)  文档视觉编码器究竟有多重要?一个直接的验证方法是把其他条件全部锁死:在 MonkeyOCRv2 的受控实验中,不同模型使用相同的 Qwen3-1.7B、相同的训练数据、优化设置和解码流程,视觉编码器也全部冻结。唯一发生变化的,就是文档进入语言模型之前所经过的那套视觉表示。结果是,在 8 个文档理解基准上,MonkeyOCRv2-B 取得 57.2 分,领先最强对照 OpenVision-B 整整 13.2 分。这说明:在 LLM 开始理解和推理之前,视觉编码器已经决定了它能拿到多少可靠证据。