百度开源 Unlimited OCR,长文档解析一次推理超 DeepSeek OCR
Unlimited OCR 通过解码端优化解决长文档 OCR 显存瓶颈,首次实现单次推理解析数十页文档。
百度开源了 Unlimited OCR 模型,在 32K 上下文窗口下可一次推理完成整本书解析,无需分页。它在 OmniDocBench 基准上以 93.23% 总分超越 DeepSeek OCR 6 个百分点,关键在于优化了解码阶段的 KV Cache(键值缓存,存储历史注意力计算结果的显存区域)管理。
正文摘录
.jpg) 编辑|张倩、陈陈 DeepSeek OCR 留下的一个问题,好像被人接上了。 昨天,我们在 HuggingFace 上刷到一个新开源模型,直接被惊艳到了。 它叫 Unlimited OCR,百度出的。 最吸引眼球的地方是,在标准最大上下文长度 32K 的条件下,它让 OCR 模型第一次能够一口气读完整本书。[](https://mp.weixin.qq.com/s/Fcdv7KZaLYcwlKFJjZL-4A) 注意,这不是逐页处理,不是 for-loop 式拆任务,也不是靠外部调度器把结果拼起来,而是真正意义上的一次前向推理直接完成数十页文档解析。  更绝的是,它不仅做到了,还做得相当好。在文档解析主流基准 OmniDocBench v1.5 上, Unlimited OCR 以 93.23% 的总分拿下端到端 SOTA,比 DeepSeek OCR 整整高出 6 个百分点。