百度开源 Unlimited OCR,长文档识别能力刷新 SOTA
百度开源 Unlimited OCR 通过革新注意力机制实现长文档连续识别,性能超越 DeepSeek OCR,或重塑 AI 数据入口竞争格局。
百度开源 Unlimited OCR,创新参考滑动窗口注意力(R-SWA),让模型像人一样连续阅读整本书,显存和计算开销不随文档长度增长。在 OmniDocBench 上综合得分 93.23%,超越 DeepSeek OCR,推理速度提升约 35%。
正文摘录
一次吃下一本书!百度开源新 OCR,作者疑似前 DeepSeek 研究员 它主打一口气读完几十页长文档,并在 OmniDocBench 上刷新 SOTA,整体成绩超过此前的 DeepSeek OCR。 与传统 OCR 处理长文档时“一页一页读,再把结果拼回去”的思路不同,Unlimited OCR 这次模仿了一种酷似人类抄录员的工作方式: 基于此,它能够像人一样连续阅读整本书,而不是每读完一页就中断一次,再从下一页重新开始。 更关键的是,借助创新的 参考滑动窗口注意力(Reference Sliding Window Attention,R-SWA) 机制,即便文档越来越长,显存占用和注意力计算开销也几乎不会增长。 简单来说,OCR(光学字符识别,Optical Character Recognition)就是把图片里的内容读出来,再转换成 Markdown 等可编辑文本。 在以往的处理流程中,一张图片会先进入编码器,被压缩成一串视觉 Token;随后解码器再一个字一个字地把内容写出来。 但问题在于,传统的 OCR 解码器每生成一个新 Token,它都需要回头查看之前生成过的所有 Token,再决定下一个字该写什么。 于是文档越长,需要回看的历史内容就越多,KV Cache(键值缓存,存储注意力计算的中间结果)持续膨胀,显存占用和注意力计算开销也随之增长。 这也是为什么现有 OCR 系统很难一次读完几十页文档,通常只能采用“逐页处理+结果拼接”的方案: 这种 for-loop 式方案虽然工程上可行,但本质上只是权宜之计,而 Unlimited OCR 想解决的,正是进一步扩展模型在长程任务的表现。 如果不采用逐页重置的 for-loop 方案,模型又该如何在保持连续阅读状态的同时,避免 KV Cache 随着文档长度无限增长?