动态

百度开源Unlimited-OCR,可一次性处理40页文档。

百度开源Unlimited-OCR,可一次性处理40页文档。
Yann LeCun
RT @VaibhavSisinty: 百度刚刚开源了一个OCR模型,可以一次性读取整个40页的文档。它叫做Unlimited-OCR。30亿参数,但推理时仅激活5亿参数。100%在本地机器上运行。为什么重要:传统OCR工具逐页切割文档,跨页表格会断裂,阅读顺序丢失,跨页上下文消失。Unlimited-OCR一次性处理整个文档,32K上下文窗口,文本、公式、表格、阅读顺序跨页保留。输出为干净的Markdown格式。→标准基准测试93%准确率,比基线高6个百分点。→错误率在40页后仍低于0.11。→开箱即支持多语言。→上个月Hugging Face下载量212万,GitHub星标14600。作为对比:Amazon Textract、Google Cloud Vision和Azure Document Intelligence都按页收费,这个免费本地运行。
动态Yann LeCun2026-07-20原文

相关内容