动态

DeepSeek-OCR通过光学压缩实现10倍文本压缩率,准确率97%

宝玉
亲爱的,我把文本缩小了:新AI如何将1000个单词压缩成一张“图片”

我们都遇到过瓶颈。当你试图将一份50页的长文档粘贴到AI聊天机器人中时,却收到错误提示:“输入过长。”

我们喜欢AI能写邮件、总结文章,但它们的“记忆”却出奇地短。让它们阅读整本书或整个公司的季度报告几乎不可能。这是当前AI最大的瓶颈,即“长上下文”问题。

其困难在于技术层面,但可以这样理解:为了理解文本,标准AI(Transformer)必须像一场大型鸡尾酒会的主人。文本中的每个单词都必须与其他每个单词“交流”以理解上下文。1000个单词需要100万次对话,10000个单词则需要1亿次。这种计算成本呈爆炸式增长,导致速度极慢且成本高昂。

多年来,AI领域最聪明的头脑一直在尝试让这场“鸡尾酒会”更高效。但DeepSeek-AI实验室的一篇新论文提出了一个奇妙且反直觉的问题:

如果我们不再强迫AI逐字“阅读”文本呢?相反,我们只是……给文本拍张照片,然后让AI看这张照片?

乍一听这很疯狂。图像充满复杂的像素数据,处理起来肯定比纯文本更困难?但DeepSeek团队怀疑这可能是一种“光学压缩”形式。一张包含1000个单词的图片能否成为AI的“营养密集药丸”,而不是一个巨大的、1000个单词的“文本三明治”?

他们构建了一个系统来验证。

“数字眯眼器”和“文本重建器”

该团队创建了一个名为DeepSeek-OCR的新模型。它由一个AI承担两个专门职责。

- 第一部分:“数字眯眼器”(编码器):这部分的工作是查看文档图像。但它不是简单的扫描仪。研究人员设计了一种特殊的“深度编码器”,故意追求高效。它“眯着眼睛”看页面,捕捉布局和文本的本质,而不纠结于每个像素。然后它将整个高清视图压缩成仅有少量“视觉笔记”(论文中称为“视觉令牌”)。

- 第二部分:“文本重建器”(解码器):这部分得到那少量“视觉笔记”,并有一个任务:逐字重建整个原始文本。

实验是一场高风险赌注:重建器能否真的从“眯眼器”极度压缩的“要点笔记”中完美还原文档?

“啊哈!”时刻:10倍压缩,准确率97%

结果令人震惊。

团队发现,他们的系统可以达到10比1的压缩比,且几乎完美准确。

让我们明确这意味着什么。他们可以拿一个包含,比如说,1000个文本“令牌”(AI大小的词块)的文档,将其压缩成仅占用100个视觉令牌的视觉表示。然后文本重建器读取这100个令牌,以97%的精度重建原始1000个单词的文本。

这证明“一图胜千言”对AI数据压缩可能字面上成立。

他们进一步推进。那么20比1的压缩比呢?这就像把一份20页的报告压缩成一页视觉笔记。准确率终于开始下降,但仍保持在约60%。

当他们在标准文档阅读测试中将模型与其他模型对比时,DeepSeek-OCR是效率冠军。在一个案例中,它性能优于竞争对手(MinerU2.0),同时使用的视觉令牌少于800个。而竞争对手完成相同任务需要近7000个。

那又怎样?为什么这可能改变一切

这不仅仅是读取PDF的新工具。这篇论文为解决AI最大问题打开了一扇新门。

1. 通往“无限”AI记忆的新路径
这种“光学压缩”从一个全新角度解决了长上下文问题。
动态宝玉2025-10-23原文

相关内容