Extend
Extend 是一款高精度 PDF 解析工具,面向 AI 开发者,用于快速构建可靠的数据处理管道。
Maker 说
"每天有超过10亿份PDF被创建,但你的智能体仍然无法可靠读取它们。"
@Extend 发布了 Parse 2.0,他们的新文档解析API。
创始人兼CEO @kbyatnal 在 X 上表示:Extend 每天已经为 @Brex、@Mercury、@Opendoor 等领先AI团队以及数百家其他公司处理数百万页文档。现在,它更好了。
Parse 2.0 在 RealDoc-Bench 上达到了SOTA质量——这是我们开源的基准测试,用于衡量智能体在生产环境中实际遇到的真实文档上的成功率。
我们在100万+页生产环境中最难的文档上训练了 Parse 2.0。以下是它的表现:在医疗、房地产、物流和金融服务领域排名第一;在581份文档上智能体问答准确率95.7%(第二名92%);版面F1得分0.847(第二名0.759)
Parse 2.0让你的智能体能够真正使用可靠的输入信息,不管文档有多复杂。它能帮你构建:能够精准回答并附带精确引用来源的RAG系统、加速文档工作流的自动化流程、以及能对文档采取行动(如路由、分类、提取等)的智能体。
Parse 2.0是一个面向需要可靠输入的智能体的SOTA、布局优先的文档解析API。它的特性包括:
基于100万+最难文档重新训练的完整布局模型
新的专用OCR和VLM下游模型,用于处理特定文档组件(如表格、手写内容等)
新的阅读顺序模型,保留语义结构(不是所有文档都应该从左到右、从上到下阅读)
如果你需要精准的PDF解析,欢迎来看看,告诉我们你的想法!
大多数管线失效并非因为提取本身,而是因为下游对层级结构的假设(尤其是表格/表单,在这些地方“正确的文本”≠“正确的语义流程”)。
我很好奇,当真实布局解读本身很主观时(比如多表格文档或混合叙述/表格),你们是如何处理评估的?