Databricks 推出 AI Extract Precision Mode,攻克复杂文档提取难题
Databricks 发布 Precision Mode,用自训练模型加智能体框架把复杂文档提取精度拉到 94.7%,比前沿模型高 7 个百分点。
Databricks 在文档提取 API aiextract 中推出 Precision Mode,结合自训练模型与智能体编排,在长文档、复杂模式等任务上达到 94.7% 提取精度,比最强前沿模型基线高 7 个百分点,专治现有 LLM 方案搞不定的难题。
正文摘录
Introducing Precision Mode in AI Extract: achieve frontier accuracy on long documents and complex schemas where existing approaches fall short. 作者:Jane Zhang、Arnav Singhvi、Ivan Zhou、Archika Dogra、Matthew Ding 和 Nihit Desai 每个企业都有宝贵的数据被锁在杂乱无章的非结构化文档中。如今,Databricks Document Intelligence 帮助数千名客户让数据发挥作用,将数十亿页文档转化为结构化数据,为生产流水线(pipeline)、智能体(agent)和应用提供支持。松下(Panasonic)、EY-Parthenon 和洲际交易所(Intercontinental Exchange, NYSE)等客户在要求最高的工作流中使用 Document Intelligence,每周处理数百万份文档。 在与客户合作时,我们注意到一些困难的抽取问题,现有的基于大语言模型(LLM)或规则的文档抽取方案在这些问题上力不从心: 今天,我们激动地宣布在文档抽取 API aiextract 中推出 Precision Mode(精确模式),为最复杂的企业文档和任务树立了新的准确率标杆。 Precision Mode 将我们为文档抽取定制训练的模型与智能体式编排(agentic harness)相结合,在长文档、大输出和高推理量 schema(数据模式)上提供可靠且准确的抽取结果。在涵盖约 9,000 份复杂文档的基准测试中,Precision Mode 达到了当前最优(state-of-the-art)质量,在抽取准确率上大幅超越最新的前沿模型。