行业新闻

十万级标签分类:混合向量搜索比前沿模型更准更省

用嵌入模型+词汇混合检索做文档分类,在超大规模标签下比直接扔给 LLM 更准、更便宜。

Databricks 对比三种方案后发现,将嵌入向量(用 Qwen3-Embedding-8B 模型)与 BM25 词汇匹配的混合检索用于标签分类,在 10 万+ 标签的精度和成本上都优于直接调用 GPT-4 等前沿 LLM。关键:向量搜索无需训练、能处理稀有标签,且不受上下文窗口限制。

正文摘录

将文档分类扩展到 10 万+ 标签 - 来源公司:Databricks - 正文 markdown: 将 AI Classify 与向量搜索结合,如何在准确率和成本上超越前沿模型。 在 Databricks 上,数以千计的客户构建生产工作负载,将自由文本映射到包含 10 万+ 标签的规范化分类体系。一些常见用例包括: - 产品分类:将产品描述映射到标准商品代码,如 UNSPSC(联合国标准产品与服务分类)或定制目录 - 内容审核:将用户内容映射到内容策略标签,如“暴力”或“骚扰” - 医疗编码:将临床文本映射到 ICD-10 诊断代码或 RxNorm 药物名称 - 主题分类:将文档(如法律文件、专利、研究报告)按主题分类 每个用例都定义了一个大型标签集,也称为分类体系,每个输入必须映射到其中的一个或多个标签。客户通常根据以下标准评估其生产解决方案: 1. 高准确率 — 首选方法是按文档准确率计算,即正确分类的文档比例 2. 完整性 — 分类器必须覆盖 100% 的标签,包括稀疏或罕见的标签 3. 支持分类体系演化 — 标签随业务需求的变化而被添加、弃用或修改 同时满足这三个要求使得大规模分类体系的生产分类变得困难,我们在 Databricks 优先研究并构建解决方案。 --- 历史上,组织通过依赖自定义正则规则、关键词匹配和监督式机器学习分类器来处理大规模分类体系。然而,这些方法在多个维度上存在不足: - 脆弱的模式匹配:正则和关键词规则依赖于精确匹配,因此会因真实数据的不可预测格式而失效。像 YipitData 这样的公司需要不断更新正则模式以应对边缘情况和分类体系变化,在数千个标签的规模下难以维护。 - 稀疏且偏斜的真实标注:真实的标签分布是长尾的:少数标签覆盖了大部分文档,而数千个标签很少出现。

阅读原文(databricks.com)→

行业新闻2026-07-20原文

相关内容