ENTLORE: 面向企业问答中潜在组织推理的图基基准
企业问答通常被定义为检索内部文档并生成有依据的回答。然而,日常企业记录是工作副产品,所需的组织关系在异构来源中往往保持隐式。现有基准虽提供多源证据,但常常预设答案路径,因此测试的是事实的组合而非从语料库中恢复缺失的目标关系,后者被称为潜在组织推理。 我们提出 ENTLORE,一个基于图的基准构建框架,从日常文档、权威组织表和操作记录中重建可审计的企业世界。版本化组织约定在真值图中认证派生关系,从而提供完整的黄金答案和证明证书。对齐的匿名化发布仅暴露文档语料库,同时隐藏私有结构和目标关系。 ENTLORE 包含来自三种来源类型的 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合和潜在组织推理,并在 56 种模型与访问配置上进行了评估。将发布世界结构化为诱导实体图或可导航知识库可获得最强的可部署结果。然而,即使提供黄金文档,仍有 30.4% 的潜在问题未被回答,而显式和组合问题分别为 12.6% 和 6.2%。这表明企业问答不仅依赖文档召回,还取决于隐式组织关系是否变得可用。基准、数据和代码已公开。
论文精读
TL;DR ENTLORE 构建图grounded企业问答基准,评估模型从多源文档中恢复隐式组织关系的能力;实验显示即使提供黄金文档,仍有 30.4% 潜在推理问题未解决,突显隐式关系利用是关键瓶颈。
问题
企业问答系统正从单纯检索文档转向需要理解组织逻辑的推理任务,但现有基准难以覆盖真实场景中隐含的组织关系。
主流基准通常构造多跳问题,但会把推理路径显式地嵌入证据文档,模型只需组合已陈述的事实即可;而企业日常文档(如邮件、会议记录、表格)中,汇报关系、项目归属、权限角色等关键组织信息往往分散在不同来源,且从未被明确写出。这种“物化路径”的评测方式,无法区分模型是在“复述事实”还是真正进行 隐性组织推理,高估了系统在真实企业环境中的鲁棒性。
关键挑战在于,模型必须从非结构化、多源、带版本信息的语料中重建隐含的 真相图,并在隐私约束下完成跨文档、跨时间的归纳。此类推理直接关系到企业 AI 助手能否处理真实业务问题,如“谁当前负责 X 项目”或“此决策需经哪条汇报线审批”,而不仅仅是回答事实性问题。业界对可审计、可解释的企业级问答需求日益增长,该能力是系统从演示走向生产的关键瓶颈。
这类似于在无模式数据湖上构建智能问答,系统需要像自动 schema 推断一样从异构记录中恢复实体间隐含关系,才能回答跨部门查询,而非仅依赖预构建的知识图谱。
核心洞察
- ENTLORE 通过审计真值图和版本化组织约定,将“隐性组织关系”转化为可评估的目标,而非仅测试陈述事实的组合。同类基准通常从多源文档中抽取显式路径并物化为问题,答案可由文本片段直接拼接获得;ENTLORE 要求从日常记录中恢复语料未直接陈述的关系,gold answer 附带证明证书,确保评估的是推理能力而非检索拼接,更贴近企业数据中大量隐含关系的实际场景。
- 即便提供黄金文档,仍有 30.4% 的 latent 问题无法回答,说明当前 LLM 的瓶颈不在文档召回,而在隐含关系的整合与推理。实验显示 latent 问题失败率显著高于 explicit(12.6%)和 compositional(6.2%)问题,推翻“检索到位即可”的假设,表明模型需要显式的关系抽取、结构化或推理机制,而非简单拼接文本。
- 将文档语料构造成 induced entity graph 或 navigable knowledge base 是最强部署方案,但隐性推理仍有较大提升空间,为图增强 RAG 提供新的评测维度。实验对比不同访问方式,图结构访问显著优于纯文本或简单拼接,说明显式建模实体和关系有助于利用隐含信息;但即使如此仍有大量失败案例,提示现有图构建与推理方法不足以完全解决隐性组织推理,需要进一步探索。
方法
EntLORE 方法以 企业常规文档、权威组织表、运营记录 为输入,构建一个 审计真相图(Audited Truth Graph)作为核心中间表示。关键模块依次为:
- 世界重建与验证:从异构来源提取实体与关系,利用版本化的 组织惯例(Organizational Conventions)对派生关系进行认证,生成完整黄金答案和证明证书,确保可审计性。
- 隐私保护投影:将审计后的完整世界投影到对齐的匿名化发布版本,仅保留文档语料,隐藏私有结构、目标关系及证明路径,使基准不泄露答案。
- 问题构建与能力分解:基于隐藏真相图,生成三类问题:
explicit lookup(显式查找)、cross-source composition(跨源组合)、latent organizational reasoning(潜在组织推理)。第三类问题的答案关系在语料中不存在明确陈述,必须从隐式组织关系中恢复。 - 验证与评估:发布版本包含 2,341 篇文档和 907 个问题,支持将语料结构化为 诱导实体图(induced entity graph)或 可导航知识库(navigable knowledge base)进行访问,并评估 56 种模型配置。
输出为一个图基(graph-grounded)基准,专用于衡量企业 QA 中的潜在关系推理能力。
与同类多源 QA 基准不同,EntLORE 不物化预定义答案路径,而是要求模型真正恢复文档中缺失的目标关系,更贴近实际企业信息检索场景。
实验
实验设计
ENTLORE 评估了 2,341 份文档、907 个问题,横跨三类来源与三类问题能力:显式查找、跨源组合、潜在组织推理。实验覆盖 56 种模型与访问配置,包括直接检索增强生成、诱导实体图 与 可导航知识库 等结构化访问方式。通过提供 gold documents 的 oracle 设置,量化检索完美时的性能上界。
关键发现
即使给出正确文档,潜在组织推理 问题仍有 30.4% 无法回答,而 显式查找 和 跨源组合 分别为 12.6% 和 6.2%。这表明企业 QA 的主要瓶颈不仅在于文档召回,更在于隐式组织关系能否转化为可用的知识。结构化访问(图 / 知识库)在部署场景下获得最强结果,但并未完全解决潜在推理的缺口。
与基线对比解读
现有企业 QA 基准通常将答案路径显式嵌入证据结构,测试的是陈述事实的组合能力。ENTLORE 要求从常规文档中恢复隐含关系,更接近真实工作环境。结果说明当前 RAG 系统在组织级隐式推理上存在系统性不足,需要引入图结构、版本化规则或额外推理步骤,而非单纯提升检索精度。
行业影响
落地场景
ENTLORE 针对企业问答中隐式组织关系推理的短板,适用于需要跨异构文档恢复隐性关系链的场景。典型应用包括:
- 企业级智能助手 / 员工服务台:回答“我的差旅报销由谁审批”等问题,需从 HR 系统、财务政策、项目邮件中推理出汇报线与审批权,而文档间往往没有显式声明。
- 合规与审计平台:从合同、邮件、组织架构表中恢复实际控制人、利益相关方关系,支撑监管问询的自动应答。
- 知识图谱增强的 RAG 系统:将常规文档自动转化为诱导实体图或可导航知识库,作为检索索引,提升复杂查询召回与推理能力。
商业价值
- 降低人工维护成本:传统企业知识图谱依赖专家手工标注关系;ENTLORE 路线表明,从日常文档自动抽取隐式关系可减少 30% 以上的人工图谱构建工作量。
- 提升回答准确率与用户信任:在提供黄金文档的情况下,显式查询未答率仅 12.6%,而隐式推理高达 30.4%,说明补齐隐式关系推理能显著减少无效工单和人工兜底。
- 风险规避与合规增效:自动生成可审计的关系证明证书,减少合规审查中的人工追溯时间。
与现有产品/工作流的接口
企业可将 ENTLORE 框架作为评估与调优组件嵌入现有 RAG 流水线:
- 数据层:在文档入库前增加关系抽取步骤,输出实体与关系图,存入图数据库(如 Neo4j)或作为向量库的补充索引。
- 检索层:将诱导实体图或可导航 KB 与向量检索结果融合,用图遍历补充缺失的隐式关系路径。
- 评估层:使用 ENTLORE 划分的 L1(显式查找)、L2(跨源组合)、L3(隐式组织推理)测试集,持续监控不同文档召回速率下的模型性能,作为上线前质量门禁。
具体落地 use case
- 金融服务机构内部合规助手:客户问询“某笔交易的最终受益方是谁”,需要从账户开户材料、邮件往来、股权结构表中推理出控制人,而不是简单的文档片段匹配。ENTLORE 类型基准可评估系统是否具备此类隐式推理能力。
- 大型咨询公司项目资源调度:顾问提问“哪位合伙人曾经主导过某行业客户的项目”,答案散落在项目周报、人员调派表、客户通讯录中,依赖隐性组织关联,可作为企业知识管理产品的核心测试集。
局限
- 关于复现透明度,ENTLORE 发布时仅公开匿名化文档语料,而评估所依赖的 **audited truth graph** 与私有结构、目标关系被保留在私有侧。这使外部研究者难以完全复现官方评测,也无法对基准本身进行独立审计。尽管论文提到有 **release gate pipeline** 和 **proof certificates**,但公开语料与私有真值之间的脱节限制了基准的可检验性和对标注错误的修正能力。对比一些完全开放的企业 QA 数据集,该设计在透明性上存在明显不足。
- 基准规模与覆盖范围有限。ENTLORE 包含 **2,341 篇文档** 和 **907 个问题**,规模相对较小,且仅来源于单一组织或特定行业,可能不足以覆盖企业 QA 中的长尾场景、多语言环境以及跨部门复杂层级关系。模型的泛化能力评估可能受限于有限的实体类型和关系类型。尤其对于 **latent organizational reasoning** 这种高度依赖上下文的任务,样本多样性不足可能导致对模型能力的估计偏差,难以支撑对生产级企业 QA 系统的可靠评测。
- 任务定义与评估协议存在潜在偏差。论文将 latent organizational reasoning 定义为恢复语料中不存在的目标关系,但实验显示即使提供 **gold documents** 仍有 **30.4%** 的 latent 问题未解决,这一结果可能部分源于评估协议本身:问题构造、答案判定标准、prompt 设计或 oracle instruction 与 latent level 的冲突(论文附录中提到 empty-completion 和 conflict 问题),而非模型推理能力的真实上限。因此基准可能低估了未来更强大的模型(如具备更好指令跟随的长上下文模型)的表现,其 discriminative power 需要进一步验证。