K12-KGraph:用于评估和训练教育大语言模型的课程对齐知识图谱
大语言模型在 K-12 教育中日益普及,但现有基准主要测试考试问答,而非理解课程知识的结构化组织和视觉呈现。本文将其称为课程认知,涵盖前提链、概念分类、实验-概念链接、教学排序和视觉定位。 我们提出 K12-KGraph,一个从人教版官方教科书(数学、物理、化学、生物,覆盖小学、初中、高中)中提取的课程对齐知识图谱,包含 9 种节点类型和 14 种关系类型,覆盖课程结构和视觉定位。基于此图,构建 K12-Bench 基准,含 23,640 道多选题,涵盖 5 个任务族:Ground、Prereq、Neighbor、Evidence 和 Locate。同时构建 K12-Train,一个图引导的有监督微调语料库,共 7,335 样本,包括 2,267 纯文本 QA 对和 5,068 多模态 VQA 对。 在 K12-Bench 上,Gemini-3-Flash 仅达到 57% 的精确匹配,Gemma-4-31B-IT 达 46%,其中 Prereq 和 Neighbor 任务最难。训练实验表明,领域特定监督可缩小差距:在 2,300 样本预算下,K12-Train-Text 在 GaokaoBench 和 EduEval 上持续优于同等规模的 8 个主流指令微调语料库子集;对于视觉-语言模型,K12-Train-Full 在 Gaokao-MM、MDK12-medium 和 K12Vista 上取得最佳整体结果,尽管使用的样本比完整 DataFlow 和 WizardLM 基线少,且超过纯文本和纯多模态变体,表明文本与视觉监督互补。 我们开源了图谱、基准、训练数据及完整构建流程。
论文精读
TL;DR 从人教版教材构建 K12-KGraph 知识图谱,揭示 LLM 在课程前置关系等认知任务上不足 50%,并提供图文互补训练数据以缩小差距。
问题
当前 LLM 在教育领域的应用多聚焦于考试题目应答,而忽略了模型对课程知识结构化与视觉呈现的理解,即“课程认知”。
现有教育基准(如 MMLU、GaokaoBench)主要评估孤立知识点的记忆与推理,缺乏对先修关系链、概念层级、实验-概念映射、教学序列及多模态视觉 grounding 的系统测试。同时,公开训练语料几乎不包含课程图谱驱动的结构化监督信号,导致模型难以内化知识间的依赖与拓扑关系,跨章节推理和视觉定位能力薄弱。
此问题的技术挑战在于:① 构建大规模、细粒度、学科覆盖完整的 curriculum-aligned knowledge graph 需要从多模态教材中提取非显式关联,并保证 schema 的设计同时满足教育学和计算需求;② 受控地从图谱生成多任务、低歧义、抗猜测的基准问题,需兼顾干扰项合理性和题型多样性,避免记忆泄露。其重要性源于教育 AI 的可靠性需求——若模型不理解知识演化脉络,就无法胜任自适应学习、教材自动生成、认知诊断等高级应用。
类似 自动驾驶依赖高精地图 理解道路拓扑与元素关系,教育 LLM 也需要课程知识图谱作为结构化“地图”来理解知识空间。
核心洞察
- 定义了“课程认知”(curriculum cognition)能力并构建首个系统化基准 K12-Bench,将教育大模型评估从答题准确率拓展至对知识结构、前提关系和视觉基础的理解,更贴近真实教学场景。与现有只考终端问答的基准(如 GaokaoBench, MMLU)不同,它通过五类任务(Ground, Prereq, Neighbor, Evidence, Locate)直接从 KG 采样生成多选题,暴露出现有最强模型在前提推理(Prereq)和邻居推荐(Neighbor)上的显著短板(Gemini-3-Flash 仅 57%),为教育 AI 改进提供了结构化诊断。
- 知识图谱引导的数据合成在领域微调中展现高效性:在匹配数据量(2,300 样本)下,K12-Train 文本部分在 GaokaoBench 和 EduEval 上显著优于八个主流指令微调数据集的等量子集,且文本与视觉监督互补(K12-Train-Full 超越纯文本/纯多模态变体)。这为垂直领域提供了一条低成本、高可控的数据生产路径:通过定义 KG schema 并自动抽取三元组,再合成 QA 对,用极少量高质量领域数据即可超越海量通用数据,对工程化落地有直接指导意义——相比盲目扩展通用语料,构建轻量领域 KG 并生成数据更高效。
方法
输入
以官方教材(数学、物理、化学、生物,覆盖小学至高中)为原始数据源,预处理为结构化文本与配图。
关键模块
- K12-KGraph 构建
- 设计包含 9 种节点(概念、技能、实验、章节等)与 14 种关系(先修、分类、视觉关联、实验验证等)的 schema,专门建模课程结构(curriculum structure)与视觉基础(visual grounding)。
- 采用 LLM 辅助的 自动化提取管道,结合人工验证与自动结构检查,从教材文本与插图中抽取实体与关系,构建课程对齐的知识图谱。
- K12-Bench 基准生成
- 从 KG 中衍生 5 类任务(Ground:知识基础、Prereq:先修推理、Neighbor:近邻推荐、Evidence:实验证据链、Locate:跨章节索引),每类任务映射到特定认知能力。
- 通过结构化候选采样(从图中关系拓扑生成干扰项)与教育专家过滤,合成 23,640 道多选题,确保问题难度与课程认知深度。
- K12-Train 训练数据合成
- 利用图谱引导的 QA 生成提示,从 KG 三元组产生监督微调样本,包含 2,267 条纯文本 QA 与 5,068 条多模态 VQA(图文结合),强调课程逻辑与视觉信息的互补性。
输出
发布完整知识图谱、基准数据集、训练语料及可复现构建管道(含质量验证脚本)。
与同类方法的差异点:区别于仅测试题目解答能力的传统基准,本工作首次系统定义并评测 LLM 的课程认知(curriculum cognition),从先修依赖、概念体系、实验证据链等维度考察模型对教材知识结构的深层理解,且所有数据均源于真实教材,保障教育严谨性。
实验
实验设计
基于 K12-KGraph 知识图谱,研究者构造了 K12-Bench 基准,包含 23,640 道多选题,覆盖五个任务族:Ground(知识锚定)、Prereq(先修推理)、Neighbor(邻居推荐)、Evidence(实验证据链)和 Locate(跨章节索引)。评估多个 LLM 与 VLM 的课程认知能力。
训练方面,利用图谱指导合成 K12-Train 监督微调语料:2267 条纯文本 QA 和 5068 条多模态 VQA。在 2300 样本预算下,与八种主流指令微调数据集的等量子集对比,观察迁移效果;多模态 SFT 设置中,对比完整 K12-Train 与单独文本、单独视觉的消融。
关键发现
- 通用模型在课程认知任务上表现不足:最优的 Gemini-3-Flash 在 K12-Bench 上 Exact Match 仅 57%,Gemma-4-31B-IT 为 46%,其中 Prereq 和 Neighbor 类任务难度最大,暴露了现有模型对课程结构理解的短板。
- 领域特定监督显著提升性能:使用 K12-Train-Text 微调后,模型在 GaokaoBench 与 EduEval 上持续优于所有同等规模的通用指令微调基线。
- 文本与视觉监督互补:K12-Train-Full 在 Gaokao-MM、MDK12-medium 和 K12Vista 三个多模态基准上取得最佳整体结果,且优于仅文本或仅视觉的变体。
对比基线深度解读
与八种主流指令微调数据(如 DataFlow、WizardLM 等)的公平对比中,K12-Train-Text 在匹配样本量下胜出,表明课程知识的 结构化注入 比通用对话的浅层数据混合更有效。多模态实验中,K12-Train-Full 使用的样本量甚至少于 DataFlow 与 WizardLM 全量数据,却实现全面领先,证明 知识图谱驱动的数据合成 能以更低成本获取高教学价值样本。消融分析进一步确认,仅靠文本或视觉线索均会带来性能下降,二者结合才能完整模拟课程认知所需的先修链条与视觉证据推理。
行业影响
落地场景
K12-KGraph 及衍生基准可直接嵌入 自适应学习平台、AI 家教、智能题库与教育硬件(学习机/平板),赋能课程认知能力的评测与训练。产品侧,知识图谱支撑先修路径推荐、概念关联探索、图文证据链(如实验与概念的关联)等功能,改善传统“拍照搜题”仅匹配答案的局限;业务侧,教育出版商和内容平台可基于图谱自动构建结构化课程库,减少人工梳理成本。
商业价值
- 降本:自动化从教材抽取结构化知识,替代大量人工教研标注(尤其是先修关系、视觉基础对齐),单科目图谱构建效率可提升数倍。
- 增收:具备课程认知的教育产品差异化明显,可撬动学校/学区采购、家长付费意愿;同时,精确的先修诊断能减少学生流失,延长用户生命周期。
- 体验提升:模型输出不再是孤立的答案,而是带有教学序列逻辑和可视化证据的解释,显著提升可信度与学习效果,直接拉高 NPS 和续费率。
与现有产品/工作流的接口
K12-KGraph 提供 JSON-LD 格式的图谱、K12-Bench 多选评估集(23,640 题)以及 K12-Train 微调语料(7,335 条)。集成方式:
- 作为基座模型微调的一环,在通用指令数据上增加 K12-Train,即可大幅提升教育领域表现(论文显示 2,300 条文本样本即可超越等量通用语料)。
- 作为评估算子的插件,在 CI/CD 流程中用 K12-Bench 五个任务族(Ground / Prereq / Neighbor / Evidence / Locate)监控模型课程认知能力的变化。
- 与现有 RAG 流水线结合:图谱节点可作为检索索引,增强检索结果的结构化上下文,使生成内容符合课程逻辑。
具体落地场景:
- 全球在线教育平台(如 Khan Academy 或类似数理化全科平台)将 K12-KGraph 嵌入其 AI 导师模块,学生在练习代数时,系统能自动追溯其掌握的“预修概念”并动态推荐补救内容,告别线性视频列表。
- 教育硬件厂商在其学习平板中内置该图谱,实现“知识点地图”的交互式探索,学生点击一个物理概念,可立即展示关联实验、先修章节与同层兄弟概念,形成认知网络而非割裂的问答。
局限
- 知识图谱源于单一官方教材(**People's Education Press**),对采用不同课程标准或非中文教育体系的泛化能力有限;自动抽取流程中,**视觉关系过滤** 与人工验证的覆盖率未详细量化,可能残留结构性噪声,影响下游任务可靠性。
- **K12-Bench** 全部为多选题,虽通过干扰项结构化设计提升了区分度,但难以模拟真实教学场景下的开放式问答、辅导对话等交互性评估;任务聚焦静态课程结构,未涵盖动态认知诊断或自适应推理等教育关键能力。
- 训练实验仅基于少量模型(**Gemini-3-Flash**、**Gemma-4-31B-IT**)和有限样本(文本 2300 条、多模态 5068 条),未探索更大参数规模或不同架构的效果;迁移性仅在 **GaokaoBench** 等少数基准上验证,跨任务、跨语言的普适性尚待检验。