JOTO
联系我们
← AI 智库
知识图谱

北大等开源 K12-KGraph:从小学到高中的教材全部整合成知识图谱,既做bench又能训练

2026 年 7 月 27 日

北京大学等团队开源K12-KGraph,基于人教版K-12数理化生教材构建多模态知识图谱,含9类节点、14类关系;同步发布K12-Bench(23,640道结构理解题)与K12-Train(7,335条监督样本),实证显示主流大模型在课程结构推理(如先修关系、概念邻接)上表现薄弱,而针对性微调可显著提升GaokaoBench等教育基准得分。

课程认知缺口:模型会解题,但不懂知识如何组织

大模型已经很会做 K-12 考题。C-Eval、CMMLU、GaokaoBench、EduEval 上,前沿模型常能逼近甚至超过优秀考生。若只看分数,教育场景好像快被做完了。

课辅产品里更常见的卡点是:模型会解「求方程的解」,却排不出「这周该先补算术运算还是直接上方程」,也说不清某道题到底在考哪几个概念、哪套实验在验证哪条规律。论文把这类能力称为课程认知:理解知识如何组织、如何排序、如何被实验与插图支撑,而不只是记住孤立事实。

现有基准几乎不测这一点,主流指令微调数据也很少显式教这一点。缺口不在「再堆一堆题」,而在缺少一份能同时支撑评测与训练的课程结构资源。

一张课程结构图,同时支撑评测和训练

团队的做法是:直接从人教版小学到高中的数学、物理、化学、生物教材 PDF 出发,建成多种节点、多种连线的知识图谱 K12-KGraph。图分两块:

  • 文本组件:概念、技能、实验、习题,以及节、章、书等容器;边刻画分类、先修、关联、实验验证、习题考查、出现位置、章节顺序等。
  • 多模态组件:新增插图节点与视觉元素节点,边覆盖图内组成、视觉指称、图示解释、习题对图的依赖,以及「图为某条关系提供视觉证据」。

整图共 9 类节点、 14 类关系。因为边和节点都能追溯到教材原文,团队用同一张图派生两套资源:

  1. K12-Bench:23,640 道多选题,考查课程结构理解;
  2. K12-Train:7,335 条监督微调样本(其中文本 2,267、多模态视觉问答 5,068)。
K12-KGraph 构建流程示意图
Figure 1:K12-KGraph 五阶段流水线:OCR 解析、按目录切节、按预定结构抽取、自下而上合并、拓扑校验与人工复核。

构建流程也按教材真实形态设计。MinerU 把 PDF 转成保留层级与公式的 Markdown;目录解析切成节级文件并挂上插图;再对每一节用带结构约束的提示(论文使用 GPT-5.2)抽出节点、边,以及证据句或置信度;随后在书级、学科级做去重与别名对齐;最后对分类边与先修边做环检测,保证这两类关系不能绕圈。抽取提示明确要求「只保留教材里真正重要、表述清楚的内容」,边上尽量带回原文证据;全部三元组再经学科合格标注员复核。

图里到底有什么

文本侧覆盖 48 册教材:合并去重后约有概念 6,579、技能 1,364、实验 652、习题 1,171;先修边就有 3,705 条。数学没有实验节点,因此「实验验证」类边为 0。这是课程本身的结构,不是采样漏了。

K12-KGraph 文本组件统计表
Table 1:文本组件按学科统计。化学概念与先修边最密,数学实验为空。

多模态侧另有插图节点约 7,388、视觉元素约 10,203。几何图、实验装置、习题附图经常直接给出定义、证据或解题条件。

K12-KGraph 多模态组件统计表
Table 2:多模态组件统计。数学插图与视觉元素最多,与教材图示密度一致。

质量上,12 名学科合格标注员的整体一致性较高(Fleiss’ κ = 0.84);K12-Bench 分层抽检中,98.4% 的样本被判定为完全正确。题目对不对,最终落回图对不对。这比「再让模型写一批选择题」更容易定位错误边。

五种题,专测结构而不是回忆事实

直观一点:学「一元一次方程」前必须先会哪些内容?某道习题在考哪些概念?某实验在验证哪个概念?K12-Bench 用五类题把这些问题问死,并补上「知识点第一次出现在哪一章」。

题目与干扰项都由程序按图规则生成,不是让大模型自由编题。模型只看到题干和四个选项,看不到知识图谱,因此测的是闭卷时是否真懂课程结构。每题正确选项数在 1–3 之间,输出必须和标准答案集合完全一致;少选、多选都算错,所以 exact match(完全匹配,下称 EM)很严。57% 的 EM 并不等于「差不多对了一半选项」。

五个任务族各自对应一类关系:

任务族在问什么
Ground(考点锚定)这道习题考查哪些概念/技能,或某个概念对应哪些习题
Prereq(先修推理)学某概念前必须掌握的一串前置知识,或它的直接后继
Neighbor(相关概念)与某概念直接分类相关或语义相邻的概念
Evidence(实验验证)哪些实验验证某概念,或某实验验证哪些概念
Locate(章节定位)知识点首次出现在哪些章,或某章的先修章

干扰项优先从「图上隔一步能走到的节点」、同一大类下的并列知识点、同节同章候选里抽,再去掉文字过于相似的选项,并用教学标准过滤「看起来也对」的假干扰项。目标是:看起来像会混,但在课程结构上绝不该入选。

K12-Bench 题目生成示例
Figure 2:(A) 同一条先修子图如何落成 Prereq 多选题;(B) 同一关系如何改写成训练用问答。

强模型也会在「结构题」上掉队

零样本、只许输出选项字母时,十个开源与闭源模型的结果很清楚。

K12-Bench 主结果对比表
Table 3:K12-Bench 主结果。看 Overall 的 EM:闭源最佳 57.1%,开源最佳 46.4%;Prereq 与 Neighbor 全面最难。

先看总体:Gemini-3-Flash 总 EM 57.1%,F1 约 73%;开源最强 Gemma-4-31B-IT 为 46.4% EM。一半以上题目,模型给不出完整正确选项集合。

再看最难的两类:即便 Gemini-3-Flash,先修题 EM 仅 34.8%,相关概念题仅 33.4%。这两类要求分清「谁依赖谁、周围一圈怎么连」,和背结论不是一回事。章节定位相对容易,头部模型可以到约 80% EM:大致记得出现在哪一章,比完整排出一串前置知识轻松得多。考点锚定与实验验证也相对好一些,教辅和实验手册里这类对应关系出现更密。

小模型几乎等于乱猜:Meta-LLaMA-3-8B-Instruct 总 EM 7.2%,随机基线是 6.7%。瓶颈在关系推理,不在背章节名。

训练数据:不大,但咬住结构

对外对比时用的是文本子集 K12-Train-Text(2,267 条);完整集 K12-Train-Full 含多模态共 7,335 条。标题里说的「约 2300 条」,指的就是这个文本子集。

K12-Train 把图转成监督信号,走三条路径:

  1. 围绕节点写问答(大模型生成):概念定义/公式、技能步骤、实验仪器与结论、习题推理链;
  2. 围绕关系写问答(大模型生成):强制回答「为何 A 属于 B」「为何必须先学 A」「实验如何验证概念」「插图如何解释或支撑某条关系」等;
  3. 习题考查问答(模板填充):对考查概念/技能的边直接套模板,避免模型改写事实关系。

文本子集里含 450 道带步骤习题、356 道考查边、695 道节点问答、766 道关系问答;多模态子集 5,068 条全部依赖插图或视觉元素,并按边置信度筛选。生成前会裁掉无关属性、过滤低置信边,生成后再做格式与非空校验,降低把图里噪声写进训练集的风险。

对比实验故意把样本量压到同一量级:从 OpenHermes、Infinity、UltraChat、WizardLM、DataFlow、LMSYS、SmolTalk、Tulu-3 各随机抽约 2,300 条,与 K12-Train-Text 对齐,在 Qwen3-4B-Base 与 Llama3.1-8B-Base 上做全参数微调,学习率与训练轮次完全一致。

GaokaoBench 微调效果对比表
Table 4:等量约 2300 条 SFT 后的 GaokaoBench。两行「K12-Train-Text」在 Total 上均为同组最高。

在 GaokaoBench 上:

  • Qwen3-4B-Base + K12-Train-Text 总分 1009.96,超过最强基线 DataFlow(985.91)+24.1;客观题得分率 81.8%,主观题 89.5%,也是同组最高。
  • Llama3.1-8B-Base + K12-Train-Text 总分 625.49,超过最强基线 WizardLM(593.08)+32.4;客观题得分率 41.0% 同样最高。

相对两家官方 Instruct 变体,增益更大(论文报告 +114.6 / +221.0),说明「通用指令风格」补不上课程结构监督。EduEval 上方向一致:两个骨干的平均分也都是等量配置里最高(66.76 / 40.90),只是涨幅小于高考卷。

旁证是跨学科表现:训练数据只来自数理化生子图,语文却拿到同组最高分(120.18),人文数学也是最高(132.00)。语文卷更依赖阅读与表达结构,并不依赖数理化事实;更可能是学会了「按关系组织答案」,而不是背到了语文知识点。

多模态:文本与视觉要一起喂

视觉-语言模型实验改用 Qwen3.5-2B-Base,比较完整集、只训文本、只训多模态,以及完整体量的 DataFlow(约 1 万)与 WizardLM(约 14 万)。评测轴是 Gaokao-MM、MDK12-medium、K12Vista。

Gaokao-MM 微调效果对比表
Table 6:Gaokao-MM。K12-Train-Full 总体 39.9%,高于 Text/MM 单模态,也高于基座与 Instruct。

Gaokao-MM 上,K12-Train-Full 总体准确率 39.9%,相对基座 +7.5 个百分点,相对官方 Instruct +3.8;并同时高于只训文本或只训多模态的变体。MDK12-medium 上完整集平均 52.94,超过最强非 K12 基线 DataFlow 约 1.66 分。

K12Vista 微调效果对比表
Table 8:K12Vista。基座已有 79.72 的高分;只有 K12-Train-Full 微调后继续升到 79.95,且选择题/填空/问答三种题型均最好。

K12Vista 很挑刺:未微调的基座已经很强(平均 79.72)。多数通用微调反而掉点;只有完整集小幅升到 79.95,并在选择、填空、开放问答三种格式上同时最好。单训文本或单训多模态都会伤到这套已有能力:文字里的课程结构,和插图里的对象对应关系,需要一起学。

论文把有效原因归结为两点:每条样本都写明知识点之间的关系,而不只是孤立事实句;训练内容的顺序与关系又和人教版一致,和下游教育基准更合拍。边界也清楚:资源锚定中国人教版数理化生;评测时不给模型看图谱,考的是闭卷是否真懂结构;多模态增益主要在小参数视觉-语言模型上验证,换骨干与换教材体系仍需另证。

图谱、基准、训练数据与完整构建流水线均已开源。对想做课辅、自适应学习路径或教材级检索的人来说,值得先跑一遍 K12-Bench:如果模型连「学 B 之前必须先会哪些」都凑不齐,再堆刷题数据,多半只会更会用技巧答题,还是不懂知识点怎么串起来。

JOTO 企业落地观察

  • 课程结构知识图谱的构建方法论(如教材 OCR→结构化抽取→拓扑校验→人工复核)可直接迁移至企业内部制度文档、SOP 或产品手册的知识工程流程,尤其适用于需严格遵循层级与依赖关系的合规性知识管理场景。
  • 将知识图谱同时用于评测与训练的设计,提示企业在构建领域 RAG 系统时,不应仅关注向量召回精度,还需配套结构化验证机制——例如用图谱生成的逻辑一致性测试题,定期检验检索增强回答是否违背业务规则依赖链。
  • K12-KGraph 中「先修边」「实验验证边」等强语义关系的显式建模,对企业智能体(Agent)的任务分解能力具有直接参考价值:当 Agent 需执行多步骤操作时,其规划模块必须识别并尊重前置条件约束,而非仅依赖语言模型的隐式推断。
  • 多模态组件强调插图与视觉元素的语义锚定,对企业部署工业设备维修、医疗影像辅助诊断等图文协同场景提出关键提醒:纯文本知识图谱无法支撑视觉证据链推理,需在知识建模阶段即统一纳入图像区域标注与跨模态关系定义。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。