北大等开源 K12-KGraph:从小学到高中的教材全部整合成知识图谱,既做bench又能训练
北京大学等团队开源K12-KGraph,基于人教版K-12数理化生教材构建多模态知识图谱,含9类节点、14类关系;同步发布K12-Bench(23,640道结构理解题)与K12-Train(7,335条监督样本),实证显示主流大模型在课程结构推理(如先修关系、概念邻接)上表现薄弱,而针对性微调可显著提升GaokaoBench等教育基准得分。
课程认知缺口:模型会解题,但不懂知识如何组织
大模型已经很会做 K-12 考题。C-Eval、CMMLU、GaokaoBench、EduEval 上,前沿模型常能逼近甚至超过优秀考生。若只看分数,教育场景好像快被做完了。
课辅产品里更常见的卡点是:模型会解「求方程的解」,却排不出「这周该先补算术运算还是直接上方程」,也说不清某道题到底在考哪几个概念、哪套实验在验证哪条规律。论文把这类能力称为课程认知:理解知识如何组织、如何排序、如何被实验与插图支撑,而不只是记住孤立事实。
现有基准几乎不测这一点,主流指令微调数据也很少显式教这一点。缺口不在「再堆一堆题」,而在缺少一份能同时支撑评测与训练的课程结构资源。
一张课程结构图,同时支撑评测和训练
团队的做法是:直接从人教版小学到高中的数学、物理、化学、生物教材 PDF 出发,建成多种节点、多种连线的知识图谱 K12-KGraph。图分两块:
- 文本组件:概念、技能、实验、习题,以及节、章、书等容器;边刻画分类、先修、关联、实验验证、习题考查、出现位置、章节顺序等。
- 多模态组件:新增插图节点与视觉元素节点,边覆盖图内组成、视觉指称、图示解释、习题对图的依赖,以及「图为某条关系提供视觉证据」。
整图共 9 类节点、 14 类关系。因为边和节点都能追溯到教材原文,团队用同一张图派生两套资源:
- K12-Bench:23,640 道多选题,考查课程结构理解;
- K12-Train:7,335 条监督微调样本(其中文本 2,267、多模态视觉问答 5,068)。

构建流程也按教材真实形态设计。MinerU 把 PDF 转成保留层级与公式的 Markdown;目录解析切成节级文件并挂上插图;再对每一节用带结构约束的提示(论文使用 GPT-5.2)抽出节点、边,以及证据句或置信度;随后在书级、学科级做去重与别名对齐;最后对分类边与先修边做环检测,保证这两类关系不能绕圈。抽取提示明确要求「只保留教材里真正重要、表述清楚的内容」,边上尽量带回原文证据;全部三元组再经学科合格标注员复核。
图里到底有什么
文本侧覆盖 48 册教材:合并去重后约有概念 6,579、技能 1,364、实验 652、习题 1,171;先修边就有 3,705 条。数学没有实验节点,因此「实验验证」类边为 0。这是课程本身的结构,不是采样漏了。

多模态侧另有插图节点约 7,388、视觉元素约 10,203。几何图、实验装置、习题附图经常直接给出定义、证据或解题条件。

质量上,12 名学科合格标注员的整体一致性较高(Fleiss’ κ = 0.84);K12-Bench 分层抽检中,98.4% 的样本被判定为完全正确。题目对不对,最终落回图对不对。这比「再让模型写一批选择题」更容易定位错误边。
五种题,专测结构而不是回忆事实
直观一点:学「一元一次方程」前必须先会哪些内容?某道习题在考哪些概念?某实验在验证哪个概念?K12-Bench 用五类题把这些问题问死,并补上「知识点第一次出现在哪一章」。
题目与干扰项都由程序按图规则生成,不是让大模型自由编题。模型只看到题干和四个选项,看不到知识图谱,因此测的是闭卷时是否真懂课程结构。每题正确选项数在 1–3 之间,输出必须和标准答案集合完全一致;少选、多选都算错,所以 exact match(完全匹配,下称 EM)很严。57% 的 EM 并不等于「差不多对了一半选项」。
五个任务族各自对应一类关系:
| 任务族 | 在问什么 |
|---|---|
| Ground(考点锚定) | 这道习题考查哪些概念/技能,或某个概念对应哪些习题 |
| Prereq(先修推理) | 学某概念前必须掌握的一串前置知识,或它的直接后继 |
| Neighbor(相关概念) | 与某概念直接分类相关或语义相邻的概念 |
| Evidence(实验验证) | 哪些实验验证某概念,或某实验验证哪些概念 |
| Locate(章节定位) | 知识点首次出现在哪些章,或某章的先修章 |
干扰项优先从「图上隔一步能走到的节点」、同一大类下的并列知识点、同节同章候选里抽,再去掉文字过于相似的选项,并用教学标准过滤「看起来也对」的假干扰项。目标是:看起来像会混,但在课程结构上绝不该入选。

强模型也会在「结构题」上掉队
零样本、只许输出选项字母时,十个开源与闭源模型的结果很清楚。

先看总体:Gemini-3-Flash 总 EM 57.1%,F1 约 73%;开源最强 Gemma-4-31B-IT 为 46.4% EM。一半以上题目,模型给不出完整正确选项集合。
再看最难的两类:即便 Gemini-3-Flash,先修题 EM 仅 34.8%,相关概念题仅 33.4%。这两类要求分清「谁依赖谁、周围一圈怎么连」,和背结论不是一回事。章节定位相对容易,头部模型可以到约 80% EM:大致记得出现在哪一章,比完整排出一串前置知识轻松得多。考点锚定与实验验证也相对好一些,教辅和实验手册里这类对应关系出现更密。
小模型几乎等于乱猜:Meta-LLaMA-3-8B-Instruct 总 EM 7.2%,随机基线是 6.7%。瓶颈在关系推理,不在背章节名。
训练数据:不大,但咬住结构
对外对比时用的是文本子集 K12-Train-Text(2,267 条);完整集 K12-Train-Full 含多模态共 7,335 条。标题里说的「约 2300 条」,指的就是这个文本子集。
K12-Train 把图转成监督信号,走三条路径:
- 围绕节点写问答(大模型生成):概念定义/公式、技能步骤、实验仪器与结论、习题推理链;
- 围绕关系写问答(大模型生成):强制回答「为何 A 属于 B」「为何必须先学 A」「实验如何验证概念」「插图如何解释或支撑某条关系」等;
- 习题考查问答(模板填充):对考查概念/技能的边直接套模板,避免模型改写事实关系。
文本子集里含 450 道带步骤习题、356 道考查边、695 道节点问答、766 道关系问答;多模态子集 5,068 条全部依赖插图或视觉元素,并按边置信度筛选。生成前会裁掉无关属性、过滤低置信边,生成后再做格式与非空校验,降低把图里噪声写进训练集的风险。
对比实验故意把样本量压到同一量级:从 OpenHermes、Infinity、UltraChat、WizardLM、DataFlow、LMSYS、SmolTalk、Tulu-3 各随机抽约 2,300 条,与 K12-Train-Text 对齐,在 Qwen3-4B-Base 与 Llama3.1-8B-Base 上做全参数微调,学习率与训练轮次完全一致。

在 GaokaoBench 上:
- Qwen3-4B-Base + K12-Train-Text 总分 1009.96,超过最强基线 DataFlow(985.91)+24.1;客观题得分率 81.8%,主观题 89.5%,也是同组最高。
- Llama3.1-8B-Base + K12-Train-Text 总分 625.49,超过最强基线 WizardLM(593.08)+32.4;客观题得分率 41.0% 同样最高。
相对两家官方 Instruct 变体,增益更大(论文报告 +114.6 / +221.0),说明「通用指令风格」补不上课程结构监督。EduEval 上方向一致:两个骨干的平均分也都是等量配置里最高(66.76 / 40.90),只是涨幅小于高考卷。
旁证是跨学科表现:训练数据只来自数理化生子图,语文却拿到同组最高分(120.18),人文数学也是最高(132.00)。语文卷更依赖阅读与表达结构,并不依赖数理化事实;更可能是学会了「按关系组织答案」,而不是背到了语文知识点。
多模态:文本与视觉要一起喂
视觉-语言模型实验改用 Qwen3.5-2B-Base,比较完整集、只训文本、只训多模态,以及完整体量的 DataFlow(约 1 万)与 WizardLM(约 14 万)。评测轴是 Gaokao-MM、MDK12-medium、K12Vista。

Gaokao-MM 上,K12-Train-Full 总体准确率 39.9%,相对基座 +7.5 个百分点,相对官方 Instruct +3.8;并同时高于只训文本或只训多模态的变体。MDK12-medium 上完整集平均 52.94,超过最强非 K12 基线 DataFlow 约 1.66 分。

K12Vista 很挑刺:未微调的基座已经很强(平均 79.72)。多数通用微调反而掉点;只有完整集小幅升到 79.95,并在选择、填空、开放问答三种格式上同时最好。单训文本或单训多模态都会伤到这套已有能力:文字里的课程结构,和插图里的对象对应关系,需要一起学。
论文把有效原因归结为两点:每条样本都写明知识点之间的关系,而不只是孤立事实句;训练内容的顺序与关系又和人教版一致,和下游教育基准更合拍。边界也清楚:资源锚定中国人教版数理化生;评测时不给模型看图谱,考的是闭卷是否真懂结构;多模态增益主要在小参数视觉-语言模型上验证,换骨干与换教材体系仍需另证。
图谱、基准、训练数据与完整构建流水线均已开源。对想做课辅、自适应学习路径或教材级检索的人来说,值得先跑一遍 K12-Bench:如果模型连「学 B 之前必须先会哪些」都凑不齐,再堆刷题数据,多半只会更会用技巧答题,还是不懂知识点怎么串起来。
JOTO 企业落地观察
- 课程结构知识图谱的构建方法论(如教材 OCR→结构化抽取→拓扑校验→人工复核)可直接迁移至企业内部制度文档、SOP 或产品手册的知识工程流程,尤其适用于需严格遵循层级与依赖关系的合规性知识管理场景。
- 将知识图谱同时用于评测与训练的设计,提示企业在构建领域 RAG 系统时,不应仅关注向量召回精度,还需配套结构化验证机制——例如用图谱生成的逻辑一致性测试题,定期检验检索增强回答是否违背业务规则依赖链。
- K12-KGraph 中「先修边」「实验验证边」等强语义关系的显式建模,对企业智能体(Agent)的任务分解能力具有直接参考价值:当 Agent 需执行多步骤操作时,其规划模块必须识别并尊重前置条件约束,而非仅依赖语言模型的隐式推断。
- 多模态组件强调插图与视觉元素的语义锚定,对企业部署工业设备维修、医疗影像辅助诊断等图文协同场景提出关键提醒:纯文本知识图谱无法支撑视觉证据链推理,需在知识建模阶段即统一纳入图像区域标注与跨模态关系定义。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


