开发者路线图:如何正确引用、复现与扩展os-taxonomy (Marble Skill Taxonomy)开放教育数据集
【免费下载链接】os-taxonomy项目地址: https://gitcode.com/gh_mirrors/os/os-taxonomy
如果你正在寻找一个开放教育数据集来做学习路径分析、自适应学习产品或教育科研,os-taxonomy(Marble Skill Taxonomy)值得认真看一眼。它把小学阶段"孩子到底学到了什么"拆解成1,590 个微主题(micro-topics)、用3,221 条先修依赖边连成一张有向无环图,并对齐 NGSS、Common Core、英国国家课程等 7 套课程标准。数据为纯 JSON、零运行时依赖,加载即用。本文是一份面向新手开发者的完整路线图:如何读懂它、规范引用它、可复现地校验它,以及合法地扩展它。
🧭 一分钟理解 os-taxonomy 开放教育数据集
与传统"扁平标准清单"不同,os-taxonomy 是一张学习连接图(connected graph of learning),包含四层信息:
| 组成 | 数量 | 说明 |
|---|---|---|
| 微主题(节点) | 1,590 | 每个主题含通俗描述、掌握证据、类型(概念/程序/表征/语言/元认知)、学科+领域、年龄段 |
| 先修依赖(边) | 3,221 | topicId依赖于prerequisiteId,每条边带hard/soft强度与一句原因 |
| 课程标准对齐 | 3,261 条标准 | 覆盖 7 套课程,共 1,859 条主题↔标准链接 |
| 领域聚类 | 183 个 | 按(学科, 领域, 年龄段)生成的家长友好型一段话总结 |
覆盖 8 个学科:Science (547)、Mathematics (503)、English (286)、History (90)、Personal & Social Development (88)、Life Skills (37)、Computing (21)、Learning to Learn (18)。
📁 5 个核心数据文件:从哪里开始读
所有数据位于 data/ 目录,均为 UTF-8 JSON,结构契约见 schema/ 下的 JSON Schema:
- data/topics.json — 微主题(图的节点)。例如 data/topics.json 中的"AI in Daily Life"主题,就带描述、年龄段、3 条掌握证据和评估提示。
- data/dependencies.json — 先修边。记住方向:
topicId依赖于prerequisiteId;想要"解锁了什么"就反转边。 - data/curriculum-standards.json — 来源课程标准,按 curriculum 分组。注意部分来源只含代码(codes-only),见下文复现章节。
- data/clusters.json — 面向家长的领域摘要。
- data/manifest.json — 计数、按学科统计、每个文件的 SHA-256 校验和(复现的锚点)。
📌 正确引用:两步就能做对
第一步:给数据集署名。任何使用都必须带上 README.md 中规定的致谢语:
Marble Skill Taxonomy (v1) · © Generative Spark, Inc. (Marble) · https://withmarble.com · licensed under ODbL 1.0 (database) and CC BY-SA 4.0 (content).
第二步:用正式引文。论文和 BibTeX 场景请直接使用 CITATION.cff,机器可读的引元数据已备好:数据集类型为dataset,版本v1,发布于 2026-07-08,主许可ODbL-1.0。
⚠️ 如果你还使用了课程标准数据,别忘了 PROVENANCE.md 中各上游来源的额外声明要求——这一步最容易漏,也最容易引发版权纠纷。
🔁 可复现地校验数据:一条命令
拿到数据后的第一件事是验证完整性。项目自带一个零依赖校验器scripts/validate.mjs,它会检查:
- 声明计数与实际条目数一致(1,590 / 3,221 / 3,261 / 183)
- 所有边的端点、所有主题→标准引用都能解析(无悬空引用)
- codes-only 不变量:受限来源不泄露原文
- data/manifest.json 中每个文件的 SHA-256 校验和
git clone https://gitcode.com/gh_mirrors/os/os-taxonomy cd os-taxonomy node scripts/validate.mjs # 或 npm run validate输出✓ valid即代表数据与你复现的版本完全一致。把"clone → validate → 记录 commit"写进你的流水线,就拿到了数据集级别的可复现性——这正是开放教育数据集区别于"下载一个 zip 就完事"的关键。
🚀 合法扩展:先看懂三层许可
os-taxonomy 是多许可结构,扩展前务必分清三层(详见 LICENSE 与 LICENSE-CONTENT):
| 层级 | 许可 | 意味着 |
|---|---|---|
| 数据库(结构、ID、主题↔主题/标准关系) | ODbL 1.0 | 可商用+研究,需署名;衍生数据库须继续以 ODbL 开放 |
| Marble 撰写的文本(描述、证据、原因、摘要) | CC BY-SA 4.0 | 署名 + 相同方式共享 |
| curriculum-standards.json | 上游各自许可 | 不可由 Marble 再授权,见 PROVENANCE.md |
关键细节:ODbL 区分"衍生数据库"(你扩展/修改分类法本身 → 必须保持开放)与"生成作品"(把它用在你的产品、模型或 App 里 → 归你所有)。所以你可以基于它构建商业产品而无需开源产品本身,只需把对分类法的改进回馈给数据集。
三个常见扩展方向
- 加入新课程标准:
topic → standard的键格式为<curriculum-slug>:<code>(见 data/curriculum-standards.json),按 schema/curriculum-standards.schema.json 追加即可。若来源有版权(如 NGSS、C3、IB PYP),默认走 codes-only 模式——只放代码,不放原文。 - 新增微主题与依赖:主题 ID 需以
mt_前缀开头(校验器会检查,见 scripts/validate.mjs),依赖边强度只能是hard或soft。 - 重新计算派生物:语义嵌入被刻意排除在发布之外(data/manifest.json 的
excluded字段),你可以自行基于 topics 重新计算,不必等待上游。
✅ 开发者速查清单
- 已读 README.md 的 License 章节
- 已运行
node scripts/validate.mjs并通过 - 产品/论文中已包含规定署名语 + CITATION.cff 引文
- 使用课程标准时已核对 PROVENANCE.md 的上游声明
- 扩展后记录数据集 commit,便于他人复现你的版本
说明:以上清单对应 CHANGELOG.md 记录的 v1 首发内容(2026-07-08),后续版本请以此文件为准追踪变更。
抓住"读懂 → 校验 → 引用 → 扩展"这条路线,你就能把 os-taxonomy 从一份静态 JSON,变成自己产品中可持续演进的学习知识图谱。
【免费下载链接】os-taxonomy项目地址: https://gitcode.com/gh_mirrors/os/os-taxonomy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考