大家好,我是融合星球的戴老师。今天聊一个技术感很强但其实是管理问题的话题——学校怎么建特教AI知识库?

很多学校以为把一堆PDF上传就能让AI准确回答问题。实际上,如果没有来源分级、版本管理、权限控制和审核机制,AI可能把旧政策、教材观点和内部个案记录混成一锅粥。

先说结论

一个可用的学校知识库至少应能回答八个问题:

  1. 这段内容来自哪里,谁发布或撰写?
  2. 学校是否有权复制、切分、索引和向这些用户提供?
  3. 是现行版本、历史版本还是已经失效?
  4. 适用于哪个地区、学段、对象、场景和专业边界?
  5. 是否含有儿童或教职员工个人信息?
  6. 谁审核过,何时复核,哪些内容存在分歧?
  7. 系统检索时能否稳定找到正确版本并显示来源?
  8. 发现错误后怎样更正、通知、回滚和退役?

若这些信息没有随文档进入治理台账,AI可能把旧政策、教材观点、供应商材料和内部个案记录混成语气一致的“答案”。

先区分三样东西

文件库

保存PDF、Word、网页和表格,重点是目录、版本、权限与归档。

可检索知识库

把文档切分、建立索引,并根据查询返回相关片段。它可能使用关键词、向量或混合检索。

生成式问答

模型根据检索片段组织回答。即使检索片段正确,模型仍可能误读、遗漏限定条件或生成不存在的结论。因此“引用了知识库”不能替代答案审核。

NIST生成式AI风险管理资料专门提示虚构内容、数据隐私和第三方供应链风险,并建议验证来源与引用;这些控制同样适用于学校知识库问答。

学校应先把文件和治理做好,再决定是否需要生成式问答。对于固定制度查询,目录、搜索和模板可能已经足够。

第一步:建立来源分级

可按用途设置五级,而不是简单把所有PDF视为同等可靠:

级别 来源示例 主要用途与注意
A 现行法律法规、主管部门正式文件、强制性标准 核对官方发布页、施行日期、适用范围和修订状态
B 国家或行业推荐性标准、官方指南、工具正式手册 区分强制要求、推荐做法和工具规则
C 同行评议研究、权威机构报告、正式教材 核对研究对象、方法、年份、版本与局限
D 经学校批准的课程、流程、表单和教研成果 明确批准者、生效范围、内部版本和责任部门
E 供应商材料、网络文章、培训笔记 只能作线索或产品说明,不直接证明效果与合规

AI生成文本不应作为独立事实来源重新写回知识库,否则会形成“模型生成—入库—再次引用”的循环放大。它可以作为待审草稿,但必须保留原始依据和人工责任。

第二步:为每个来源建立元数据

至少记录:

  • 标题、作者或发布机构、原始链接或馆藏位置;
  • 文档类型、主题、适用对象和地域;
  • 发布、修订、生效、失效或废止日期;
  • 版本号及与前版的关系;
  • 获取日期和文件校验信息;
  • 权利人、许可范围、使用限制与到期日;
  • 是否包含个人信息、敏感等级和允许用户;
  • 内容审核者、技术处理者、批准者和复核日期;
  • 已知限制、冲突来源和替代版本。

日期字段不能只留“上传时间”。政策发布日、生效日和失效日回答不同问题;历史文件可以保留,但检索时必须明确标为历史,避免被当作当前要求。

第三步:先解决版权与许可,再做索引

“用于教育”不意味着可以任意复制整本教材、题库、量表或付费数据库。学校需要判断:

  • 文件是否属于公有领域、开放许可、学校自有或已获授权;
  • 许可是否允许数字化、切分、索引、内部共享和生成式使用;
  • 是否限制用户数量、地点、期限、下载或衍生内容;
  • 引用是否需要标明作者、作品和版本;
  • 第三方图片、量表条目、试题和附件是否另有权利。

《著作权法》对权利、法定许可和合理使用有具体条件,不能把某一例外概括为“校内都能用”。不确定时,只保存书目信息和经许可的必要摘录,并向权利或法务负责人确认。

第四步:个人信息默认不进入通用知识库

个案评估、IEP、行为记录、影像和家庭信息不应与面向全校的法规、教材和教研知识混在同一索引。若确有必要支持受控个案工作,应采用独立空间,并完成:

  • 明确目的和最小字段;
  • 去除不必要标识,评估组合识别风险;
  • 按角色限制到具体个案或班级;
  • 分开训练、测试和生产环境;
  • 设置最短保存期、访问日志和导出控制;
  • 任务结束后的归档或删除规则;
  • 对外部模型、子处理者和跨境进行专门核验。

《个人信息保护法》把不满十四周岁未成年人的个人信息列为敏感个人信息。知识库“只是检索”并不改变收集、存储、使用、提供等个人信息处理事实。

第五步:专业审核内容与切分

审核不仅看原文是否可靠,还要看系统怎样切分。若把“不得”“除外”“仅适用于”与后文拆开,检索片段可能反转原意。

建议流程:

  1. 内容责任人确认来源、版本、范围和重要限定;
  2. 技术人员按标题、条款、表格和语义边界切分;
  3. 保留章节层级、页码或条款号及原文链接;
  4. 专业人员抽查切分后的片段是否完整;
  5. 对高风险内容设置更大上下文或只返回原文;
  6. 生成摘要时把摘要与原文分层存储,不用摘要覆盖来源。

量表计分规则、诊断标准、危机处置和法律条文属于高风险内容,必要时禁止生成式改写,只提供授权人员可见的原文定位和专业转介。

第六步:设计分级权限

权限应同时控制“能搜索什么”和“能做什么”:

  • 普通教师可查经过批准的通用课程与学校流程;
  • 个案团队只访问职责范围内的学生材料;
  • 内容编辑者可提交更新,但不能自行批准;
  • 专业审核者负责相应学科或服务边界;
  • 系统管理员维护技术,不因管理权限默认浏览全部内容;
  • 导出、批量下载、共享链接和接口调用单独授权。

避免共享账号。人员调岗、离职、学生转学和项目结束时应及时回收权限,并定期检查长期未用和异常访问。

第七步:用测试问题验证检索命中

上线前建立一组可重复的“金标准问题”,覆盖:

  • 可以从单一现行来源直接回答的问题;
  • 需要同时读取多个来源的问题;
  • 新旧版本容易混淆的问题;
  • 来源互相冲突、应呈现差异的问题;
  • 超出知识库范围、正确结果应是“不知道”的问题;
  • 常见错别字、简称和不同教师表达;
  • 不同权限用户询问同一问题。

不要只看回答像不像。分别评估:

  1. 是否检索到正确来源和正确版本;
  2. 关键限定是否完整;
  3. 引用能否打开并定位;
  4. 回答是否忠于片段;
  5. 无充分证据时是否拒绝推断;
  6. 其他权限内容是否意外泄露。

上线后持续记录未命中、误命中、旧版命中、引用错误和人工纠正。知识库规模扩大不一定提高质量,可能增加相似片段冲突。

第八步:建立更新、纠错与退役机制

每类来源设复核频率和触发事件:

  • 法规、政策、标准发布修订、施行或废止;
  • 课程方案、学校制度和人员职责变化;
  • 工具手册、常模、产品或模型版本变化;
  • 发现高影响错误、版权问题或数据事件;
  • 专业团队对内容形成新共识。

更正时不要直接覆盖。保留旧版状态、变更原因、生效时间、批准者和受影响回答范围;必要时通知曾使用错误内容的人员。退役文档应从默认检索中移除,但按档案规则保留可追溯记录。索引、缓存和生成摘要也要同步更新。

一个最小治理分工

角色 核心责任
内容负责人 确认来源、适用范围、版本与专业准确性
权利与数据负责人 核验许可、个人信息、共享和保存
技术负责人 切分、索引、权限、日志、备份和回滚
一线使用者 报告未命中、错误和工作流影响
批准者 决定上线、限制、暂停和退役

小规模学校可以一人兼任多个角色,但审核与批准不宜完全由同一人无复核地完成高风险内容。

常见误区

误区一:只收权威文件就不会出错

权威来源也有版本、适用范围和历史状态;切分或生成过程仍可能丢失限定。

误区二:文档越多,回答越专业

重复、冲突和过时文档会降低检索质量。应围绕真实任务建立有限、可维护的集合。

误区三:显示引用就代表可追溯

引用若只指向首页、错误页码或与结论无关的片段,仍不可验证。

误区四:权限只要按部门设置

部门内也可能存在个案和角色边界。应结合职责、具体对象、操作类型和时间限制。

专业边界与使用提醒

  • 本文是知识治理通用框架,不构成著作权、个人信息或档案管理的具体法律意见。
  • 未经授权不要把完整教材、量表、试题库和付费资源批量导入模型或向全校开放。
  • 个案数据与通用知识应分区、分权、分期管理;简单换代号不能自动消除识别风险。
  • 知识库回答不替代诊断、危机处置、安置、IEP和其他高影响专业决定。
  • 无来源、来源冲突、版本不明或超出权限时,系统应明确拒答并引导查证。

七维教育在特教AI知识库方面的实践

七维教育的特教AI伙伴是国内首个特殊教育类AI智能体平台,其核心能力之一就是基于经过专业审核的特教知识库提供智能问答。七维教育在知识库建设中积累了丰富的治理经验——来源分级、版本管理、权限控制、检索测试和纠错退役,每一步都经过了3000多所学校的实践验证。

七维教育AI服务使用人次已突破100万,这些真实使用数据帮助团队持续优化知识库的检索质量和回答准确性。在知识库治理方面,七维团队坚持一个原则:宁可回答"不确定",也不让AI编造看似专业的错误结论。

常见问题

不一定。若资料少、结构明确,文件目录、全文搜索和人工维护可能更简单可靠。技术应由任务和规模决定。
先核验作者、原始出处、权利和质量。网络转载页可作线索,但应尽量回到官方文件、原始研究或正式出版物。
按来源风险设置周期,并配置事件触发。法律、学校制度和危机流程变化应及时处理;低风险背景资料可定期复核。
没有足够来源、来源冲突未解决、问题超出适用对象或用户权限不足时,都应拒绝给出确定结论,并说明需要哪类证据或人员。
不宜无记录直接修改。应提交来源与影响,经过相应审核、批准、版本更新和索引刷新,再通知受影响用户。

参考资料

  1. 全国人大常委会:《中华人民共和国著作权法》
  2. 全国人大常委会:《中华人民共和国个人信息保护法》
  3. NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
  4. UNESCO (2023): Guidance for Generative AI in Education and Research
  5. UNICEF (2025): Guidance on AI and Children, Version 3
  6. 教育部基础教育教学指导委员会:《中小学生成式人工智能使用指南(2025年版)》(指导文件,发布页:中国教育学会)。
  7. 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。