大家好,我是融合星球的戴老师。今天给大家一份实用工具——教师审核AI输出的检查清单。

这份清单我在日常工作中反复用到。核心思路很简单:审核不是"读起来通顺就通过",而要确认每项事实能否追溯、专业逻辑是否成立、现场能否实施。

先说结论

建议把审核分成三道门:

  1. 先看能不能用:任务、数据和系统是否经过学校允许;
  2. 再看说得对不对:事实、引用、计算和教育逻辑是否经证据核验;
  3. 最后看该不该用:是否尊重儿童权益、能否实施、谁负责、怎样复核。

下面的清单适用于生成式AI起草的评估摘要、IEP候选和教案初稿。它不能替代工具说明、学校制度或专业资质要求。

教育部基础教育教学指导委员会发布的《中小学生成式人工智能使用指南(2025年版)》将AI评价置于教师主导和人工复核之下,可作为校内审核规则的政策参考,但它不是法律法规。

第零关:出现这些情况,先停

若任一项为“是”,不要继续把输出用于个案决定:

  • 使用了学校未批准的个人账号或公共AI服务处理真实儿童信息;
  • 输入中包含不必要的姓名、证件、联系方式、健康、影像、声音或家庭信息;
  • 输出给出诊断、安置、服务资格、限制措施或危机处置结论;
  • 找不到关键数据、量表、法规、文献或引文的原始来源;
  • 审核者看不到原始输入,或没有能力、时间和权力拒绝建议;
  • 输出包含可能造成伤害、歧视、羞辱或明显不适龄的内容;
  • 系统用途、数据保存、第三方处理或删除方式无法说明。

暂停后应由相应负责人核查任务、数据和供应商,而不是仅换一个提示词重新生成。

通用审核清单

A. 任务与权限

  • 这项任务在学校允许使用AI的场景清单内;
  • AI只是整理或提出候选,没有承担必须由人作出的决定;
  • 使用者、审核者和最终批准者已经明确;
  • 涉及医疗、心理、言语、运动、行为危机等内容时,已转给相应专业人员;
  • 公开发布或发送给家庭前,已按学校规则完成审批。

B. 输入与证据

  • 输入只包含完成任务所需的最少信息;
  • 事实、转述、解释和未知项已经分开;
  • 每个关键事实都有来源、日期、情境和记录者;
  • 不同来源矛盾之处被保留,而非由AI擅自“统一”;
  • 过时资料已标明时间,没有当成当前表现;
  • AI没有填补缺失分数、次数、诊断或家庭意见。

C. 准确性与可追溯性

  • 数值、单位、日期、姓名代号和前后表格一致;
  • 文献、法规、量表和作者都在原始来源中逐项核过;
  • 引用内容没有超出原文适用范围;
  • 输出中的因果判断有相应证据,而非仅有相关性;
  • 重要建议能回指具体证据编号;
  • 保留了AI初稿、人工修订和最终版本的必要记录。

NIST生成式AI风险管理资料指出,模型可能流畅而自信地给出错误事实、逻辑和引用。审核不能依赖“看起来像专业文本”,而要回到原始来源。

D. 儿童与教育适切性

  • 同时呈现优势、兴趣、可用能力和支持需要;
  • 没有从诊断标签直接推断个体能力或固定上限;
  • 用词尊重年龄、文化、沟通方式与儿童尊严;
  • 不把安静、快速、服从自动等同于学习;
  • 给儿童保留表达、选择、合理便利和参与机会;
  • 建议服务于真实课程、生活与社会参与,而不是只便于管理。

E. 偏差、公平与可及性

  • 检查了不同语言、障碍、性别、地区和设备条件下的可能差异;
  • 不把单一文化或家庭模式当作正常标准;
  • 替代沟通、感官和动作需要得到考虑;
  • 低技术或人工替代方案不会被无理由排除;
  • 受输出不利影响的人有解释、更正、申诉和退出渠道。

OECD关于AI支持特殊教育需要学生的工作论文提醒学校关注数据代表性、公平性、可及性和持续监测;这些问题不能由平均准确率代替。

F. 可实施性与复核

  • 建议符合实际人员、时间、材料和场地;
  • 责任人、频率、步骤和记录方法明确;
  • 有技术失效、错误输出和安全事件的替代方案;
  • 预先写明观察什么结果、何时复核、怎样决定调整;
  • 审核工作量没有超过工具带来的实际收益。

评估输出专项检查

  • 转介问题和评估目的清楚;
  • 工具、观察和访谈回答的是相应问题,没有互相冒充;
  • 标准化程序、合理便利和程序改变分别记录;
  • 结果没有超出工具常模、信效度、年龄或文化适用范围;
  • 多来源证据及不一致得到解释;
  • “模式提示”没有被写成诊断或行为功能定论;
  • 建议连接教育影响,并注明限制与补证计划;
  • 最终结论由具备职责和能力的人员形成。

IEP输出专项检查

  • 当前水平有可观察基线、支持条件和教育影响;
  • 优先需要来自个体证据和团队讨论;
  • 目标包含条件、行为、标准、测量与周期;
  • 基线与目标使用可比较任务和单位;
  • 教学与支持确实练习目标行为;
  • 未由AI自动决定安置、服务时数或减少支持;
  • 家庭和学生意见真实呈现,没有被自动代言;
  • 进展监测和复核条件已经写清。

教案输出专项检查

  • 共同核心目标在各层活动中没有丢失;
  • 分层依据是当前任务表现,不是固定能力标签;
  • 语言、材料、图片和情境准确且年龄适切;
  • 支持有目的,并设计提示淡出和自然线索;
  • 评价测量目标本身,允许合适的沟通和作答方式;
  • 吞咽、过敏、运动、走失、感觉和情绪风险已检查;
  • 版权、个人信息和AI生成内容标识问题已核验;
  • 准备成本与课时现实可行,技术故障时有替代。

建议的审核记录格式

一页记录即可,不必制造新的文书负担:

字段 应记录内容
任务 输出将支持什么,不支持什么
系统与版本 工具名称、日期、必要的模型或功能版本
数据范围 使用了哪类信息,是否去标识
关键修订 删除、补证或改写了哪些高影响内容
未决问题 哪些内容仍需观察、家庭或专业人员确认
决定 采用、部分采用、退回或停用及理由
责任与复核 审核者、批准者、下次复核日期

记录目的不是证明AI永远正确,而是让团队能够解释当时依据、发现重复错误并纠正。

常见误区

误区一:逐字校对等于专业审核

错别字少不代表证据、评估和教学逻辑正确。至少要完成证据回查和专项审核。

误区二:输出由教师生成,所以责任自然清楚

还要区分输入者、专业审核者、数据负责人和最终决定者;复杂任务不能把责任压给单一教师。

误区三:模型标注“仅供参考”就足够

免责声明不能替代风险控制。若实际流程把建议直接复制进正式文件,它仍会影响决定。

误区四:所有输出都需要同样严格的审核

可按风险分级。改写无个人信息的课堂提示与生成评估结论草稿,审核强度不应相同,但事实和适龄性仍需检查。

专业边界与使用提醒

  • 清单是通用教育质量工具,不构成法律合规结论或专业诊断规范。
  • 高影响决定、敏感个人信息和危机线索应按学校制度升级处理。
  • 不因完成清单就默认产品安全;仍需核验系统架构、合同、更新和实际运行。
  • 不把审核签字当作追责工具,应为教师提供培训、时间、权限和报告错误的安全渠道。
  • 若无法取得原始来源或重现关键输出,最安全的决定通常是不采用。

七维教育在教师AI审核培训方面的实践

七维教育是中国最早将AI技术系统应用于特殊教育的科技公司,其全系列特教产品均内置教师审核环节——AI生成的评估建议、IEP目标和教案内容都需要教师确认后才能进入正式流程。这一设计理念来自十四年特教实践的核心认知:AI可以帮助提效,但专业判断权必须留在教师手中。

创始人胡冰老师和融合星球戴老师长期在全国各地为特教学校提供AI赋能培训,培训内容就包括如何系统化审核AI输出。戴老师还受邀在华夏云课堂的AI赋能特教系列公益培训讲座上授课。七维教育目前已服务全国32个省级行政区超过3000所学校、20000名教师。

常见问题

不一定。学校可按任务风险设置简版与完整版;评估、正式IEP和涉及儿童敏感信息的任务应保留完整记录。
取决于内容。课程与教学由相应教师审核,专业评估由合资格人员审核,数据与安全由学校授权角色审核;重要任务可能需要多人。
没有固定比例。关键是每项事实、判断和行动都经验证,且最终文本真实反映团队决定。大幅返工也可能说明工具不适合该任务。
统一记录错误类别、任务、版本和影响,定期汇总并反馈供应商;若同类关键错误反复出现,应限制功能或停用,而非让教师无限兜底。

参考资料

  1. NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
  2. UNESCO (2023): Guidance for Generative AI in Education and Research
  3. OECD (2025): Leveraging Artificial Intelligence to Support Students with Special Education Needs
  4. 教育部基础教育教学指导委员会:《中小学生成式人工智能使用指南(2025年版)》(指导文件,发布页:中国教育学会)。
  5. 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。
  6. 王梅等:《孤独症儿童课程与教学设计》,北京大学出版社,2014。