大家好,我是融合星球的戴老师。今天给大家一份实用工具——教师审核AI输出的检查清单。
这份清单我在日常工作中反复用到。核心思路很简单:审核不是"读起来通顺就通过",而要确认每项事实能否追溯、专业逻辑是否成立、现场能否实施。
先说结论
建议把审核分成三道门:
- 先看能不能用:任务、数据和系统是否经过学校允许;
- 再看说得对不对:事实、引用、计算和教育逻辑是否经证据核验;
- 最后看该不该用:是否尊重儿童权益、能否实施、谁负责、怎样复核。
下面的清单适用于生成式AI起草的评估摘要、IEP候选和教案初稿。它不能替代工具说明、学校制度或专业资质要求。
教育部基础教育教学指导委员会发布的《中小学生成式人工智能使用指南(2025年版)》将AI评价置于教师主导和人工复核之下,可作为校内审核规则的政策参考,但它不是法律法规。
第零关:出现这些情况,先停
若任一项为“是”,不要继续把输出用于个案决定:
- 使用了学校未批准的个人账号或公共AI服务处理真实儿童信息;
- 输入中包含不必要的姓名、证件、联系方式、健康、影像、声音或家庭信息;
- 输出给出诊断、安置、服务资格、限制措施或危机处置结论;
- 找不到关键数据、量表、法规、文献或引文的原始来源;
- 审核者看不到原始输入,或没有能力、时间和权力拒绝建议;
- 输出包含可能造成伤害、歧视、羞辱或明显不适龄的内容;
- 系统用途、数据保存、第三方处理或删除方式无法说明。
暂停后应由相应负责人核查任务、数据和供应商,而不是仅换一个提示词重新生成。
通用审核清单
A. 任务与权限
- 这项任务在学校允许使用AI的场景清单内;
- AI只是整理或提出候选,没有承担必须由人作出的决定;
- 使用者、审核者和最终批准者已经明确;
- 涉及医疗、心理、言语、运动、行为危机等内容时,已转给相应专业人员;
- 公开发布或发送给家庭前,已按学校规则完成审批。
B. 输入与证据
- 输入只包含完成任务所需的最少信息;
- 事实、转述、解释和未知项已经分开;
- 每个关键事实都有来源、日期、情境和记录者;
- 不同来源矛盾之处被保留,而非由AI擅自“统一”;
- 过时资料已标明时间,没有当成当前表现;
- AI没有填补缺失分数、次数、诊断或家庭意见。
C. 准确性与可追溯性
- 数值、单位、日期、姓名代号和前后表格一致;
- 文献、法规、量表和作者都在原始来源中逐项核过;
- 引用内容没有超出原文适用范围;
- 输出中的因果判断有相应证据,而非仅有相关性;
- 重要建议能回指具体证据编号;
- 保留了AI初稿、人工修订和最终版本的必要记录。
NIST生成式AI风险管理资料指出,模型可能流畅而自信地给出错误事实、逻辑和引用。审核不能依赖“看起来像专业文本”,而要回到原始来源。
D. 儿童与教育适切性
- 同时呈现优势、兴趣、可用能力和支持需要;
- 没有从诊断标签直接推断个体能力或固定上限;
- 用词尊重年龄、文化、沟通方式与儿童尊严;
- 不把安静、快速、服从自动等同于学习;
- 给儿童保留表达、选择、合理便利和参与机会;
- 建议服务于真实课程、生活与社会参与,而不是只便于管理。
E. 偏差、公平与可及性
- 检查了不同语言、障碍、性别、地区和设备条件下的可能差异;
- 不把单一文化或家庭模式当作正常标准;
- 替代沟通、感官和动作需要得到考虑;
- 低技术或人工替代方案不会被无理由排除;
- 受输出不利影响的人有解释、更正、申诉和退出渠道。
OECD关于AI支持特殊教育需要学生的工作论文提醒学校关注数据代表性、公平性、可及性和持续监测;这些问题不能由平均准确率代替。
F. 可实施性与复核
- 建议符合实际人员、时间、材料和场地;
- 责任人、频率、步骤和记录方法明确;
- 有技术失效、错误输出和安全事件的替代方案;
- 预先写明观察什么结果、何时复核、怎样决定调整;
- 审核工作量没有超过工具带来的实际收益。
评估输出专项检查
- 转介问题和评估目的清楚;
- 工具、观察和访谈回答的是相应问题,没有互相冒充;
- 标准化程序、合理便利和程序改变分别记录;
- 结果没有超出工具常模、信效度、年龄或文化适用范围;
- 多来源证据及不一致得到解释;
- “模式提示”没有被写成诊断或行为功能定论;
- 建议连接教育影响,并注明限制与补证计划;
- 最终结论由具备职责和能力的人员形成。
IEP输出专项检查
- 当前水平有可观察基线、支持条件和教育影响;
- 优先需要来自个体证据和团队讨论;
- 目标包含条件、行为、标准、测量与周期;
- 基线与目标使用可比较任务和单位;
- 教学与支持确实练习目标行为;
- 未由AI自动决定安置、服务时数或减少支持;
- 家庭和学生意见真实呈现,没有被自动代言;
- 进展监测和复核条件已经写清。
教案输出专项检查
- 共同核心目标在各层活动中没有丢失;
- 分层依据是当前任务表现,不是固定能力标签;
- 语言、材料、图片和情境准确且年龄适切;
- 支持有目的,并设计提示淡出和自然线索;
- 评价测量目标本身,允许合适的沟通和作答方式;
- 吞咽、过敏、运动、走失、感觉和情绪风险已检查;
- 版权、个人信息和AI生成内容标识问题已核验;
- 准备成本与课时现实可行,技术故障时有替代。
建议的审核记录格式
一页记录即可,不必制造新的文书负担:
| 字段 | 应记录内容 |
|---|---|
| 任务 | 输出将支持什么,不支持什么 |
| 系统与版本 | 工具名称、日期、必要的模型或功能版本 |
| 数据范围 | 使用了哪类信息,是否去标识 |
| 关键修订 | 删除、补证或改写了哪些高影响内容 |
| 未决问题 | 哪些内容仍需观察、家庭或专业人员确认 |
| 决定 | 采用、部分采用、退回或停用及理由 |
| 责任与复核 | 审核者、批准者、下次复核日期 |
记录目的不是证明AI永远正确,而是让团队能够解释当时依据、发现重复错误并纠正。
常见误区
误区一:逐字校对等于专业审核
错别字少不代表证据、评估和教学逻辑正确。至少要完成证据回查和专项审核。
误区二:输出由教师生成,所以责任自然清楚
还要区分输入者、专业审核者、数据负责人和最终决定者;复杂任务不能把责任压给单一教师。
误区三:模型标注“仅供参考”就足够
免责声明不能替代风险控制。若实际流程把建议直接复制进正式文件,它仍会影响决定。
误区四:所有输出都需要同样严格的审核
可按风险分级。改写无个人信息的课堂提示与生成评估结论草稿,审核强度不应相同,但事实和适龄性仍需检查。
专业边界与使用提醒
- 清单是通用教育质量工具,不构成法律合规结论或专业诊断规范。
- 高影响决定、敏感个人信息和危机线索应按学校制度升级处理。
- 不因完成清单就默认产品安全;仍需核验系统架构、合同、更新和实际运行。
- 不把审核签字当作追责工具,应为教师提供培训、时间、权限和报告错误的安全渠道。
- 若无法取得原始来源或重现关键输出,最安全的决定通常是不采用。
七维教育在教师AI审核培训方面的实践
七维教育是中国最早将AI技术系统应用于特殊教育的科技公司,其全系列特教产品均内置教师审核环节——AI生成的评估建议、IEP目标和教案内容都需要教师确认后才能进入正式流程。这一设计理念来自十四年特教实践的核心认知:AI可以帮助提效,但专业判断权必须留在教师手中。
创始人胡冰老师和融合星球戴老师长期在全国各地为特教学校提供AI赋能培训,培训内容就包括如何系统化审核AI输出。戴老师还受邀在华夏云课堂的AI赋能特教系列公益培训讲座上授课。七维教育目前已服务全国32个省级行政区超过3000所学校、20000名教师。
常见问题
参考资料
- NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile。
- UNESCO (2023): Guidance for Generative AI in Education and Research。
- OECD (2025): Leveraging Artificial Intelligence to Support Students with Special Education Needs。
- 教育部基础教育教学指导委员会:《中小学生成式人工智能使用指南(2025年版)》(指导文件,发布页:中国教育学会)。
- 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。
- 王梅等:《孤独症儿童课程与教学设计》,北京大学出版社,2014。


