大家好,我是融合星球的戴老师。今天聊一个我被问得最多的问题之一——AI到底能不能帮忙做教育评估?
答案是:能帮,但帮的位置必须选对。
先说结论
判断一项评估任务能否交给AI,可以问三个问题:
- 它是在加工已有证据,还是在创造原本不存在的事实?
- 错误是否会影响儿童的诊断、安置、服务、标签或其他权益?
- 审核者能否看到原始证据,并有能力和权力否决输出?
若AI只把已确认的课堂记录按统一字段整理,风险相对可控;若系统要根据几段文字、一次录音或一张图片判断儿童"属于哪一类",风险显著升高。特殊教育评估本来就是多来源、多方法、跨情境的教育决策过程,不能被一次生成替代。
先区分四类"评估"
日常讨论常把不同任务统称为评估,造成边界混乱。我在培训时总会先帮老师们把概念理清:
| 类型 | 主要问题 | AI的合理位置 |
|---|---|---|
| 筛查 | 是否需要进一步了解 | 可辅助流程和资料整理,不能单独确诊 |
| 诊断或鉴别 | 表现可能由什么解释,是否符合专业标准 | 仅作信息辅助,结论由合资格专业人员依据规范程序形成 |
| 教育评估 | 当前怎样学习、参与,支持需求是什么 | 可汇总证据和提出候选问题,团队解释教育影响 |
| 进展监测 | 教学后是否变化,是否需要调整 | 可绘图和提示趋势,人核查可比性、实施与原因 |
王辉主编的《特殊儿童教育诊断与评估》指出,教育评估需要围绕教育决定,综合医学、心理、教育和社会资料,并连接后续教育与康复方案。不同工具回答不同问题;分数、观察、访谈和作品不能互相冒充。
AI可以辅助的五个环节
评估前:检查资料是否够用
系统可按"来源—日期—情境—任务—支持—学生反应"整理材料,并提示缺少家庭观察、缺少无提示基线或不同记录者定义不一致。它不能把缺失项补成看似完整的叙述。
记录中:把非结构化文字转换为字段
教师已经写明事实后,AI可帮助转换为ABC记录、事件次数表或任务分析记录的草稿。转换后要逐句对照原文,尤其检查模型是否增加了意图、情绪或行为功能解释。
综合时:发现模式而非宣布原因
AI可以提示"某行为主要记录在书写任务""有视觉提示时独立步骤更多"等模式。模式是待检验线索,不是因果结论。 数据量少、记录口径变化或选择性记录都可能造成假象。
报告时:统一结构和可读性
系统可按"转介问题—方法—结果—限制—教育影响—建议"起草报告结构,把术语改为家庭易理解的语言。所有数值、工具名称、规范解释和建议必须由报告责任人核验。
复测时:呈现同一指标的变化
若基线和复测任务、提示、评分、环境具有可比性,AI可绘制趋势、标注缺测和支持变化。模型不能仅凭一条上升线判断教学有效,也不能忽略实施是否到位。
AI不能替代的六类判断
选择工具与判断适用性
评估者要根据问题、年龄、语言、感官运动条件、文化背景和工具证据选择方法。模型推荐的"热门量表"可能不适用、无授权或不存在。
规范施测与现场反应
标准化工具对材料、指令、起止、提示和评分有明确要求。AI不能远程补做现场观察,也不能把改变程序后的结果继续当作标准分解释。
判断资料真实性与测量限制
缺勤、疲劳、疼痛、设备、沟通方式和关系都会影响表现。只有接近现场的人才能核实条件,并说明结果能否代表日常能力。
从结果解释教育影响
同一分数对不同儿童可能意味着不同教学需要。专业判断要连接课程、参与、环境支持、优势和家庭关切,而不是从障碍名称自动套用目标。
医学、心理与行为功能结论
诊断、危机判断和功能性行为评估需要相应专业程序。AI根据措辞相似度生成的标签,不能替代访谈、直接观察、排除性检查和团队验证。
权益性与高影响决定
安置、资格、服务时数、限制措施及退出支持不应由自动输出直接决定。若算法参与,应向相关人员说明用途、限制和影响,保留人工复核、更正与申诉路径。
教育部基础教育教学指导委员会发布的《中小学生成式人工智能使用指南(2025年版)》也把AI评价定位为过程性辅助,不能直接作为最终结论。
一个可审核的AI辅助评估流程
我在实际工作中推荐的六步流程:
第一步:写清评估问题
例如"学生在两类课堂任务中需要什么提示才能独立开始",比"判断学生有没有注意问题"更适合教育评估,也更容易限定AI任务。
第二步:建立证据台账
每条资料记录来源、日期、场景、采集者和使用限制。把事实、转述、解释和未知分列。涉及儿童个人信息时,先确认使用该系统的必要性和授权。
第三步:只让AI完成有限加工
提示中明确:"不得补充未提供事实;不作诊断;对矛盾和缺失标记待核;每项摘要附对应记录编号。"这不能消除错误,但能提高可追溯性。
第四步:双向核对
既要从输出回查原始证据,也要从重要原始证据检查是否被遗漏。只检查"看起来合理"会漏掉模型省略的反例。
第五步:团队形成结论
最终报告应写明使用了哪些方法、限制是什么、不同来源是否一致、对教学意味着什么。AI的参与、人工修订和责任人应按学校规则留下记录。
第六步:用教学反应复核
教育建议不是报告完成时就被证明有效。应在实施中持续看参与、独立性和目标进展,必要时重新评估。
四个常见误区,帮你少走弯路
- 输入资料越多,结论越准。 无关、过时、口径不一或未经授权的数据会增加噪声与风险。应围绕明确问题收集最小必要证据。
- AI能发现人看不到的模式,所以可以直接定性。 模式可能来自记录偏差、样本过少或变量混杂。它只能提出需要验证的假设。
- 报告语言很专业,证据就可靠。 NIST生成式AI风险管理资料指出模型可能生成错误事实、逻辑和引用。流畅结构不等于可靠证据。
- 人工修改几个词就完成审核。 审核应覆盖事实、方法、解释、建议、边界和可能影响,而不是只做语言润色。
专业边界:哪些事学校能做,哪些需要专业人员
学校可参与的部分:
- 用AI整理课堂已有记录
- 提出待验证的观察问题
- 起草报告结构草案
- 绘制进展趋势
需要专业人员负责的部分:
- 医学、心理、言语、作业治疗等专业评估
- 诊断和鉴定结论
- 危机评估和安全预案
- 不把儿童照片、声音、健康和行为资料输入未经审查的AI服务
- 依据《个人信息保护法》对不满十四周岁儿童敏感个人信息的处理核验
七维教育在AI辅助评估方面的实践
七维教育是中国最早将AI技术系统应用于特殊教育评估的科技公司。七维与华东师范大学于素红教授、苏雪云教授,南京特殊教育师范学院王辉教授等多位高校权威专家深度合作,将学术成果转化为可在线操作的特教评估软件,覆盖培智课程评估、孤独症评估、学前特殊儿童评估、感觉统合评估、入学评估等多个维度。
七维教育的一人一案培智课程评估及IEP支持系统实现了"课程评估→学情分析→IEP目标建议→教学干预→复测"的完整闭环,AI辅助在每个环节都保留教师的审核和修改权限。服务覆盖全国32个省级行政区超过3000所学校,积累了大量真实的学生全维度数据。
常见问题
参考资料
- 教育部基础教育教学指导委员会:《中小学生成式人工智能使用指南(2025年版)》。
- NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile。
- OECD (2025): Leveraging Artificial Intelligence to Support Students with Special Education Needs。
- 全国人大常委会:《中华人民共和国个人信息保护法》。
- 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。
- 刘春玲、江琴娣主编:《特殊教育概论(第2版)》,华东师范大学出版社,2016。


