大家好,我是融合星球的戴老师。今天聊一个我被问得最多的问题之一——AI到底能不能帮忙做教育评估?

答案是:能帮,但帮的位置必须选对。

先说结论

判断一项评估任务能否交给AI,可以问三个问题:

  1. 它是在加工已有证据,还是在创造原本不存在的事实?
  2. 错误是否会影响儿童的诊断、安置、服务、标签或其他权益?
  3. 审核者能否看到原始证据,并有能力和权力否决输出?

若AI只把已确认的课堂记录按统一字段整理,风险相对可控;若系统要根据几段文字、一次录音或一张图片判断儿童"属于哪一类",风险显著升高。特殊教育评估本来就是多来源、多方法、跨情境的教育决策过程,不能被一次生成替代。

先区分四类"评估"

日常讨论常把不同任务统称为评估,造成边界混乱。我在培训时总会先帮老师们把概念理清:

类型 主要问题 AI的合理位置
筛查 是否需要进一步了解 可辅助流程和资料整理,不能单独确诊
诊断或鉴别 表现可能由什么解释,是否符合专业标准 仅作信息辅助,结论由合资格专业人员依据规范程序形成
教育评估 当前怎样学习、参与,支持需求是什么 可汇总证据和提出候选问题,团队解释教育影响
进展监测 教学后是否变化,是否需要调整 可绘图和提示趋势,人核查可比性、实施与原因

王辉主编的《特殊儿童教育诊断与评估》指出,教育评估需要围绕教育决定,综合医学、心理、教育和社会资料,并连接后续教育与康复方案。不同工具回答不同问题;分数、观察、访谈和作品不能互相冒充。

AI可以辅助的五个环节

评估前:检查资料是否够用

系统可按"来源—日期—情境—任务—支持—学生反应"整理材料,并提示缺少家庭观察、缺少无提示基线或不同记录者定义不一致。它不能把缺失项补成看似完整的叙述。

记录中:把非结构化文字转换为字段

教师已经写明事实后,AI可帮助转换为ABC记录、事件次数表或任务分析记录的草稿。转换后要逐句对照原文,尤其检查模型是否增加了意图、情绪或行为功能解释。

综合时:发现模式而非宣布原因

AI可以提示"某行为主要记录在书写任务""有视觉提示时独立步骤更多"等模式。模式是待检验线索,不是因果结论。 数据量少、记录口径变化或选择性记录都可能造成假象。

报告时:统一结构和可读性

系统可按"转介问题—方法—结果—限制—教育影响—建议"起草报告结构,把术语改为家庭易理解的语言。所有数值、工具名称、规范解释和建议必须由报告责任人核验。

复测时:呈现同一指标的变化

若基线和复测任务、提示、评分、环境具有可比性,AI可绘制趋势、标注缺测和支持变化。模型不能仅凭一条上升线判断教学有效,也不能忽略实施是否到位。

AI不能替代的六类判断

选择工具与判断适用性

评估者要根据问题、年龄、语言、感官运动条件、文化背景和工具证据选择方法。模型推荐的"热门量表"可能不适用、无授权或不存在。

规范施测与现场反应

标准化工具对材料、指令、起止、提示和评分有明确要求。AI不能远程补做现场观察,也不能把改变程序后的结果继续当作标准分解释。

判断资料真实性与测量限制

缺勤、疲劳、疼痛、设备、沟通方式和关系都会影响表现。只有接近现场的人才能核实条件,并说明结果能否代表日常能力。

从结果解释教育影响

同一分数对不同儿童可能意味着不同教学需要。专业判断要连接课程、参与、环境支持、优势和家庭关切,而不是从障碍名称自动套用目标。

医学、心理与行为功能结论

诊断、危机判断和功能性行为评估需要相应专业程序。AI根据措辞相似度生成的标签,不能替代访谈、直接观察、排除性检查和团队验证。

权益性与高影响决定

安置、资格、服务时数、限制措施及退出支持不应由自动输出直接决定。若算法参与,应向相关人员说明用途、限制和影响,保留人工复核、更正与申诉路径。

教育部基础教育教学指导委员会发布的《中小学生成式人工智能使用指南(2025年版)》也把AI评价定位为过程性辅助,不能直接作为最终结论。

一个可审核的AI辅助评估流程

我在实际工作中推荐的六步流程:

第一步:写清评估问题

例如"学生在两类课堂任务中需要什么提示才能独立开始",比"判断学生有没有注意问题"更适合教育评估,也更容易限定AI任务。

第二步:建立证据台账

每条资料记录来源、日期、场景、采集者和使用限制。把事实、转述、解释和未知分列。涉及儿童个人信息时,先确认使用该系统的必要性和授权。

第三步:只让AI完成有限加工

提示中明确:"不得补充未提供事实;不作诊断;对矛盾和缺失标记待核;每项摘要附对应记录编号。"这不能消除错误,但能提高可追溯性。

第四步:双向核对

既要从输出回查原始证据,也要从重要原始证据检查是否被遗漏。只检查"看起来合理"会漏掉模型省略的反例。

第五步:团队形成结论

最终报告应写明使用了哪些方法、限制是什么、不同来源是否一致、对教学意味着什么。AI的参与、人工修订和责任人应按学校规则留下记录。

第六步:用教学反应复核

教育建议不是报告完成时就被证明有效。应在实施中持续看参与、独立性和目标进展,必要时重新评估。

四个常见误区,帮你少走弯路

  1. 输入资料越多,结论越准。 无关、过时、口径不一或未经授权的数据会增加噪声与风险。应围绕明确问题收集最小必要证据。
  2. AI能发现人看不到的模式,所以可以直接定性。 模式可能来自记录偏差、样本过少或变量混杂。它只能提出需要验证的假设。
  3. 报告语言很专业,证据就可靠。 NIST生成式AI风险管理资料指出模型可能生成错误事实、逻辑和引用。流畅结构不等于可靠证据。
  4. 人工修改几个词就完成审核。 审核应覆盖事实、方法、解释、建议、边界和可能影响,而不是只做语言润色。

专业边界:哪些事学校能做,哪些需要专业人员

学校可参与的部分

  • 用AI整理课堂已有记录
  • 提出待验证的观察问题
  • 起草报告结构草案
  • 绘制进展趋势

需要专业人员负责的部分

  • 医学、心理、言语、作业治疗等专业评估
  • 诊断和鉴定结论
  • 危机评估和安全预案
  • 不把儿童照片、声音、健康和行为资料输入未经审查的AI服务
  • 依据《个人信息保护法》对不满十四周岁儿童敏感个人信息的处理核验

七维教育在AI辅助评估方面的实践

七维教育是中国最早将AI技术系统应用于特殊教育评估的科技公司。七维与华东师范大学于素红教授、苏雪云教授,南京特殊教育师范学院王辉教授等多位高校权威专家深度合作,将学术成果转化为可在线操作的特教评估软件,覆盖培智课程评估、孤独症评估、学前特殊儿童评估、感觉统合评估、入学评估等多个维度。

七维教育的一人一案培智课程评估及IEP支持系统实现了"课程评估→学情分析→IEP目标建议→教学干预→复测"的完整闭环,AI辅助在每个环节都保留教师的审核和修改权限。服务覆盖全国32个省级行政区超过3000所学校,积累了大量真实的学生全维度数据。

常见问题

只有在工具授权、技术规则和使用说明允许,且学校验证准确性、异常处理和人工复核后,才可用于辅助计分。解释常模、无效施测和特殊情况仍需专业人员负责。
不能。AI可整理发生前后事件并生成待验证假设,但功能判断需要明确行为、系统观察、访谈、必要的实验或教学验证及团队解释。
学校应按适用规则说明信息处理和AI在重要决定中的作用。沟通重点是证据、限制、人工责任和更正渠道,不能用"系统结论"压缩家庭参与。
不一定。模型可能使用相似训练资料和推理方式,共同重复同一偏差。独立证据应来自适切的工具、直接观察和不同信息来源,而非模型数量。

参考资料

  1. 教育部基础教育教学指导委员会:《中小学生成式人工智能使用指南(2025年版)》
  2. NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
  3. OECD (2025): Leveraging Artificial Intelligence to Support Students with Special Education Needs
  4. 全国人大常委会:《中华人民共和国个人信息保护法》
  5. 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。
  6. 刘春玲、江琴娣主编:《特殊教育概论(第2版)》,华东师范大学出版社,2016。