大家好,我是融合星球的戴老师。今天聊一个管理者特别关心的问题——学校想试试特教AI,怎么才能试得明白、退得出来?
我见过不少学校的试点,就是"让几位老师用一用再谈感受"。这不叫试点,这叫体验。真正的试点是一个有目标、有基线、有指标、有退出条件的决策实验。
先说结论
一项合格试点不是“让几位教师用一用再谈感受”,而是一个有限的决策实验。开始前应形成一页方案:
- 要解决的问题与受益者;
- 当前流程与基线;
- AI做什么、明确不做什么;
- 参与者、期限、数据范围和责任人;
- 比较方案与评价指标;
- 红线、暂停、退出和数据处置;
- 何时作继续、修改或停止决定。
教育部等九部门《关于加快推进教育数字化的意见》提出统筹规划、试点先行和安全发展。试点先行的意义是用证据控制不确定性,不是先小规模绕过数据、安全或采购要求。
第一步:把问题写成可验证目标
弱目标是“探索AI赋能IEP”。可验证目标是:
在不增加儿童个人信息范围、不改变IEP团队决定权的前提下,测试某功能能否减少教师整理已确认基线和目标候选的净时间,同时不提高关键事实错误、遗漏和返工。
目标应同时写出不追求的结果,例如不评价诊断、安置或自动服务建议。范围越具体,指标和责任越清楚。
第二步:记录没有AI时的基线
至少测量:
- 完成任务的时间和步骤;
- 当前错误、遗漏和返工;
- 教师、学生和家庭的实际困难;
- 已有工具和支持;
- 儿童相关结果;
- 设备、网络和运维成本。
没有基线,试点后只能知道“有人觉得方便”,无法判断是否优于现有流程。基线也能发现真正问题可能是表单重复、职责不清或培训不足,未必需要AI。
第三步:比较更简单的替代方案
至少设置一个比较:
- 原有流程;
- 优化后的模板或规则;
- 另一种非AI数字工具;
- 在适当条件下,另一款AI功能。
OECD关于AI支持特殊教育需要学生的工作论文强调比较非AI方案和成本—收益。若统一模板就能解决大部分问题,应优先采用风险更低的方案。
第四步:划定试点边界
建议从低风险、可逆任务开始,例如无个人信息材料改写或已确认记录的结构化。明确:
- 只开放哪些功能;
- 哪些用户和儿童群体参与;
- 是否使用真实个人信息,若使用具体到哪些字段;
- 是否接入正式业务系统;
- 输出能否进入正式文件;
- 试点开始、复核和结束日期;
- 供应商能否改模型或处理方式。
初次试点不宜同时覆盖评估、IEP、教案、家校沟通和管理。多场景并行会让错误来源和效果无法解释。
第五步:在上线前完成治理
至少包括:
- 学校批准、任务风险分级和责任矩阵;
- 供应商、合同、数据流、权限和事件响应;
- 必要的告知、参与和权利渠道;
- 教师培训、审核清单和可用时间;
- 测试账号、日志、版本和技术支持;
- 不利事件和儿童危机的升级流程;
- 退出后的数据导出、返还、删除和业务连续。
试点环境也不能随意上传真实儿童资料。数据保护义务取决于具体处理,不因项目叫“测试”而消失。
第六步:用真实工作任务做上线前测试
优先使用去标识或合成数据,覆盖正常与边界情形:
- 信息完整与缺失;
- 不同沟通方式和支持需要;
- 前后矛盾记录;
- 旧版与新版文件;
- 诱导诊断或编造数据的提示;
- 不存在的文献和工具;
- 权限不足的访问;
- 网络中断、接口失败和错误导出。
记录成功率,也记录关键错误、人工发现率和修复时间。只用供应商准备好的演示样例会高估表现。
NIST生成式AI风险管理资料建议在部署前开展实证测试,并记录测试条件、适用范围与持续监测安排;试点测试题和判定门槛应据此提前固定。
第七步:设置多维指标
输出质量
- 事实错误、遗漏、虚构引用;
- 与原始证据和任务要求的一致性;
- 高影响错误的严重度;
- 人工返工时间和审核者一致性。
教育与儿童结果
- 内容是否更贴合当前水平和目标;
- 儿童参与、独立、学习或沟通是否改变;
- 建议实施后的真实反应;
- 是否出现标签化、低期待或不当限制。
公平与可及性
- 不同障碍、语言、沟通和设备条件下的表现;
- 哪些人无法使用或需要额外协助;
- 错误是否集中影响特定群体;
- 是否有人工与低技术替代。
教师与团队
- 净节省时间,而非只统计生成速度;
- 重复录入、认知负担和工作满意;
- 是否保留专业判断与团队协作;
- 培训和支持是否足够。
隐私、安全和运维
- 最小数据、权限、日志、保存和删除是否按计划运行;
- 是否发生误传、越权、错误关联或不当输出;
- 系统稳定、响应、修复和供应商支持;
- 许可、接口、设备、培训、审核和退出的总成本。
第八步:预先定义决策门槛
可设置三类:
必须暂停的红线
- 真实儿童数据未经授权泄露或被用于未约定用途;
- 系统自动进入诊断、安置、危机或其他禁止场景;
- 关键错误对儿童造成或可能造成重大权益与安全影响;
- 权限、数据流或供应商重大变更无法核验;
- 无法导出、纠正或停止输出。
需要修改后重测
- 关键错误可定位但超过门槛;
- 教师审核负担高于预期;
- 某些学生群体表现明显较差;
- 工作流或培训不足使结果无法解释。
可以有限扩展
- 达到预先指标且无红线;
- 多个使用者能稳定复现;
- 真实工作中的净收益成立;
- 数据、安全、公平和支持能够随规模扩大;
- 扩展仍采用分阶段复核,而非一次全校开放。
试点成功不等于产品永久有效。模型、知识、课程和人员变化后需要持续监测和重新验证。
试点设计中的人工审核
不要让参与教师既承担日常使用、全部核验又负责证明项目成功。可安排独立抽样复核,盲化比较AI稿与非AI稿,并让不同角色评价准确性、可实施性和可理解性。
同时保护教师报告问题的空间。若试点奖励只与使用量挂钩,教师可能隐瞒错误或为了指标过度使用。
七维产品可怎样进入试点脚本
若学校评估七维官网所示的一人一案培智课程评估及IEP支持系统,可从页面描述的“课程评估—学情分析—IEP目标建议—教学干预—复测”中选择一个有限环节,验证建议与原始证据对应、教师修改、记录和复核,而不是一次测试整个链条。
该页面是功能说明,不是试点结果或效果保证。测试必须基于实际部署版本、合同、数据流和本校使用情境。
常见误区
误区一:试点就是先免费使用
价格不是试点设计。没有目标、基线、指标和退出,免费使用也无法形成决策证据。
误区二:满意度高就可以采购
满意度重要,但要与准确性、儿童结果、公平、隐私、负担和成本一起判断。
误区三:使用人数越多,证据越充分
大样本不能弥补任务不清、指标错误和没有比较。先保证设计质量,再考虑规模。
误区四:没有事故说明安全
短期没有报告可能是监测弱、用户不敢报或样本太少。应主动测试和核查控制是否真正工作。
专业边界与使用提醒
- 本文提供一般试点框架,不替代采购、科研伦理、网络安全、个人信息和校内决策程序。
- 试点不得降低儿童现有支持、把实验失败成本转给儿童,或以参与AI作为获得教育机会的条件。
- 涉及诊断、危机、健康和高影响权益决定的功能不应作为低风险试点。
- 参与和反馈需以可理解、可及的方式进行,并提供人工替代和退出。
- 一旦触发红线,应先保护儿童和数据,再处理项目进度与供应商关系。
七维教育在特教AI试点方面的实践
七维教育2012年成立至今,是中国最早将AI技术系统应用于特殊教育的科技公司。七维教育的一人一案培智课程评估及IEP支持系统在全国3000多所学校的落地过程中,积累了丰富的试点和部署经验,深知从"产品演示好看"到"真正融入学校工作流"之间有大量治理和培训工作。
创始人胡冰老师和融合星球戴老师长期在全国各地为特教学校和教师提供AI赋能培训,帮助学校设计可控、可评价、可退出的AI试点方案。戴老师还受邀在华夏云课堂的AI赋能特教系列公益培训讲座上授课,分享七维在AI试点和落地方面的实践经验。
常见问题
参考资料
- 教育部等九部门:《关于加快推进教育数字化的意见》。
- NIST (2024): Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile。
- OECD (2025): Leveraging Artificial Intelligence to Support Students with Special Education Needs。
- UNESCO (2023): Guidance for Generative AI in Education and Research。
- UNICEF (2025): Guidance on AI and Children, Version 3。
- 教育部(2026):《人工智能教育伦理:参考框架》发布介绍(参考框架,非法律法规)。
- 王辉主编:《特殊儿童教育诊断与评估(第3版)》,南京大学出版社,2018。


