AI 教育的 2026:三场 RCT 都说有效,为什么家长还是不放心

AI 教育在 2026 年同时发生了两件看似矛盾的事:一是证据面空前繁荣——三场标志性随机对照试验(RCT)全部得出「AI 显著提升学习」的结论,效果量最高折合两年常规学习进度;二是信任面持续塌陷——MIT 的脑电研究警告「认知债」,教师工会与科技公司谈判出十项隐私红线,中国高考给 AI 平台「限时上锁」。产品在校园里铺得比任何时候都快:OpenAI 的教师工作区已覆盖 30 个州 30 万教育者,作业帮学习机在中国学习平板市场份额登顶。证据越多,争论越烈——本文把格局、证据、政策、商业四条线摊开,看看这场信任危机的根源在哪。

产品格局:巨头围剿「学习模式」,中国厂商押硬件

教育产品在 2026 年的形态收敛得很快。OpenAI 这边是三件套:面向学生的 Study Mode(2025 年 7 月上线的苏格拉底式引导,分步提问不给答案,现已对 Free/Plus/Pro/Team 全档免费)、面向 K-12 教师的 ChatGPT for Teachers(经核验教师免费,官方口径已与 30 个州 100 多个教育机构合作、覆盖 30 万以上教育者,并推出了覆盖 16 个州的统一数据隐私协议),以及 8 月全球上线的 ChatGPT for Teens(屏蔽高风险话题、家长控制)。Anthropic 7 月跟进推出 Claude for Teachers(美国 K-12 教师免费)。Google 的答案是在 Gemini 里内置 Guided Learning 分步讲解,加上学校统一管理的 Gemini for Education;Google Classroom 也已内置 Gemini 标签页,可直接生成学习指南、闪卡与测验。集成层面的标志动作是 OpenAI 与 Instructure 的合作:2025 年 7 月起,ChatGPT 嵌入北美高校广泛使用的 Canvas 学习管理系统,教师可以创建 AI 生成式作业——AI 正从「一个 App」变成 LMS 里的一层。

老牌玩家可汗学院提供了最诚实的一组数字:其 AI 导师 Khanmigo 本学年工作日平均 26.9 万次交互、上线三年累计超 1 亿次——但第三方观察显示,获得访问权的学生里经常使用的只有约 15%。这组数字概括了 AI 教育产品的真实渗透水平:覆盖是行政性的,使用是个体性的。

中国市场的形态截然不同:政策把大模型挡在了「向学生直接卖服务」的门外,厂商于是把 AI 装进硬件。学习平板成为主战场——第三方监测口径下,2026 年一季度作业帮以 32.9% 的销量份额居首(搭载自研银河大模型、接入 DeepSeek),学而思以九章大模型主打「培优 AI 家教」,并在 9 月云栖大会发布教师端「九章老师」;小猿 AI 宣称付费用户上半年突破 1200 万(公司口径,未经第三方审计)。「AI + 学习机 + 订阅」取代了上一代的「卖课」,成为教育科技的主商业模式。

证据战:三场 RCT 的共同弱点

「AI 到底能不能提升学习」,2025 到 2026 年终于有了三个随机对照试验级别的回答。哈佛大学物理课的 RCT(2025 年 6 月发表于《Scientific Reports》)把 194 名学生随机分组:使用定制 AI 导师「PS2 Pal」的学生,后测成绩中位数 4.5,显著高于面授主动学习组的 3.5,相对基线的学习增益超过两倍,且用时更短(49 分钟对 60 分钟);83% 的学生认为 AI 讲解不亚于或优于真人教师。世界银行在尼日利亚的实验让约 800 名中学生六周内两人一组使用 GPT-4 学习英语,学习增益约 0.3 个标准差——论文口径约合 1.5 到 2 年常规学习进度,效果优于发展中世界 80% 的教育干预 RCT,且女生增益更大、呈剂量反应效应。Google DeepMind 2026 年 6 月发布的塞拉利昂试验覆盖 12 所学校 1763 名学生,八周数学成绩提升 0.258 个标准差。

三个结论方向一致,但把「AI 导师完胜课堂」写进标题前,必须看清它们共享的四个限定:其一,资助方全部是利益相关方——哈佛用的是自家课程与自研平台,世界银行评估的是自家项目,塞拉利昂研究由 Google 资助;其二,周期全部在 6 周到一个学期之间,无任何长期追踪;其三,哈佛论文自己写明,AI 导师仅覆盖理解与应用层次的初学材料,用的是专家逐题打磨的提示词加预写标准答案,不声称适用于高阶批判性思维场景;其四,均无独立复现。把这三场试验读成「AI 导师有效」是合理的,读成「AI 导师可以替代教学」则超出了证据的射程。

对面阵营的证据同样具体:MIT 媒体实验室 2025 年的《Your Brain on ChatGPT》用 54 人脑电实验发现 LLM 写作组的神经连接最弱、文章所有权感与记忆最差(注意:小样本、未同行评审,网络流传的「脑力损失 47%」系夸大转述,原研究并无此结论);2025 年被引超过 2200 次的 MDPI 调查发现频繁使用 AI 与批判性思维显著负相关,年轻重度用户最弱;产品侧的旁证则是 Study Mode 的护栏被证实可绕过。两派证据其实并不正面冲突——它们分别说的是「设计良好的 AI 导师在受控条件下有效」与「无护栏的自由使用有代价」,真正的分歧在于大规模铺开时,产品会落在哪个端。

政策两条路:工会谈判隐私标准,政策先行加 AI 监考

美国走的是「厂商圈地 + 工会谈判」的路线。教师工会 AFT 2025 年牵头与微软、OpenAI、Anthropic共建 2300 万美元的「国家 AI 教学学院」,目标培训 40 万教师;2026 年 9 月,AFT 与微软发布《全国学校 AI 安全与隐私标准》,十项可执行承诺——微软不用师生数据训练模型、不用 AI 追踪学生——适用于全国所有学区,口号是「学生不是产品,教师不是测试员」。州层面,截至 2026 年 9 月已有约 40 个州出台 K-12 AI 指导(不同目录统计口径略有出入),立法焦点集中在数据隐私与学术诚信。大学的默认政策则普遍转向「默认禁止、教师明示许可才可用」,因为检测器假阳性频发、学生用 humanizer 工具规避检测(2026 年 1 月单月访问量 3390 万次),「一刀切」已被证明不可行。

中国走的是「政策先行 + 平台管控」。2026 年 4 月,教育部等五部门印发《「人工智能+教育」行动计划》:基础教育开齐开足 AI 课程、AI 成为高校公共基础课、建设国家应用中试基地。而在考试端,2026 年高考形成了「三重防线」:考场 AI 智能巡查与智能安检门、教育部预警「AI 押题」虚假宣传、多家主流 AI 平台在高考期间对涉考功能限时上锁——「用 AI 监考 AI」与美国「检测失灵后改评估方式」形成了鲜明对照。有趣的是,两国在教师端的选择殊途同归:先武装教师、再放开学生,把「人机协同」的决策权留给讲台。

商业逆风:钱流向 AI,但不流向教育科技

资本面给这场教育革命泼了冷水。Chegg 是被 AI 颠覆的标志样本:2025 年两轮裁员合计超过 60%,公司在裁员公告里直言「AI 的新现实」;传统 edtech 风投持续遇冷,第三方口径显示 2026 上半年全球教育科技融资约 10 亿美元、同比下降 26%——同期全球 VC 总盘仍在千亿量级,钱流向 AI,但不流向教育 AI。反向案例是 Duolingo:全面转向「AI 优先」,用 AI 视频通话导师替代外包人力,股价与用户数同步受益。中国的 52 起教育融资多为数百万元级的天使轮——行业的共识似乎是:教育 AI 的钱,要么从大模型巨头出(烧在教师端免费圈地),要么从家长出(硬件加订阅),中间层的创业公司两头受挤。

意味着什么

三句话收拢。第一,「AI 能否提升学习」已经不是好问题——受控条件下有效已成定论,真问题是「什么样的护栏与教师角色设计,能让受控条件下的有效在大规模开放环境里存活」。第二,证据生产的方式正在决定证据的公信力:三场 RCT 全部利益相关方资助、全部短期、全部无复现,这既解释了「为什么家长还是不放心」,也点名了下一个研究周期最稀缺的东西——独立、长期、预注册的第三方复测。第三,中美把同一个技术按进了不同的制度容器:美国靠工会与隐私协议谈判出边界,中国靠政策与考试管控划出边界,但都选择了「教师在场」这个共同前提。AI 教育的终局形态大概率不是某个超级 App,而是被这两套制度重新打磨过的课堂本身——就像哈佛论文自己建议的那样:AI 导师是课前初学的好工具,但课堂,还是留给课堂。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?