「作业涨一成八,考试掉两成」:AI 把练习变成了表演

| | 1 次浏览

当 AI 辅导工具以肉眼可见的速度进入学生的书包,"它到底是在帮助学习,还是在替代学习"这个问题的答案正在变得具体。本周,一项在 Hacker News 上引发讨论的研究报道给出了一组刺眼的数字:使用 AI 的学生在作业环节得分平均提升约 18%,但在随后不允许使用 AI 的闭卷考试中,成绩反而下降了约 20%。

事件要点

这份以「AI Boosted Homework Scores by 18% – Then Exam Scores Dropped 20%」为题传播的研究,核心结论可以浓缩成一句话:AI 让"交付结果"变得更容易,却让"形成能力"变得更难——作业分数的上涨与考试分数的下跌,来自同一个机制。

需要说明的是,该报道来自一家小型新闻站点,样本构成与实验设计还有待查阅原文核实,具体数字不必当作铁律。但它的价值在于,把一个已被严肃研究反复验证的模式,又一次摆到了公众面前。

这个结论其实不新

2024 年,宾夕法尼亚大学 Hamsa Bastani 等人在约 1000 名土耳其高中生中做过严格对照实验(论文题为 Generative AI Can Harm Learning):可直接调用 GPT-4 做练习题的学生,练习环节表现大幅领先;但收走 AI 之后的统一考试中,这组学生比从未使用 AI 的对照组低约 17%。值得注意的是,加了引导式脚手架的"Tutor 版"显著缓解了这种伤害——决定结果的,是工具的形态,而非工具本身。

MIT 媒体实验室 2025 年的"Your Brain on ChatGPT"研究(arXiv:2506.08872)则从脑电层面给出佐证:借助大模型写作的学生神经连接更弱,几分钟后几乎无法引用自己刚"写"完的文章。

作业是练习,不是交付物

这些证据指向同一个被忽略的常识:作业的价值从来不在于那张交上去的纸,而在于完成它时大脑里发生的挣扎——检索、试错、卡住、重来。教育心理学称之为"必要难度"(desirable difficulty),而生成式 AI 恰好是这种难度的精确溶解剂:它把挣扎环节整体外包,交付物越来越漂亮,能力却留在原地。

对教育系统而言,这带来两个直接后果。其一,作业作为形成性评估手段正在失效——它度量的不再是学生,而是"学生 + 工具"的组合体;其二,作业与考试之间的分数差,正从"粗心差距"变成"AI 差距",出题与评分方式都需要重新设计。

对 AI 公司而言,这也是一次产品哲学的分流:做"答案出口",还是做"脚手架"。宾大研究中 Tutor 版的表现说明,强制学生先自行尝试、再逐步给提示的设计,可以保留大部分效率收益而不透支学习。可汗学院的 Khanmigo 等产品在往这个方向走,但默认形态的工具仍是最顺手的那种。

简短点评

18% 与 20% 会随样本和方法浮动,方向却已足够清楚:AI 进入教育的第一波红利,有相当一部分是"把练习变成表演"换来的。对学生和家长来说,真正的问题不是"要不要用 AI",而是"哪些挣扎值得保留"。把每一次卡壳都外包出去的代价,最终会在闭卷的时刻、在没有任何工具可用的场合,一次性结账。

评论(0)

暂无评论,来写第一条吧。