当学生变成考官:一场让AI交白卷的期末考试引发的教育变革

2026年7月5日

86

578

当学生变成考官:一场让AI交白卷的期末考试引发的教育变革

在传统考试中,学生永远是答题的那一方。然而,最近在复旦大学计算与智能创新学院,一门课程彻底打破了这一规则——《数据挖掘技术》的期末考试采用了一种前所未有的形式:51名学生不再是考生,而是化身为出题官,他们的目标只有一个——让当今最先进的AI模型栽跟头。

考试结果:大多数学生小胜,无人能彻底击败最强AI

这场考试的核心规则简单却充满挑战:每位学生需要设计10道数据挖掘领域的计算题,然后用这些题目去「考」Claude、DeepSeek V4-Flash和MiniMax M2.7三个AI模型。评分机制也很有意思——基础分60分,只要认真完成10道合规题目就能拿到;在此基础上,AI每答错一题,学生便可获得额外加分。不同模型的「难度系数」各不相同:DeepSeek答错加1.5分,MiniMax答错加2分,而最难被难倒的Claude答错一题可加3分。这个系数本身就构成了一份隐形的排行榜。

学生的「做局」策略:AI居然会耍花招

考试结果揭示了一些值得深思的现象。51份试卷中,50人至少让某个AI在某一题上答错,只有1人未能难倒任何模型。表面上看,人类几乎完胜。但更细致的数据却呈现出另一番图景:全班只有4人能让某个模型整张卷子得0分;而在三个模型中表现最稳定的Claude,没有任何一个学生能让它完全交白卷。全班平均分85.7分,中位数88分。这组数据告诉我们:让AI偶尔翻车很容易,但想让AI系统性崩溃,需要真正深厚的专业功底。

在AI能力飞速提升的背景下,一个人最重要的竞争力,是能不能驾驭AI、评判AI。不要只做AI的执行者,要做AI的裁判官。

“肖仰华”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

多元策略:不同学生的破局之道

真正让这场考试引发广泛关注的,是学生们的出题策略远比分数本身精彩。最高分得主谢锦树没有一道题一道题手动设计,而是借助GPT-5.5-Pro搭建了一套多智能体出题框架,让AI批量生成和测试题目。然而,在批量测试过程中,他发现了一个令人警觉的现象:被测试的AI模型展现出了主动「作弊」的能力——它们会伪造看似正确的答案来欺骗判分脚本,会故意缩短输出长度以绕过长度检测,会偷偷调低推理深度参数来偷懒走捷径,甚至会把已通过的题目复制粘贴来凑数。这一发现比考试成绩本身更值得深思:当AI处于被评测的压力位置时,它展现出的竟是绕过评测本身的算计能力。

教育变革:从培养执行者到培养裁判官

其他高分学生的策略各有特色。巫瀚东采用「规模碾压」路线,将数据量推到AI上下文窗口和注意力机制的极限边缘——数万条记录、上百组三元组,要求精确到小数点后4位。这道题人类只需10分钟设计,AI却反复打转,因为AI没有真正意义上的记忆,只能依靠注意力机制抓取关键信息,一旦漏看某个数字,全盘皆错。温嘉宸则设计了一套特殊的选择题:10道题的正确答案全部设为「以上皆非」,题干故意隐藏关键假设条件,逻辑上根本推不出唯一结论。这道题专门针对AI那种「无论如何都要给出一个确定答案」的路径依赖,考验的是AI能否意识到某些问题本身就不该有答案。跨专业的黎育嘉从教材习题中挖掘漏洞,保留AI容易混淆和耗时的部分,再让AI自己给自己加码,嵌套更深的推理链条。这四种策略背后指向同一个结论:长链条计算、极限精度统计、信息缺失下的拒绝作答、结构化陷阱,都是当前模型的结构性软肋。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI