#186 2002 · Chicago Public Schools (with researchers Brian Jacob and Steven Levitt) · Education / statistical fraud detection
只看一间教室抓不到作弊的老师——看横跨数千间教室的成绩规律,反而抓得住
问题
一间教室里出奇亮眼的测试成绩,和另一间教室里真材实料的好成绩看起来一模一样——无论你盯得多仔细,孤立地审查任何一间教室,都无法分辨这是舞弊还是真本事
背景
高利害的标准化考试给压力之下的老师和行政主管制造了真实的动机去拉高成绩——改动答案、考试时递答案,或其他手脚——但任何一间教室异常出色的成绩,单独看时都与一位真本事的老师正好碰上好年景无异。一间一间地人工调查可疑教室既慢又贵,还容易被驳倒,因为几乎每一次成绩暴涨都能找到一个清白无辜的解释。
研究者 Brian Jacob 和 Steven Levitt 构建了一个统计算法,它不孤立地看任何一间教室的结果,而是看两枚只有造假才容易同时留下的指纹:某间教室异乎寻常的大幅年度成绩跳升,再加上同一间教室里学生答案大致雷同的成块可疑规律——这是真实的学生表现几乎绝不会留下的印记,因为真实学生不会在同一段罕见序列里齐刷刷地错在同样的答案上。
换别人会怎么做
一间一间地调查单独可疑的教室——调出试卷、约谈老师、逐例复核成绩跳升——这是标准的舞弊应对手册,它又慢又贵,还容易被被指控的老师驳倒,因为任何一间教室的好成绩总有一个清白无辜的解释可用。
他们看到了什么
单看成绩跳升说明不了任何问题,单看不寻常的答案规律也同样说明不了——但 Jacob 和 Levitt 看出,造假会留下一种任何单一信号都抓不到的具体指纹:难以解释的大幅增益,配上学生在异常相同的答题序列上齐刷刷一致的答案。没有哪间货真价实的教室两者同时出现,所以是组合,而非两枚信号中的任一枚,才真正把舞弊和优秀区分开来。
那一手
2002 年春天,芝加哥公立学校邀请 Jacob 和 Levitt 依据算法的输出,为其既有的重测质检项目圈定教室,把 117 间接受重测的教室分成三组:算法标记为疑似作弊的、「好老师」教室(成绩大增但答案规律正常),以及随机选出的对照组——这个设计让算法的预测能在真实、受监控的重测成绩里得到检验,而不只是一项统计上的怀疑。
为什么管用
真实的学生进步本身就能带来大幅成绩跳升,答案偶然巧合雷同也在任何教室都可能发生,因此任一枚信号单独出现都会产生误报,让逐例指控变得不可靠、可被驳斥。要求同一间教室里两枚信号同时出现,这个门槛高得多——造假稳稳能过(因为动手改答案、递答案的人自然会造出这种规律),而诚实的表现几乎绝不会凭偶然做到;这正是算法标记的教室在受监控的重测中成绩崩塌、而真正强劲的教室守住了分数的原因——算法不是蒙的,它在读一种只有某一种底层原因才真正产生的特征。
值了多少
在严加监控的重测中,算法标记的教室成绩暴跌超过整整一个年级的当量,而「好老师」教室——初见成绩喜人、货真价实的那些——保持稳定甚至略有上升,随机对照组也仅小幅回落——真实表现与造假表现呈现出干净利落的统计分野,这是一间一间人工排查永远无法企及的置信度与速度。
什么时候会失灵
这套方法依赖舞弊真的留下可被侦测的统计指纹——一个更高明的作弊者,会变化改动哪些答案,或用更小、更不反常的幅度拉高成绩,从而躲过算法专为捕捉而构建的特定特征。它还需要一个真实的自然实验或受监控的重测来验证标记——因为若无控制条件下的确认,即便确实证明被标记教室的表现不同,统计上的异常也只能停留在「可疑」而非「坐实」;而仅仅凭统计特征去标记,也可能在极少数碰巧符合该规律的诚实教室里造成冤案。
后来呢
Jacob-Levitt 方法学是应用统计与舞弊侦测文献里的一个基础案例研究,被教育政策和数据科学课程广为引用,作为通过人口层面的统计特征而非个案审查来侦测操纵的范例;如今,可比的答案规律与成绩跳升检测法,已是考试机构和各州教育部门的标准做法。
资料来源
- [1]NBER Digest — Do Incentives Cause Teachers to Cheat?National Bureau of Economic Research, 2003nber.org
- [2]The Cheating CurveChicago Booth Review, 2013chicagobooth.edu