#436 2015 · Avon and Somerset Police / Behavioural Insights Team · Public sector recruitment / assessment design
纸面上测试并不偏颇,于是警方不再盯着测试本身,转而去看测试前不久发生了什么
问题
一项选拔测试在几类人群之间出现了明显的通过率差距,而对测试本身做内容审查也说不出所以然
背景
埃文和萨默塞特警署的情景判断测试是其警员招募流程的一部分,却在黑人及少数族裔(BME)候选人和其他候选人之间制造出悬殊的通过率差距——按一种说法大约是30%对65%——尽管测试内容已被审查,问题与评分都看不出明显偏颇。一份纸面公平的测试,仍可能被与其内容无关的心理因素所塑造。
行为研究团队(BIT)与警方合作,推断这一差距源于刻板印象威胁——即一个被充分证实的效应:在高风险评估中,候选人想起外界对自己群体的负面刻板印象时,会单凭这一点就压低成绩,与实际能力无关。修改题干措辞或评分规则这类修正测试偏见的常规做法,对候选人在读到第一题之前就已发生的心理效应毫无作用。
换别人会怎么做
面对选拔测试的通过率差距,标准做法是审查测试本身——重读题干找偏见的措辞,检查评分权重是否让某类人群吃亏,然后修订内容。这在这里行不通,因为差距并非来自测试内部的任何东西;内容审查本就未发现明显偏颇,那么修订题目或评分规则,改动的只是一份并非真正差距根源的文档。
他们看到了什么
行为研究团队看到,一份测试可以在纸面上完全公平,却仍交出不公平的结果,因为成绩取决于候选人带着怎样的心理状态走进考场,而不只取决于测试内容。刻板印象威胁——那个被充分证实的效应:想起外界对自身群体的负面刻板印象,会压低高风险评估中的成绩——完全发生在读第一题之前,这意味着解决办法必须落在测试的上游,而不是测试内部。
那一手
团队没有去改动测试本身,而是在候选人考前收到的邮件邀请里加了两道简短的附加问题,请他们反思自己凭什么能成为警队的良好补充、这对他们的社区又意味着什么——一段简短的自证式自我肯定,意在评估开始前就消解刻板印象威胁。
为什么管用
在考前邮件里加上两道简短的自证式反思题——问候选人凭什么能成为警队的良好补充、这对他们的社区意味着什么——给了候选人一个在评估开始前重新确认自身能力与归属感的机会,而刻板印象威胁的文献表明,这能缓冲那种在带有刻板印象的压力下压低成绩的焦虑。因为干预针对的是候选人带进考场的心理状态,而不是测试的内容或难度,所以它能在不放低门槛、不改评估对象的前提下抹平通过率差距(据已发表的田野实验,少数族裔申请者的通过概率提高约50%,对其他候选人无影响)——同一份测试,由一位自认属于这里的候选人作答,更能读出其真实能力。
值了多少
收到促成性问题的BME候选人,其情景判断测试通过率和非BME候选人相当,大致抹平了此前从约30%起步、到约65%才对等的差距,而测试的内容、难度和评分全部原封未动。
什么时候会失灵
只有当成绩差距确实源于刻板印象威胁或类似的心理机制(归属感不确定、评估焦虑),而不是真正的技能或准备差距、训练材料接触不平等、或测试实际内容中内嵌的偏见时,这项干预才会见效——误判原因、把促成式疗法用在结构性问题上,只会白做一场表面文章而没有任何改进。它也要求促成本身必须真正简短、低风险;一项反而在身份认同上大做文章、或显得装模作样的干预,可能适得其反,让刻板印象更显眼而非更淡化。再者,它的着力点在心理而非内容,因而对测试本身是否真的在测对的东西一无所知——一份评估可能还存在促成式干预永远不会暴露的其他效度问题。
后来呢
这一干预在英国公共部门行为科学圈子里被当作示范,用以说明评估中的公平问题可以源于候选人的心理框架而非测试设计;行为研究团队此后也把相似的促成式做法推广到其他因无法解释的人口统计差距而困扰的招募与评估场景。
资料来源
- [1]Levelling the playing field in police recruitment: Evidence from a field experiment on test performancePublic Administration 95(4), 2017 (Linos, Reinhard & Ruda), via UC Berkeley Goldman School of Public Policy, 2017gspp.berkeley.edu
- [2]Better, fairer recruitment with behavioural scienceMoreThanNow, 2018morethannow.co.uk