第 22 章

法庭上的分数

旧金山联邦法院的卷宗里有一行字,后来被心理测量史的研究者反复引用。它不来自测验手册,也不来自某个心理学教授的书房,而来自一份诉讼文件:“问题不在于这些孩子是不是真的迟钝,而在于我们凭什么用一张试卷决定他们的一生。”

这话说得直白。说的人也未必想到几十年后会成为档案里的铅字。但把这句话放进当时的法庭,它的分量不亚于一次小型的制度地震。

因为在这之前,智商分数很少被这样追问过。测验可以测智力,这件事被当作常识。测出来分数低,学校安排你进慢班,天经地义。

可到了二十世纪七十年代,美国的民权律师开始把测验本身告上法庭。理由只有一条:你用一张带着文化偏见的试卷,把黑人孩子成批地送进特殊教育班。这不是测量,这是歧视。

这话传到测验出版商耳朵里,最初的反应是荒诞。一家测试公司的高管后来在行业会议上说,测验只是温度计。你总不能在病人发烧的时候怪温度计。

这个类比听着漂亮,但律师不吃这一套。律师反问:如果这支温度计只在某些人身上读数偏低,而且偏低的结果是送进一个没有出路的小教室,那这还是温度计吗?智商测试第一次在美国法律体系里遭遇系统性挑战。

不是学院里的方法论争论,也不是期刊上的统计争吵,而是在法庭的证人席上,在法官的追问下,在家长的沉默中,那个曾经无懈可击的分数第一次被迫亮出了自己的底牌。

上一章结尾,我们说到企业人事材料摆在民权调查人员桌上。某些岗位测验的通过率,白人和黑人之间悬殊得惊人。白人申请者通过主管选拔测验的比例超过一半,黑人申请者通过的比例不到十分之一。企业拿出一堆纸,说这是测验公司的效度手册。翻开一看,里面只写着“可用于筛选文职岗位”这类笼统话,没有一个数字能说明这套测验真能预测接线员或者基层主管的实际表现。手册写的是产品介绍,不是科学证据。

可企业还是那句话:我们只看分数,分数不认肤色。这话在法律上曾经很有市场。因为只要程序看起来中立,结果再悬殊也很难被证明是故意的。

可民权律师们换了个打法。他们不再只盯着企业,而是把火力集中到一个更敏感的靶子上——公立学校。因为学校和企业不同。企业用工自由,学校不行。

公立学校受宪法平等保护条款的约束,受联邦教育法的约束,更受家长监督。你可以在工厂门口放一支测验把人挡住,但你不能在教室门口把孩子分出去。如果测验本身有问题,学校的责任就跑不掉。

于是,视线从人事部门转向了校区。转向了加利福尼亚。转向了旧金山湾区的几所小学。

1970年代早期,旧金山联合校区有一类班级,名字叫“可教育性智力落后”班,英文缩写EMR。这个名称听上去很温和,“可教育”还带着一种给人机会的味道。但实际呢?进了这个班,课程简化,教材简单,教材外面的世界也简化了。学生不再跟同龄人一起上课,不再接受正常学业进度。家长拿到的成绩单上,分数再也不是重点,重点是一个标签:智力落后,可教育程度有限。

这个标签从哪里来?就从智商测验来。按照加州当时的规定,学生要被安置进EMR班,智商分数必须低于某个门槛。

门槛一划,试卷一测,分数一低,安置程序就启动。听上去清清楚楚。可清楚的事情往往最怕看细节。细节在数字里。

旧金山校区当时的人口结构里,黑人学生占比不到三成。但在EMR班里,黑人学生占比超过一半。这个数据并不难查,校区的学籍档案白纸黑字。难的是,很多年没人认真查。家长不知道自己的孩子为什么进了那个班。

学校通知家长,说是测验显示孩子需要特殊教育。家长听不懂测验术语,只知道孩子被安排了一个“特殊”的地方。很多家庭是工薪阶层,家长要上工,要养家,对学校的安排习惯性地点头。信的抬头写着“为了孩子的最大利益”,落款盖着学校的章。家长在签字栏写下名字,心里或许有一丝不安,但说不出问题在哪儿。

直到有一天,几个家长聚在一起,发现彼此的孩子都在那个班里,发现大家的肤色一样。他们开始数:这条街上,那个街区里,多少黑人孩子被送进了EMR。越数越不对劲。

于是有家长找到社区法律服务机构,找到民权律师。律师一看学区数据,也愣了。比例太离谱了。如果说智商低是随机分布的,那为什么某个种族的孩子会集中在同一个班里?这是第一个问题。更关键的第二个问题在后面。

律师开始翻测验记录。他们发现,很多孩子只在一次测验里拿了低分,就被送进了EMR。一次测验,一次分数,一次安置。

中间没有复查,没有第二次机会,没有老师的面谈记录,没有考虑孩子当时的身体状态、语言环境、家庭变故。有个孩子的测验记录显示,他在测试当天发着烧,测验员在记录栏里写了一行字:注意力不集中。可这行字没有改变任何结果。分数依然是分数。低分依然是低分。

律师把这些材料一件件摆在桌上,开始构建一条证据链。先证明比例失调,再证明程序随意,再追问测验本身。

第三步是最难的一步,因为测验的“科学性”是最大的挡箭牌。你可以批评程序不完善,但很难动摇试题本身。试题是专家编的,信度和效度写在手册上,常模样本写得很清楚。你要说测验不准,那是在挑战一整个学科。

律师们没有正面去撞这堵墙。他们换了一条路。他们问:这套试卷里,到底在问什么?问题就在这里。当时美国常用的儿童智力测验里,有不少题目依赖具体的白人文化经验。

比如让小孩辨认某些生活场景,场景里出现的是郊区独栋房子、修剪整齐的草坪、一个穿着西装的男人开车回家。对许多在旧金山市区租房长大的黑人孩子来说,这个场景陌生得像明信片。再比如词汇题,有些词在城市黑人社区日常口语里不常见,有些词在黑人口语里有别的用法。孩子不是不会想,不是不会说,而是试卷要他说的话,他从来不说。

一套要求孩子识别银行支票、棒球规则、乡村俱乐部设施的测验,放在一个从没见过银行支票的孩子面前,测出的到底是谁的问题?

这里必须停一下。支持测验的人会说,这些题目在编制时已经做了项目分析,那些被证明对不同群体不公平的题目已经被删掉了。测验手册里确实写着类似的话。测验公司也不承认试卷里还有“乡村俱乐部”这种题。

那个反驳有一定道理。战后几版儿童智力量表确实做过难度和区分度分析,也淘汰了一批明显依赖文化经验的题目。但淘汰题目不等于根除偏见。因为麻烦不在个别题目,麻烦在整张试卷的语言方式、提问方式、以及孩子面对测试时的整个心理位置。

一个从小在拥挤公寓里长大、父母都没有高中文凭、家里没有人用过“检测”“分类”“排列”这些词的孩子,第一次坐在一个陌生成年人对面,被要求在规定时间里回答纸上的图形和词语,他的分数里有多少是“能力”,有多少是“不熟悉”?这个问题,测验手册回答不了。

律师把这套逻辑带进了法庭。1972年左右,以几名黑人儿童和家长为名义原告的集体诉讼正式提出。被告是加州教育主管部门和旧金山联合校区。

诉状的核心主张是:以智商测验成绩为主要依据将黑人学生安置进EMR班,违反了联邦宪法第十四修正案的平等保护条款,也违反了联邦教育法。原告要求法院禁止继续使用这类测验作为安置依据,并要求对已经被错误安置的孩子进行重新评估。

这就是后来在心理测量史上被反复讨论的Larry P.案。名字来自其中一个孩子的化名。

案子拖了很多年,卷宗越摞越高。中间经历了好几次上诉,也经历了加州方面的抗辩。加州方面的逻辑很直白:测验本身不歧视,它只是反映孩子当前的能力水平。

学校根据能力分班,这是教育学常识。如果黑人孩子在EMR班占比高,那是因为他们确实有更高比例的学习困难。这个抗辩听起来像企业当年的说法:我们只看分数,分数不认肤色。

但到了法庭上,“分数不认肤色”这句话就不好用了。因为原告律师拿出了一组数据。数据不是秘密,它来自学区自己的档案。学区报告显示,在某个时间段,黑人学生占校区学生总数的比例和他们在EMR班中的比例严重失衡。这个差距之大,已经不能用“自然分布”来搪塞。

统计学上有一个词,叫标准差。如果差异达到几倍标准差,那随机发生的概率微乎其微。

律师请来的统计学专家在证人席上算给法官看,结论只有一个:这种比例如果还说是偶然,那等于说抛一百次硬币九十五次都是正面。法庭上一时安静了一下。法官问被告方专家:你们怎么看这个数字?被告方专家解释说,可能存在社会经济因素、家庭因素、早期教育经验等原因,导致了黑人孩子在学习困难上的真实比例偏高。说得不是没道理。

可律师接着问:既然如此,学校为什么只拿一个智商分数做安置依据?为什么不去查孩子的营养史、家庭状况、语言背景、老师观察记录?被告方一时没有直接回答。因为答案其实很简单:智商分数最方便,最便宜,最快。可这个真实答案在法庭上说不出口。

这时,证据链的第三环扣紧了。原告律师要求查看测验的具体内容。测验公司起先不愿意公开。试题有版权,公开了会影响测试有效性,这是行业通行的说法。但法院在证据发现程序中要求提交部分材料,测验公司只能在保护令下提供。

于是,法庭上出现了这样的场面:一本本测验题本被抬进来,法官、书记员、双方律师围坐在一起,一页页翻看。有些题目确实温和无害,无非是找图形、分类、拼图。

可有些题目,带着那个时代鲜明的文化印记。比如一类信息题,问孩子“你会在哪里买到一把锤子?”对在五金店长大的孩子,这是送分题;对从来没单独进过商店的孩子,这是谜题。再比如一类词汇理解题,问“什么是邮政?”如果孩子住在邮政服务不到位的街区,家里用电话亭而不是信箱,他该怎么回答?不是说这些孩子真的不知道锤子或邮政是什么,而是他们知道的方式和试卷要求的方式对不上。试卷要求的是标准答案,标准答案后面是一套标准生活。一个孩子如果够聪明,可能猜到出题人要什么。可这种“猜出题人”的本事,本身就是一种文化能力。

庭上最微妙的一幕发生在心理学家作证的时候。原告方请来一位心理学教授,研究心理测量多年。辩护律师问他:您是否认为智商测验完全没有价值?他说:不,我不这么认为。辩护律师又问:您是否认为智商测验可以测量某些认知能力?他说:可以。律师以为得计。

原告律师站起来,问了一个问题:在这些测验分数里,有多大成分是儿童先前的文化经验?教授想了一下,说:有相当一部分。原告律师再问:如果用这些分数来决定一个孩子的教育轨迹,您认为公平吗?教授沉默了几秒,说:我不认为完全公平。这几秒钟的沉默,被后来的旁观者记了很久。

心理学不是不能承认这个结论,而是承认这个结论总要晚半拍。因为承认了文化经验对分数的影响,就等于承认了温度的读数里混着体温之外的东西。这不是温度计坏了,而是温度计从一起头就没量过纯粹的温度。法庭要的却正是这个回答:既然分数受文化背景影响,那它就不是一个纯能力指标;既然不是纯能力指标,那拿它来做唯一安置依据,就有问题。

需要把这个论断翻出来看。法庭争论的焦点,从“测验准不准”转向了“测验公不公平”。

这两个问题看起来相近,其实完全不同。准不准是技术问题,有信度、效度、常模这些指标撑着。公不公平是分配问题,看的是分数怎么被用来划分人群、分配机会。

测验可以很准,却很不公平;反过来,也可以很公平,却并不准。之前的心理测量界花了几十年证明测验准。民权律师们没有全面否定这个“准”,他们说的是:你“准”又怎么样?你把它用在一个不公平的地方,用它来把一些孩子永久地送进没有出口的房间,这才是问题。

这个转向,就像问一个工厂主:你的尺子很精确,这一点没人反对。但你只用尺子来决定谁能进厂,别的尺子之外的因素你一概不问,这公平吗?尺子精确不能回答公平与否。法庭要管的,恰恰是尺子之外的事。

这样说下来,也许有读者会问:这一章是不是把测验说得太不堪?我得把反方最强的那套说法也放进来。

支持智商测验的人会说,智商测验虽然有历史滥用,但它核心测量的是真实且稳定的认知能力。心理测量学里有个词,叫g因子,就是一般智力因素。大量研究表明,g因子在不同测验之间高度一致,在不同时间点上高度稳定。它确实能预测学业、职业表现,甚至健康、寿命。这些东西不是假的。测验公司拿得出数据:一个孩子的智商分数,和几年后的考试成绩、毕业率、甚至成年后的收入水平都有显著相关。这个“显著相关”不是法律外行嘴上说说,是统计学意义上的。所以支持者说,测验被广泛采用,不是哪家公司在阴谋排挤谁,而是学校和企业的一种理性选择。

它便宜、快捷、有预测力,筛选成本远低于一个人一个人去面试考察。这套说法的力量在于,它不靠阴谋,靠数据。真正的历史解释必须回答它:既然相关是真的,为什么要限制测验?

法庭给出的回答,不是否认相关,而是重新定义了问题。相关是一个总体均值,但在具体个体身上,相关不等于因果,更不等于应该。测验可以预测一个群体的平均表现,但不等于它就能公平地判断一个孩子的未来可能。同一个分数,加上不同的家庭资源、学校质量、社会支持,会走向完全不同的结果。分数的预测力,部分来自能力,部分来自环境,部分来自阶层。

而测验把所有这些都压缩进一个数字里,然后反过来用这个数字去分配资源,等于拿着果去决定因。更麻烦的是,这种预测会自我实现。一个孩子若被贴了低分标签,被送进低期望班级,被剔除出正常学习轨道,他的未来成绩自然更差,这又反过来印证了当初的那个低分。这在社会科学里叫“标签效应”,在律师嘴里则叫做“自我实现的预言”。

支持者不否认这些,他们只是说,那只是使用不当的问题,不是测验本身的问题。可这句话说了等于没说。没有哪个制度在真空里使用测验。测验从来都是被某些人、在某些目标下、对某些人群使用的。如果你只用“测验本身”来为测验辩护,那你护住的只是一个抽象的、从未存在过的东西。

这就是“命运技术”这个词最该登场的地方。智商测验之所以危险,不是因为它坏,不是因为它没用,而是因为它太像命运。它把人的复杂潜能简化成一个数字,然后依据这个数字给人生路径分岔。进天才班还是普通班,进特殊教育还是正常课堂,拿管理培训岗位还是流水线岗位,有时候真的就压在那几分上。

这整个过程,我称之为命运技术:一套把人的连续能力分布切成一格一格、然后按格子分配生命机会的社会装置。法庭第一次大规模地审查这套装置,不是因为它突然变坏了,而是因为它的栅格切得太锋利,把一些人划出了正常世界。

法律能做的,不是砸碎所有分数,而是划出使用边界:你可以测,但不能只凭这个测出来的数字决定一个孩子的长期教育安置;你可以筛,但不能让筛子的漏洞固定地漏掉某一个族群;你可以分类,但不能把分类变成终身判决。加州那个案子的结果,今天回头看,法律判决确实限制了测验的使用。法院认定,加州将黑人学生安置进EMR班所依赖的智商测验程序,违反了联邦法律。具体来说,校区不能继续以标准化智商测验成绩作为安置黑人学生的唯一或主要依据。判决之后,加州下令重新评估所有被安置在EMR班里的黑人学生,一大批孩子被重新吸收回普通班级。

这个判决的影响远远超出了加州。全国各地的学区开始重新审视自己的测验安置政策,测验出版商也被迫在手册里加上文化公平性的说明。测验行业第一次感到,法律可以在一个年级教室里拦下他们的尺子。

但历史的麻烦在这里咬合。法律可以限制测验的使用,却无法消除人们对分数背后能力等级的信仰。法庭判决里写得很清楚,测验分数受文化背景影响。

可判决书之外的世界,依然把低分数理解成低能力。一个被重新评估为“正常”的孩子,从EMR班转回普通班,同学和老师看他的眼神未必真的变了。那道标签,曾经印在学籍卡上,后来印在人的心里。法律文件可以改,签个字换个班;但那些年在慢班里落下的进度,那些因为低期望而不再挣扎的夜晚,那些家长签下安置同意书时笔尖的犹豫,不会被一纸禁令抹掉。

测验的分数好改,分数的后劲难消。这里我想把镜头放慢一点。案卷里没有留下多少家长在法庭外的表情描写,这很正常。历史材料记录的通常是程序和结果,不是眼泪。但我们可以从程序里看到人的位置。

有一个细节常被忽略:这起诉讼的原告,大多不是自己走出来的。他们的名字前面往往跟着父母的签名。父母签字,律师起草,孩子只是那个“被代表”的人。一个黑人小学生可能根本不知道诉讼是什么,不知道自己的分数为什么被大人拿去向另一群大人讲道理。他最清楚的,也许只是班上原来那些熟悉的脸不见了,自己又换了一个教室。

这个细节放在整个制度论证里,显得很小。可它最接近事情本身:当大人们在法庭上争论公不公平的时候,孩子已经在分班的漩涡里转了好几圈。他们不会去敲第二下门,就像上一章里那些拿着低分离开人事部门的年轻黑人接线员一样。他们把低分装进口袋,转身走进下一份被人挑拣的表格里。现在,法律在表格上面盖了一个章:此分数仅供参考,不得作为唯一依据。可表格还在。

测验出版商的应对策略,同样值得说清楚。他们不能公开抱怨法院,但可以调整产品。判决之后,几家大型测验公司加速推出“文化公平”或“文化缩减”的新测验版本。所谓文化公平测验,试图用图形推理、抽象符号替代语言和历史知识,把文化经验的占比压到最低。广告词变得比以前更谨慎,不再说“测出孩子的真实能力”,而说“为教育决策提供参考信息”。手册里多了几页法律合规说明,建议使用者在高利害决策中结合多种信息来源。

这些变化当然有积极意义。但另一面,新的测验依然免不了标准化,免不了区分度,免不了把分数变成标签。

文化公平测验只是把文化偏见的表面痕迹擦掉了一些,没有改变测验作为分配工具的底层逻辑。业内人士心知肚明,所谓“公平测验”更像一种市场公关。真正被法律逼出来的,不是一套没有偏见的题,而是一整套关于如何使用测验的行政程序。程序一多,签字的人就多,分担责任的人就多,将来再出问题,学校:我们遵循了手册的所有要求。这其实也是一种命运技术的自我修复。它没有消失,只是变得更合规了。

心理学家在证人席上的角色冲突,也不能略过。一方面,心理测量学是他们的专业,测验是他们亲手参与编制的工具,他们很难完全否认自己工具的价值。另一方面,当他们面对一个个被错分的孩子,面对那些明显不公平的比例,专业良心又逼着他们承认分数背后的文化杂质。这种撕裂,不是测验公司法律顾问的立场分裂,而是整个心理测量学科的深层矛盾。

它一直想成为一门像物理学一样价值中立的科学,可它的工具从来都用在价值密集的社会场景里。法庭把这种撕裂公开化了。

证人不能说“这题不难”,因为法官会追问:难不难对谁?在什么环境里?证人也不能说“分数就是能力”,因为对方律师会问:那为什么同一批孩子换了另一套测验,排名就变了?

这些追问,逼得心理学在证人席上做了一件它平时不太愿意做的事:承认自己的测量对象,根本不像长度和温度那样可以脱离背景存在。这件事,从学科内部看,是一段不太体面的历史;

从公众利益看,却是一场必要的拆穿。法律程序迫使测验的支持者公开承认分数受文化背景影响,这个“公开承认”比任何学术论文都更有分量。论文发表在期刊上,只有同行看;证词记在法院卷宗里,版权局、教育局、媒体、后来的研究者都会引用。

测验行业最看重的“客观性”形象,在法律的目光下被打了一道缝。缝不大,但光透进来了。后来所有关于测验公平性的讨论,几乎都绕不开这一章里的几次法庭交锋。它们像一小排桩子,打在智商神话的高墙底下。高墙没有倒,但开始摇晃。

现在可以回答那个最开始用温度计打比方的说法了。温度计不发烧,可它不是无辜的。

因为在这里,温度计并不仅仅反映现实,它还参与制造现实。一个孩子被温度计判了低温,就被送到一间不需要保温的房间,这房间反过来让他更冷。法律最后管住的是那间房间的分配方式,不是温度计的制造。至于心里那支温度计——那些被分数烙下的“我不行”的感觉,那些看到孩子分数就自动降低期待的眼神,那些在办公室里一看到低分简历就放到另一摞的手——几页判决书够不着那里。这才是这一章真正的未解压力。

最后,让我们落到一个安静的画面上。不是法庭宣判,不是律师握手,不是记者闪光灯。就是宣判之后很久的某一天,一个家长带着孩子从EMR班的旧教室走出来,穿过走廊,走到普通班门口。孩子的转班通知单上写着重新评估的结果,分数后面没有“落后”两个字。普通班的门开着,里面坐着三十个同龄人。孩子没有立刻走进去,他只是站在门口,手抓住了书包带子。那位家长也没有催,只是把手放在孩子的肩上,陪着站了一会儿。

这个画面没有出现在任何一份判决书里。但它就在那些转班通知单的夹缝中。

法律已经尽到了自己能尽的力:它拦下了那张试卷的单一裁判权。可门槛没有消失,它只是往后退了几米。将来孩子还要跨别的门槛,填别的表格,见别的分数。法律把尺子的锋刃磨钝了一点。人心里的尺子,还握在别的裁量者手里。这就是二十世纪七十年代那场法庭风波留下的真正矛盾。智商测试第一次在美国法律体系里被系统地检验,结果不是神话的终结,而是神话的一次收敛。

分数不再那么万能,不再那么不可挑战。可作为命运技术的底牌,那个关于“低分等于低能”的信仰,仍在社会的暗处运转。法庭上的分数被管住了,法庭外的分数还在流转。而在那些流转的尽头,教育体系的另一道门还开着——特殊教育的门槛,依然刻着数字的形状。