第 16 章

法庭扳倒的智商

“我们测量的是个体能力,不是种族。”

这句话出自1949年美国心理学会一份关于智力测验的官方声明。说这话的人叫罗伯特·耶基斯——没错,就是那个在一战期间帮陆军设计了甲种测验和乙种测验,把一百七十万新兵按照字母等级分类的罗伯特·耶基斯。

他需要在1949年说这句话。纽伦堡审判的余波还在震荡。纳粹医生坐在被告席上的照片传遍了全世界。那场审判把测量房的卡尺和集中营的筛选台焊在了一起。任何一个懂行的美国心理学家看到那张照片,都会后背发凉——因为他们认得出那些工具。德国人用的智商量表,往上追溯,和美国人用的是同一套祖宗。

切割势在必行。1946年到1950年间,美国心理学界完成了一次体面而迅速的理论转向。优生学这个词被扔进了垃圾堆。种族退化论被宣布为伪科学。智力测验被重新包装成一项中性的、个体化的、为民主教育服务的科学工具。耶基斯们说:我们从来没说过智力由种族决定。我们测的是单个的人。话是说清楚了。但工具还嵌在旧齿轮里。

如果你在1950年代走进加州任何一所公立小学,你会看到这个切割的限度在哪里。智力测验确实不再被用来给整个种族贴标签了。它被用来给一个个具体的六岁小孩贴标签。门牌从“种族低能”换成了“可教育智障”,但门还是那道门。让我们来看看这道门是怎么在一个人身上关上的。旧金山湾区。一个名叫拉里·P的黑人男孩被送进小学。

他母亲在别人家帮佣。家里没人说那种带完整从句的标准英语。老师注意到他在课堂上沉默,做题慢,注意力涣散。一份转介表填好,学区派来一位学校心理学家。白人,女性,说一口流利的标准英语。她把拉里带到一个陌生的房间,拿出斯坦福-比奈量表。“把这三块积木搭成这个形状。”“太阳从哪边升起?”“如果在商店里捡到别人的钱包,你应该怎么办?”

拉里的回答被逐条记录、编码、转成标准分。最后他得了67。低于70。这就是门槛。加州教育法的门槛。跨过这道门槛,一个孩子就不再是“普通学生”了。他被归入EMR——“可教育智障”。

他被从普通班教室里领出来,走过走廊,推进一扇标着EMR的门。门里面没有阅读课,没有算术课,教的是系鞋带、叠毛巾、刷盘子。教育目标写在学校档案里:训练生活自理能力。不指望回归普通轨道。拉里在里面待了六年。

没有任何人给他重测过。没有任何人在意那次测验的环境——一个陌生的白人女人、一间陌生的屋子、一套他家里从来没人那样说话的正式英语。没有任何人注意到,那些测验图片里画的是壁炉、网球拍和带草坪的郊区独栋——拉里住的是公寓。他见过的最接近壁炉的东西,是暖气片。但数字67已经被锁死了。它被写进了拉里的永久档案,像出生日期一样,成了这个男孩身上的法定属性。好,我们现在把这个个案拉开,看它背后的制度规模。

1960年代的加州公立学校系统里,黑人学生占学龄人口的比例不到百分之十,但在EMR班级里,他们占了超过四分之一。这不是一个学区的失常。旧金山、洛杉矶、奥克兰——数据摆在那儿,白纸黑字。学区官员被质问时,回答几乎一字不差:不是我们分的。是测验仪器分的。

测验仪器。这话说得好像智商量表和磅秤一样,没心没肺,不分皂白。但1960年代不是个能让人继续相信“仪器说了算”的年代。风从远处刮过来。1957年3月,古巴哈瓦那。巴蒂斯塔的总统府遭到突袭。

一群青年革命者——领头的叫安东尼奥·埃切维里亚——冲进行政中枢,枪声在政府大楼走廊里回荡。行动失败了,埃切维里亚当场阵亡。但三一三革命指导委员会的名字被刻进了那个动荡时代的国际记忆。我不是在跑题。

我要请诸位看的是全球气候。1950年代末到1960年代,从哈瓦那到河内,从阿尔及尔到伯明翰,被殖民者和被边缘化的人群在做同一件事——他们开始拒绝把压迫解释成自然秩序。

他们开始拆那些被权威贴了封条的装置,问一个简单到危险的问题:这是谁的规矩?按谁的尺度?这个风刮进美国的公立学校系统,变成了六个黑人家庭签在起诉书上的名字。1969年。加州旧金山联邦地区法院。

拉里·P和其他五个黑人孩子的家长起诉旧金山联合学区、加州教育委员会和州教育总监。案由写得不长,逻辑戳得死准:学区依据标准化智力测验把我们的孩子编入EMR班级。这些测验在文化和种族上存在系统性偏见。这种安置构成歧视。

案子一立案,整个教育测量界就知道——雷要劈下来了。在这之前,没人敢在法庭上直接攻击智商量表本身。你可以批评某个学区用错了常模。你某个测验过期了没修订。你可以要求加测别的项目。但你不能说——这套题本身就有毒。那是科学产品。科学产品怎么会错?它只可能被误用。

但Larry P.案的原告律师不跟你讨论误用。他直接把测验题目簿带进了法庭。让我们进入庭审现场。

这场庭辩在我读过的二十世纪教育法律档案里,应该被列为所有想理解“科学客观性如何在对抗性程序中解体”的人的必修课。被告方的证人席上坐着智力测验领域的顶尖专家。他们的论证逻辑清楚、训练有素、在学术会议上能赢得满堂掌声:斯坦福-比奈量表经过四十年的修订和标准化抽样。每一项题目都做过项目分析和信度检验。施测程序写在手册里,精确到主试该说的每一个字。这些工具测量的是个体的一般智力——g因子——这个因子在大量研究中显示出跨任务、跨情境的稳定性。它有预测效度。它能预测学业表现。这不是意识形态。这是科学。

原告律师没有接“科学”这个大词。他做了一件事。他打开测验题目簿,把题目一条一条念给法庭听。他先念了一道常识题:“太阳从哪边升起?”答案:东方。满分。好。

但为什么非要问“升起”?太阳并不升起——地球自转。这是从古希腊天文学一直错到今天的日常语言错误。

但你如果是个六岁的黑人小孩,在旧金山菲尔莫尔区的公寓里长大,你从来没见过地平线——你家窗户对着的是另一栋公寓的墙——你答“上边”或者“我不知道”,测验手册说你错。你的智力被扣了一分。再念一道:“在商店里捡到别人的钱包应当怎么办?”标准答案:交给店员或归还失主。

但诸位——你什么时候学会这个答案的?是你妈带你逛梅西百货,你看见过失物招领柜台,你妈告诉你“捡到东西交给柜台阿姨”的时候。那个柜台、那个流程、那套规范——它是一个特定社会阶层的育儿场景。如果你妈从来没带你去过百货公司——她带你去的是街角杂货铺,那儿的店主从来不设失物招领——如果你妈告诉你“别碰别人掉的东西,省得有麻烦”,你怎么答这道题?你答“走开”或者“不知道”。评分规则给你零分。

这零分打进了你的总成绩,你的总成绩被换算成67分,67分把你推进EMR教室。从今往后,你不再学阅读。你学叠毛巾。这不是科学测验。这是文化筛选伪装成了认知测量。

原告律师又拿起一本韦氏儿童智力量表,翻到词汇分测验。“什么是‘钻石’?”标准答案需要包含“宝石”“贵重”“坚硬”之类的语义要素。但一个在奥克兰公屋里长大的黑人小孩,他从哪儿接受“钻石”的定义训练?他妈跟他说过最接近的词是“玻璃”——“别踩碎玻璃”。他答“亮晶晶的东西”。

评分为零。一套又一套。题目被一条条拆开。拆到后来,法庭上出现了一个不大不小的尴尬时刻——被告方的专家证人在交叉质询中承认,某些个别题目的文化负载可能确实偏高。但他们马上补了一句:但整个量表作为一个整体,文化偏差在统计上可以被稀释掉。原告方的反击来得快。你们说稀释。

那你们告诉我——67分这个数字,是从被稀释过的数据里算出来的,还是从没被稀释过的单条回答里加出来的?被告方沉默了几秒。这沉默就是答案。测验分数是个体对一百多道小题的回答逐条累加出来的。每一道文化偏见题都在加分过程中做了贡献。它们没有被稀释。

它们被忠实地收藏在那个三位数的总分里——那个总分后来出现在拉里的永久档案袋上,决定了他未来六年乃至一生要走哪扇门。

到这里,我必须正面回应那个最强的反论证了。在法庭之外的心理测量学圈子里——即使是相当一部分反对种族歧视的学者——也在反复强调一个事实:智力测验的确测量了某种真实而稳定的认知能力。g因子不是一个幻觉。智商分数可以在统计上显著预测学业成绩、职业成就、甚至健康状况。这种统计关系不会因为你讨厌它就消失。

这是真的。g因子不是一个凭空捏造的概念。它的统计效应在心理测量学文献里被重复复制了无数遍。

但问题是——预测不等于解释。相关性不等于公平性。智商分数之所以能预测学业成绩,不是因为分数抓住了某种纯生物性的大脑功率——而是因为现代学校教育和智商量表测量的是高度重合的认知习惯。抽象符号操作、标准语言理解、去情境化的问题解决——这些东西在智商测验里加分,在学校里也加分。测验不是在独立测量“潜能”。

它在测量一个人对主流教育环境的文化适应程度。然后把适应程度翻译成“天赋”。再说白一点:如果一张测验卷子里的词汇、常识、推理情境,全面偏向某个社会经济阶层的日常经验,那么这张卷子测出来的高分,就是那个阶层的经验被转化成的数字优势。这不是阴谋。这是机制。

Larry P.案的法官听懂了这个机制。1979年,罗伯特·佩卡姆法官发布判决书。文字不煽情,法理拆得稳。他写道,标准化智力测验“在文化上存在偏见”,将其作为安置黑人儿童进入特殊教育班级的主要依据“违反了宪法第十四修正案的平等保护原则”。他下令禁止加州学区对黑人学生施测智商,并将其作为EMR安置决策的组成部分。1986年,第九巡回上诉法院维持判决,并扩大了禁令范围。判决语言说得很明确:不能把智商量表作为分配黑人学生进入任何特殊教育轨道的依据。

法槌落下。加州教育测量界一片哗然。有些学区紧急撤下了斯坦福-比奈量表。有些学区开始寻找替代工具。

整个特殊教育评估程序被强制改写——必须加入非语言测评、非标准化的教学观察、家长访谈、多元评估团队共同决策。智商分数不能再坐那把唯一的交椅了。

从制度层面看,这是智商测试在美国遭遇的第一次重大法律挫败。它的意义不在技术细节——哪套测验被禁,哪个分值被取消——而在一件事:智商量表第一次被剥掉了科学中性的外衣,作为一项可能造成歧视的社会设置接受法律审查。在Larry P.案之前,你要批评智商测验的文化偏见,你会被视作不懂科学的煽动家。在Larry P.案之后,官方文件里正式写下了“文化偏见测试”这个词组。

这是一道分水岭。但我现在要把判决必须话的后半截说出来,因为那半截不说,整章就不诚实。判决生效之后,教育系统中对黑人儿童的标签化并没有消失。它转移了。许多学区改用了号称“文化公平”的非语言测验——比如雷文渐进矩阵,全用图形,没有文字。看起来干净了。但后来的研究表明,图形推理的能力和学校教育年限、纸笔操作的熟悉程度高度相关。

一个在密西西比河三角洲农村教会学校长大的孩子,一年摸不到几次抽象几何图形。把文字去掉不等于把文化去掉。它只是把文化的指纹擦得更干净,让偏见更难被追踪。

另一件事发生得更隐蔽。一些学区把EMR的门牌换了——学习障碍、语言迟缓、注意力缺陷。分类更细了,看起来更尊重个体特殊性了。但底层逻辑没变:这个孩子还是被从普通教室里领走,还是被塞进低期待轨道的课程,他的老师还是不在备课本里写“上大学”这个目标。

而所有这些新标签的评估报告首页上,依然印着一个智商数字。法律能禁止一种用法。法律禁止不了信念本身。1980年代末,加州的黑人家长没有停止斗争。他们发现,EMR的门被法院堵上了一半,另一扇门却开得比任何时候都大——那就是天才班。GATE项目。天赋与才能教育。这些项目的选拔极度依赖智商测试和标准化成就测验。

白人家庭和中产家庭的孩子大批涌入,黑人家长和低收入家庭的孩子入选率低得让人不得不怀疑那把尺子的材质——它是不是和测出EMR的那把,用的是同一块钢板。同一个数字,上次说你低能。这次说他天才。上次你们说是歧视,这次你们说是科学鉴别。这个逻辑不矛盾——只要你不追究数字背后那个未经检验的假设。那个假设是:智力是天生、稳定、可被标准化程序干净捕捉的东西。测出来的数字是客观的。按照数字分配资源是合理的。

这个假设,Larry P.案没有消灭它。法院做不到。法院可以禁止政府机构用某种方式使用一个数字,但法院不能禁止六百万个家庭在晚餐桌上说:“我们家孩子智商高。”不能让教师办公室里不再流传“这孩子脑子慢”的评语。不能让招聘网站的后台不再把认知能力测评分数默认为筛选条件。

评估工具被送上法庭受审,科学权威被扒了一层皮。但命运那台机器没有停转。它学会了用更文明、更精细的方式继续运转。它藏在“多元评估”的程序夹层里。它躲进“认知潜能”这样更文雅的词里。

原告律师没有停下。他翻到韦氏儿童智力量表的词汇分测验,念出了另一道题:“什么是‘勇敢’?”标准答案的关键词是“面对危险不害怕”“有勇气”“敢于挺身而出”。

听起来没毛病。但你再往深想一层。一个在奥克兰公屋长大的黑人男孩,他每天面对的“勇敢”不是字典定义——是在楼道里遇见拿刀的人时知道怎么侧身让过,是警察拍门时知道把手放在看得见的地方,是看到社工来家访时知道什么该说什么不该说。你让他用完整的主谓宾从句把这些经验转化成标准英语,他不一定能做到。他能做到的是活下来。

测验不在乎这些。测验只认那个定义。答不出“面对危险不害怕”就拿不到分数。又一个零分被忠实地加进了总分。

原告律师抬起头,问被告方专家:“你们在设计这道题的时候,有没有考虑过不同社会阶层的儿童对‘勇敢’一词可能有完全不同的经验性理解?”专家证人停顿了一下。他的回答在庭审记录里被标了一行字:证人未直接回答该问题。

这不是孤例。一套又一套,题目逐条晾在法庭的荧光灯下。图画补全分测验:画的是一个白人男孩在草地上打棒球,球棒少了一截,孩子要指出缺失的部分。

但如果你从来没见过棒球棒——你从小到大玩的运动是街头篮球,用的是没气的橡皮球,球架是钉在电线杆上的牛奶筐——你怎么知道那根木头棍子应该长什么样?这不是智力缺陷。这是生活半径不允许。

排列图片分测验:几幅画打乱顺序,孩子要排列成一个合乎逻辑的小故事。其中一套画的是一个人从电烤箱里取出烤好的饼干。

烤箱。烤盘。预热的厨房。那个黑人孩子住在公寓楼里,他家的厨房只有两个灶头,烤箱坏了很多年,他妈从来没用过。

烤饼干这件事不在他的经验库里。他试着排序,排错了。扣分。算数推理分测验里有一道应用文题:“约翰有二十五美分,他买了一根十美分的棒棒糖,又买了一根六美分的口香糖,他剩下多少钱?”这道题的数学部分极其简单——二十五减十六。问题不在计算能力,在“约翰”“棒棒糖”“口香糖”“美分”这些词构成的那一整套消费场景。

一个六岁的黑人孩子可能已经帮他妈算过很多东西了:食品券能换几罐奶粉,公交车怎么倒车能省一张票,月底房租还差多少。但他妈不太会给他一个叫“零花钱”的东西。他也极少走进那种玻璃柜台里摆着棒棒糖和口香糖的店面——那种店在郊区购物中心,不在他住的街区。他管那玩意叫“糖”,不知道它分“棒棒糖”和“口香糖”。

题目读一遍,他没听懂。再读一遍,他的注意力已经耗尽。测验手册规定不许解释词义。答错。或者不答。都算零。这些零被累加,被换算,被锁死在一个三位数里,然后在学区的档案柜里推着这个黑人孩子离开普通教室的走廊,推进一扇标着EMR的门。我们现在必须停下来回答一个更根本的问题。那些出题的美国心理测量学家——他们难道不知道自己在干这个?

这个问题的真实答案比简单的“种族歧视”复杂得多,也比它冷得多。斯坦福-比奈量表最初的标准化抽样在1937年。韦氏儿童智力量表在1949年。这两次大规模抽样的人群样本,主体是中产阶级白人儿童。测验编制者把目标瞄准了“一般美国学龄儿童”。

但“一般”这个词在统计学上有一个被刻意忽略的前提——当你用一个特定人群的常模去代表“一般”,任何偏离这个常模的回答模式都会被自动识别为“缺陷”。这不是偏见动机。这是方法设计本身的结构性后果。

好,我们现在回到法庭。被告方专家的最后一道防线是这个:即便个别题目确有文化负载,整份量表因为包含一百多道题,不同类型的题目可以从不同角度测量一般智力,那些噪声总会互相抵消。律师追问:实验证据呢?你们的信效度研究里,有没有做过针对不同种族和社会阶层儿童的分组偏差检验?

有没有比较过这些题目在黑人儿童和白人儿童中的项目功能差异?在这个案子进入庭审之前,答案是没有。这个没有,不是有人故意隐瞒。是测验编制行业根本没觉得有必要做。他们一直假设,智力作为一般因子,是跨文化普适的。如果有群体得分偏低,那不是偏见,是那个群体能力差。

先有结论,后看数据——这就不是科学的事了。这是科学内部长出来的循环论证。

法官佩卡姆听进去了。他在判决意见书里做了一件司法史上罕见的事:他不是只引用双方专家的证词摘要,而是亲自动手分析了测验题目和文化偏见之间的具体关联。他写道:“法庭审查了这些测验的具体内容,发现大量题目要求受试儿童拥有白人主流社会的特定知识和经验。这些知识和经验并非智力的组成部分,而是特定文化环境的产物。”法槌落在这个句子上的时候,智商量表在美国公立教育系统里的不可审查地位,第一次被实质性地打碎了。

现在我们要从法庭切到制度回应的层面。判决之下的加州,教育系统并没有瘫痪。它转起来了——但转的方式值得仔细看。

学区被要求在两年之内拿出替代评估方案。一群测量专家、特殊教育协调员、律师坐在一起,讨论“非歧视性评估”应该长什么样。

他们写上了一条又一条。不能单独依赖智商分数。必须加入课堂表现的观察记录。

必须纳入家长提供的孩子发展史。评估团队必须有多种专业背景的人参与——学校心理学家、特殊教育老师、社会工作者。决策必须有多个数据来源交叉验证。这些规定写在纸面上,字字合理。

但制度运行的逻辑从来不看书面规定,它看的是资源和惯性。旧的斯坦福-比奈量表从柜子里撤走了。新的评估手册印好发下来了。

但那个负责评估的学校心理学家还是同一个人——白人女性,时间表上排着八十个待评估的孩子。她的“课堂观察”是被压缩成一个二十分钟的窗口时间,站在教室后门看了一眼。她的“家长访谈”是一个电话,对面那头是一个白天在别人家帮佣的母亲,被叫到雇主的座机旁边接听,说话声音压得不能再低。

“多元评估”变成了填更厚的表格,盖更多的章,花更多的时间。但底层那个逻辑没人敢碰——还是要在某个时间点,由某个手握测量工具的专业人员,对某个孩子做出一个标签化的分类决定。因为美国公立学校的特殊教育拨款制度,是绑定在分类标签上的。没有标签,没有资金。没有资金,你连一个额外的助教都请不到。

这正是智商测验在法庭上被扳倒之后,还能继续呼吸的真正土壤。它栖身在制度的毛细血管里。你可以禁止它的名字,但你禁不掉分类本身的需求。

分类需要证据。证据需要一个看上去客观的数值。这个数值最终还得从某种标准化测量里冒出来。

它不作古。它改头换面。这就是Larry P.案判决划出的那条边界。它赢了一场巨大的法律胜利,但它暴露出一个更难对付的事实——科学权威可以被法庭打碎,但只要支撑它的分类制度不动,碎片会自动重新粘合,只是这一次,粘合剂更隐蔽。那些被推开的EMR教室的门,没几年就被另一批标签推开了。学习障碍。语言迟缓。注意力缺陷。发育迟缓。

每一个新标签的评估流程都写着“排除文化偏见”“多维度测量”,但每一个流程的首页,在很多学区,仍然有一个空格等着填那个智力商数。法律禁止它作为唯一依据,但不禁止它作为“参考信息”之一被写进档案。只要它还在档案里,它就还是一把尺。它的材质没有变。它的刻度没有变。它曾经把拉里送进EMR教室的那套换算公式,仍然在别处安静地运行。而站在这个时间点上——1979年判决书签署的那个月份——大西洋另一端,詹姆斯·弗林已经开始注意到从两代人的测验数据里渗出来的异常。

它把自己科学方法论论证写得更厚。但它仍在做同一件事——把复杂的人压成数字,再用数字替人开门或关门。到这里,我必须把这一章真正要讲的东西点破。

Larry P.案的法槌在1979年落下。但就在同一时间,隔着一个太平洋,新西兰南岛达尼丁市,一个教政治学的中年学者正在做一项没人委托的统计工作。他叫詹姆斯·弗林。

他从各国历年智商测验数据里翻出了一个被整个学术界忽略了几十年的现象——每一代人的原始分数都在往上涨。而且涨的幅度大到让人无法用“天生智力代际变化”来解释。

弗林不是心理学家。他不管g因子稳不稳定。他只看着那些数字,问了一个和拉里的律师异曲同工的问题:如果分数在变,那这玩意儿到底测的是啥?这个问题一旦被端上台面,智商量表所依托的整个理论地基——智力是天生的、稳定的、超越文化的——就会从另一个方向被撕开。

弗林看到的不是歧视,而是历史性变化本身。他发现的裂缝,比法庭上任何交叉质询都更难修补。Larry P.案结束的地方,问题没有结束。

那把法槌撬开的不是一道门,是一条缝。而缝的后面,还有更尴尬的事实等在数据里。只是当时站在法庭上的人们还不知道,那把曾经不可审查的圣坛上,裂缝才刚刚开始蔓延。