第 9 章
种族与基因的战场
1969年春天,在那把冷战量尺即将撞上种族问题的前夜,如果有人告诉你,一份教育心理学期刊能把一所顶尖公立大学变成战场,你可能觉得这个人看多了科幻小说。学术论文嘛,躺在图书馆里吃灰才是常态。可是《哈佛教育评论》那年春季号出刊以后,加州大学伯克利分校真的炸了。
学生占领教学楼,扩音器架在广场上,口号声震得窗户嗡嗡响。抗议的对象不是白宫,不是五角大楼,而是一篇一百二十三页的论文。论文作者是伯克利教育心理学教授阿瑟·詹森,题目平淡得像教务处通知:《我们可以把智商和学业成绩提高多少》。这个标题没有任何修辞,没有感叹号,甚至透着一股技术人员的谦逊——它好像在说,我只是来讨论一个技术问题的。但读过全文的人都知道,詹森的结论一点都不谦逊。
他写道,美国黑人和白人之间大约十五分的平均智商差距,主要来自基因差异,而不是环境剥夺。因此,联邦政府砸钱推行的补偿教育项目,从基因概率上说,注定失败。这句话,等于在一份学术刊物上宣判了美国民权运动以来最核心的一项社会政策的死刑。
消息传开的速度快得离谱。先是有研究生把论文复印出来贴在了系里的公告栏上,用红笔圈出了那句关于基因的段落。接着,黑人学生会组织了公开抗议。再接着,有人趁夜里往詹森的办公室门上泼了红漆。那扇门是木头的,红漆顺着纹路往下淌,停在他名字的铭牌上。第二天早上,詹森来上班的时候,警察已经站在走廊里了。他的课堂需要武装警卫把守,学生冲上讲台把他的论文撕成碎片,撒向空中,有人喊“种族主义者”,有人喊“纳粹”,还有人喊得更直接——“伪科学”。
这场火的燃料,不是詹森一个人在实验室里点起来的。如果你还记得上一章那个在天上响了三个月的苏联卫星斯普特尼克,那我得告诉你,冷战的量尺从天上掉下来以后,一直悬在美国教育系统的头顶。它量完白人小孩量黑人小孩,量完成绩量智商,最后量到的不是教育质量的差距,而是美国社会最深的那道裂痕——种族。斯普特尼克危机催生的《国防教育法》把标准化测试推向了全国。每一个学区、每一个年级、每一个孩子都被放到了同一把尺子上。
这套做法的初衷,是把美国孩子的能力和苏联孩子比一比,看看谁更聪明。可是一旦你开始用统一标尺在本国孩子内部排名,一个无法回避的问题就会浮出水面:为什么排在前面的大多是某种肤色,排在后面的又大多是另一种肤色?冷战的量尺追求群体比较,比较的结果一旦被种族化,量尺就变成了武器。詹森就是在这样的制度土壤上写下那一百二十三页的。
说回詹森这个人。他当时四十五六岁,在伯克利教书十几年,研究方向是心理测量学里一个叫“一般智力”或者“g因子”的东西。这个方向听上去很技术化,研究的是智商测试里各种题目背后那个共同的心理能力。他不研究种族,不研究政治,准确地说,他原本不关心社会问题。让他转向种族与智商这个火药桶的,是一个叫威廉·肖克利的诺贝尔物理学奖得主。肖克利这个名字,今天的人可能只在半导体历史上见过。他是晶体管的共同发明人,斯坦福大学教授,硅谷科技精英的精神祖宗之一。
1960年代中期,肖克利突然对遗传学产生了强烈的兴趣,开始到处演讲,鼓吹一个冷硬的主张:智力主要靠遗传,智力不均衡必然导致社会分层,社会分层是自然秩序的反映。这些话放在今天听也够刺耳,放在1964年《民权法案》和1965年《投票权法案》刚刚通过的美国,简直是跟整个时代对着干。肖克利被舆论围剿,但他有一个本事:他不断引用智力测验的经典文献,把别人的道德愤怒一律视为“不懂统计学”。他后来找到詹森,要求这位教育心理学家“认真对待遗传对智力的影响”。詹森接过了这个题目。
说到这里,必须澄清一件事。如果你以为詹森是个披着学术外衣的政治煽动家,那就把问题想简单了。从气质上说,这个人更接近于一个相信数据能解决一切争议的技术官僚。他想在方法上做到无懈可击,所以论文才写了一百二十三页,而不是一篇十来页的短评。他先引了几十项双胞胎研究和收养研究,算出在一个给定群体内部,智商差异有多大比例能被基因差异解释。这个数字,就是心理测量学里的遗传率。
詹森给出的结论是,大约百分之八十。请注意,这是一个关于个体差异的数字。它的意思是,同一群人里,张三比李四聪明多少,基因解释力很强。这本身在当时的双胞胎研究里不算离谱。
詹森接下来做的事情,才是真正的引爆点。他把群体内的遗传率推向了群体间的差异。他的逻辑链条是这样的:既然在一个群体内部,基因解释了智商差异的百分之八十,那么美国黑人和白人这两个群体之间十五分的平均智商差距,很可能也主要来自遗传。既然基因的作用这么大,靠早期教育、营养改善、家庭支持这些环境手段去填那道沟,空间就非常有限。
所以他在论文里说,补偿教育“已经得到了一次公平的、或许是理想的机会来运作”,结果却是“平均智商几乎没有变化”。他在措辞上并不是百分之百的武断。他留了余地,说基因在群体差异中的解释权重可能在百分之五十到百分之九十之间。可这种百分比的精细表达,一旦离开学术刊物,就只剩下一句话:黑人天生不如白人聪明。
对街头抗议的学生来说,任何比例,只要大于零,就踩在了政治和道德的红线上。对正在缩减福利预算的保守派政客来说,百分之五十足够让他们合上钱袋了。
我们把镜头再往后拉,看看詹森论文出现时的制度现场。1960年代中期,美国最大的一项社会实验叫做“向贫困开战”,林登·约翰逊总统推动的。这场战争的口号是,贫困不是穷人自己的错,是社会结构出了问题。战争的主力部队不是军队,而是一个叫“开端计划”的项目,给贫困家庭的孩子提供学前启蒙、营养餐、健康检查和早期教育活动。背后的信念很明朗:穷人家的孩子只是缺少机会和刺激,现在推他们一把,他们就能追上来。
“开端计划”花了联邦政府不少钱,国会盯着呢。议员们在听证会上要问成效,项目官员要写评估报告,制度运转需要可量化的证据。
于是,智商分数被请进了评估体系。今天你看上去,这个选择几乎带着荒诞的反讽:你要检验一个帮助贫困孩子的项目,却用了一套从设计之初就没有打算被用来训练和评估贫困儿童的测验去衡量。
可是在当时,这个逻辑顺理成章。智商分数被认为是标准化的,是可比的,是可以每年重复测的。它满足了一个官僚体系对数字证据的所有需求。测验结果出来以后,“开端计划”的孩子们智商分数有短暂上升,然后过一两年又落回去了。批评者抓住这个结果,宣布补偿教育没有持久效果。他们的逻辑很简单:花了那么多钱,智商分数没变,这钱不是白花了吗?
詹森的论文就是在这个关口出现的。全美国都在争论,到底还要不要继续往贫困社区投钱。詹森提供了一个科学版本的回答:不必投了,因为环境改不了基因。这话听起来冷酷,但在冷战之后形成的国家测试文化里,恰恰最让政策制定者感到踏实。有一份同行评议的论文作证,总比听街头抗议者喊口号要省事。于是论文被迅速接过去,操弄得比詹森的原意还要粗暴百倍。国会议员在听证会上引他的研究,说社会福利只会让“劣生者”生更多孩子。南方的学校董事会用他的论文否决黑人社区的校舍改善计划。极端右翼刊物把智商差距当成“种族无法同化”的科学证据。
詹森后来在接受访问时反复强调,他只是做科学。但科学家的名字一旦出刊,定义权就不在他手里了。引用他的人不会标注统计学前提,不会注明那百分之五十到九十的浮动区间,也不会为十五分的智商差距写方法论脚注。他们只会说:伯克利那位心理学家用数据证明了,黑人天生不如白人聪明。这正是这一章要拆开的机制。
先看第一个环节。智商分数在不同的种族群体里,是否具有同样的科学意义?詹森的整个推断都建立在一个假设上:一个得85分的黑人孩子和一个得85分的白人孩子,他们的认知能力处在同一个水平上。测出来的数字相同,就代表能力相同。这个假设听起来似乎合理,但它恰恰是智商测试从诞生之日起就一直未能解决的核心争议。这套工具的源头,是1905年法国心理学家比奈设计的儿童智力量表。比奈的目的非常具体,就是找出巴黎小学里需要特别辅导的孩子。他从来没说过,这套题能把一个人的天生智力天花板给测出来。他甚至明确警告过,不能把量表变成给孩子贴标签的机械工具。
比奈的量表是为教育诊断服务的,不是为人类排名服务的。但这份量表到了美国以后,完全换了一副面孔。斯坦福大学心理学家推孟在1916年将它改编成斯坦福—比奈量表,用途从诊断变成了筛选——把“天才”和“低能”从人群里挑出来。推孟本人是优生学运动的同情者,他的题库里塞满了美国中产阶级白人孩子熟悉的生活常识和词汇传统。比如,题目会问冬天的特征,问邮局是干什么的,问一把刀和一把叉有什么共同点。
这些内容对一个生长在郊区中产家庭、父母都是读书人的孩子来说,是日常生活的自然延展。但对一个生长在南方农村黑人佃农家庭、父母都不识字的孩子来说,这些题目问的是一种他从未生活过的经验。测试从一开始就不是文化中立的。它偏好的语言风格、图形逻辑和快速抽象判断,恰恰是二十世纪工业社会里占据上升通道的阶层最熟悉的认知习惯。当这些人被设定为“常模”模板之后,任何不同文化背景的孩子来考这套题,都会被换算成一个“落后”的位置。
冷战的量尺没有重新校准这些文化权重,它只是把这份带着历史偏好的模板大规模分发出去,装进全国学区的档案柜。
再看第二个环节——遗传率。詹森说群体内遗传率大约百分之八十,这在当时和今天的双胞胎研究中,都不是一个伪科学数字。同一个群体内部,基因差异确实能解释大部分智商分数的差异。
但问题在于,群体内遗传率高,不等于群体间差距就是基因造成的。这是一个基本的逻辑规则,詹森的论文恰恰在这个关节上出现了致命的滑动。举一个现代农业里的类比。
假设你有两块田,甲田土壤肥沃,常年施足肥料,灌溉无忧;乙田土质贫瘠,水量不足,还经常闹虫害。你在甲田里种同一种种子,收成有高有低,这些差异主要来自种子本身的基因差异,因为土壤条件是均质的。你在乙田里也种同一种种子,收成同样有高有低,也主要来自基因差异。在两块田各自的内部,基因的作用都是决定性的。
但如果你要问“甲田和乙田的平均收成为什么差那么多”,你不能说这个差距主要来自种子的基因差异,除非你先证明两块田的土壤条件完全相同。事实上,这个差距很可能就是土壤——种子生长的环境——造成的。群体内遗传率再高,也完全不等于群体间差距来自遗传。詹森知道这个陷阱吗?回看论文,他在部分段落里确实承认,在理论上不能从一个群体内的遗传率直接推出群体间差异的成因。但他承认归承认,写完这句话以后,又继续用那个百分之八十去反推:种族间智商差距“很可能”是遗传的。那个“很可能”从学术刊物流到社会之后,“可能”两个字被滤掉了,只剩下“已经证明”。
美国心理学界对詹森论文的第一反应,不是欢呼,而是恐惧。恐惧的不是他一定算错了,而是他的说法太容易被人拿去当武器了。一群受训于同一套统计方法的心理学家开始公开反驳。哈佛大学发展心理学家杰罗姆·卡根用实验数据指出,智商分数对环境变化非常敏感,早年的刺激剥夺可以在短期内拉低分数,而改善营养和亲子互动则能让分数回升。
这些发现说明,智商不是一个固定不变的量,而是一个随着生活环境上下浮动的指标。普林斯顿大学的心理学家利昂·卡明走得更远。他没有纠缠詹森的统计学细节,而是从根源上发难。卡明重读了美国智商测试的早期历史,发现了一个几乎被遗忘的事实:最早把比奈量表引入美国并进行大规模推广的那批心理学家,包括推孟在内,几乎都是优生学运动的骨干成员。
他们设计测验的时候,根本不是出于公正测量智力的学术目的,而是为了给社会排斥提供数字背书。用测试得分来论证某些族裔“天生低能”,然后名正言顺地把他们挡在移民大门之外,或者送进强制绝育的机构,这才是智商测试在美国最早的政治功能。卡明的批评像一把扳手,不是拆墙,而是从地基开始拆。他告诉人们,这栋智力测量大厦从第一块砖开始就是歪的。
这场争辩越滚越大。1970年代,美国各大心理学系里几乎人人都得表态。一部分测量心理学家试图划清界限,说詹森只代表一种极端观点,不代表整个学科。
但在公共舆论里,任何站出来说“詹森在方法论上提出了值得讨论的问题”的人,下一秒就可能被扣上种族主义者的帽子。另一部分人则干脆离开智商研究这个领域,转向对测试文化的批判和重建。
心理测量学期刊的编辑们发现,每收到一篇涉及种族差异的论文,信箱里就会多出几封措辞激烈的来信,一方说这篇论文在延续奴隶主思想,另一方说退稿就是压制学术自由。编辑们被迫在每一个用词上都反复斟酌,生怕一个形容词引发一场学术内战。
这件事实质上脱离了科学辩论的轨道。它变成了一个政治站队问题,而政治站队从来不需要翻完一百二十三页论文才能下判断。
詹森本人的反应,也许是这场冲突里最令人扼腕的部分。他觉得自己是这场疯狂中唯一的理性派,拒绝公开辩论,认为那不过是情绪化的表演。他把自己关进书房,开始写更长的论文,加入更复杂的公式和更多的遗传学文献,越来越钻进遗传决定论的堡垒。越是被攻击,他反而越相信自己是那个在暴民面前坚持真理的孤独科学家。
这是心理测量学史上最具戏剧性的反讽:一个相信数据可以客观解决争议的人,却恰恰被数据引发的社会情绪围困,最终自己也变成了情绪驱动的囚徒。科学争论一旦变成身份标签之争,证据本身反而退居其次,对立的双方都被推得越来越远,远到谁也听不见谁在说什么。
从这个角度回看,詹森论文的真正要害,不在那十五分到底是不是基因造成的。这件事可能永远不会有百分之百的科学定论,因为人类智力基因的作用永远和环境纠缠在一起,不可能在实验室里拆干净。
论文的真正遗产,是把智商测试长久以来披着的那件“中立工具”外衣彻底扯了下来。
人们开始追问一连串问题:谁在出这些题?为什么这些题测到的能力恰好是社会统治阶层拥有的能力?为什么测量结果一次又一次被用来论证某些群体天生不适合受教育、不适合掌权、不适合获得福利?当这些问题被大规模抛进公共领域之后,智商测试就再也回不到心理学系办公室里干净的测量技术世界了。
它暴露了自己的本质:一种把人的复杂潜能压缩成单一数字,再依据这个数字分配生命机会的社会装置。这本书里有一个词叫“命运技术”,说的就是这种东西。
詹森事件之后,所有人都看见了这台装置的价值负载。它不是中立的,它从诞生第一天就带着优生学的胎记,那个胎记在种族政治的烈火里,怎么洗都洗不掉。
也许你会问,这工具争议这么大,为什么社会没有干脆把它扔掉?这就得回到一个更棘手的悖论。智商测试虽有历史污点,但它所测的一般智力——g因子——在许多大规模研究里,确实展现了对学业表现、职业成就和收入的预测力。这不是宣扬优生学的人编造出来的幻觉。在类似文化环境里,一个人的智商分数和他的考试排名、升学结果乃至成年后的工作薪酬之间,存在中等强度的相关性。心理学家会说,这种相关不能被简单地归因为社会经济地位的混杂效应,因为在统计控制之后,一定比例的预测力仍然存在。
这就构成了心理学史上最难缠的矛盾:一个工具可以既不中立,又有预测力。
它给出的数字是真的有点用的——公司和军队可以据此分配岗位,学校可以据此调整教学质量,政策部门可以据此判断某个项目的成效。
可是这份有用的背后,是它把历史和社会的偏好埋进了测试题目里,然后倒过来说“这些题目预测了谁会在这种社会里成功”。它的预测力不是来自对先天潜能的精确丈量,而是来自一个自循环预言:我们让下一代人去考这些题,是因为我们先让他们活在一个被这些题型背后那套认知习惯所主宰的世界里。然后我们指着分数说,看,分数高的人果然是聪明的,分数低的人果然需要更少的教育资源。
循环一旦闭合,测试就变成了制造它所预测的结果的机器。这正是命运技术的可怕之处。它不仅筛选人,还制造了被筛选者“命该如此”的自我认知。
一个在贫困中长大的黑人孩子,从小学一年级开始,每年都要坐在教室里考一套他不熟悉的量表。分数年年告诉他:你不够聪明。老师的同情里夹着放弃,父母的沉默里夹着无奈,同学的目光里夹着轻蔑。
报纸上还时不时出现“种族智商差距可能是遗传的”这样的标题。层层叠加上去,用不了几年,他自己也会相信,他确实是天生就差了别人一截。
即使他后来学会修车,能在几秒钟内听出变速箱故障的位置,即使他在非标准化情境下展现出其他测试根本不测的能力,那份档案里的智商数字还是钉在他身上。量化分类的铡刀一切,标签贴完,某些门就提前为他关上了。而这些门背后所依据的判据,从来不只是“认知能力”这几个字能说干净的。
詹森事件最重要的转折就在这里。它不是科学击败伪科学的胜利,也不只是一次正义情绪对技术傲慢的修正。
它是一次被迫的公开摊牌——让所有人看见,那把量尺后面站着的,从来不只是统计学家和他们的正态分布曲线。站着的是一整套关于谁值得被教导、谁值得被救济、谁值得被信任的政治判断,是统治机器对被统治者潜能的计算和分配。这场爆炸把心理学、遗传学和公共政策的边界彻底撕开。
从那以后,遗传学家不敢再轻易谈论智力基因,公共政策专家对任何涉及种族的量化指标杯弓蛇影,而心理测量学者则在学术自由和政治正确之间寻找越来越窄的缝隙。
影响不仅体现在学术圈。关于智力本质的争论从此彻底走出了实验室,变成了大众文化和选战的原材料。报纸副刊、电视辩论、教堂布道和社区集会,都开始讨论“智商是天生的还是可以改变的”这个问题。而每一次讨论,都会有人把詹森的论文从尘封的期刊里翻出来,当作终极论据或者终极靶子。
这团火没有灭。它会在二十五年后,以另一种面貌再烧起来,把智商测试的政治属性推到白宫门口。到了那时候,人们会看见,詹森在伯克利被泼了红漆的那扇门,又被人用另一种方式敲开了——不是用抗议者的拳头,而是用畅销书的书脊。
而这一章要留给你的,不是一个关上的答案,而是一个仍在继续的历史后果。当一份科学论文的名字可以被街头口号改写含义,当一间大学里的红漆涂门可以被大众出版业做成封面卖上百万册,这说明智商测试已经不再属于发明它的心理学家。
它属于争夺它解释权的所有人——属于用它来削减福利预算的政客,属于用它来证明种族歧视合理性的种族隔离主义者,也属于那些在街头抗议中试图夺回自我定义权的年轻人。
有一件事被许多后来的论述忽略了。伯克利那扇泼了红漆的门,旁边是詹森办公室的窗户。窗玻璃没有碎——从始至终,没有人砸那扇窗户。红漆只泼在门外的墙面上,溅了几滴在门把手上。
门没有打开,但墙已经裂了。裂缝从伯克利蔓延向全国,把智商测试从实验室推向了街头,推向了国会听证会,推向了每一个相信过或者被“你的智商分数等于你的价值”这句话审判过的人。这道裂缝,直到今天也没有弥合。
今天在加州大学伯克利分校,学生们还能找到当年教育心理学系所在的建筑。门当然早就换过了,墙也重新粉刷过,完全看不出红漆的痕迹。但如果你拦住一个心理学专业的本科生,问他詹森是不是“用科学证明了种族智商差距”,他会表现出某种本能的警觉。那种警觉不属于数据,不属于方法论,它属于记忆。
这份警觉,就是1969年那场风暴留给美国社会的遗产。人们不再遗忘,但也还不知道该拿这个数字怎么办。
这就是种族与基因的战场最根本的困境。你无法只靠测量更多数据,或者把统计学做得更精美,来解开这个结。因为你面对的不是一个技术错误,而是一个逻辑结构和历史债务。
技术错误可以修正,逻辑结构只能被看穿,历史债务则需要在漫长的不平等修复中慢慢消解。这些事不是心理学家单独能完成的,也不是政治家单独能完成的。
詹森论文真正的余波,是所有后来者都没法再干净利落地讨论智商数字了。任何一项关于智力的研究,从发表的那一天起,就注定不只是测量技术。数字背后站着活生生的种族、阶级和历史创伤。这套命运技术的输入端冰冷如铁,输出端却连着人的一生。
它生下来就带着优生学的胎记,如今这胎记被烈火烧得清清楚楚,没有任何人可以再假装看不见。
那扇门前的红漆早被清洗掉了。但历史不会因为墙面干净就折返回去,假装什么都没发生。量尺上那道裂缝永远留了下来,留给每一个后来者审视,也留给每一个曾经被量过的人去承受。