第 3 章
军营里的实验室
问题不在于战争需要武器,而在于战争需要一种能批量生产等级的工具——正如埃利斯岛上那套从法国学校诊断工具变形而来的机器,它不发射子弹,也不制造硝烟,它的杀伤力在于把人分类——不是靠伤口,是靠数字。我说的不是坦克,不是机关枪,也不是芥子气。
那是一套试卷。准确地说,是两套:一套叫阿尔法,给识字的人;一套叫贝塔,给不识字的人,或者不懂英语的人。
1917年春天,美国对德国宣战,征兵令像雪片一样飞向每一个县,在不到一年的时间里,将近两百万新兵涌进训练营。军方陷入了一个前所未有的管理噩梦:你手里有两百万人,怎么在最短时间内决定谁去当军官、谁扛步枪、谁连枪都不该碰?靠长官面试,一天能见几个;靠体能测试,只能筛出身体弱的,筛不出脑子混的;靠举荐信,等于把军官职位送给有门路的人。
斯坦福大学教授刘易斯·特曼带着一套自己称之为“智力测验”的工具走进了军营,身后跟着一队年轻的心理学家,每个人都抱着成捆的试卷和秒表。在此之前,这种测试只是诊所里用来诊断个体缺陷的小玩意儿,一次只测一个人,面对面,小心翼翼。
但特曼说,我们可以同时测五百人,只需要铅笔、试卷和秒表,一个小时就能出结果,结果可以用数字精确标示。
这件事的后果,我们今天还在承受:它把一个原本用来帮助人的诊断工具,变成了大规模社会筛选的流水线。效率战胜了谨慎,数字的简洁掩盖了文化的暴力。而那个路易斯安那州佃农的儿子,就是这条流水线上第一批被碾过去的样本。
在讲特曼的流水线怎么运作之前,我想先请你想象一个具体的人。他没有名字留存在档案里——或者说,他的名字被一个编号代替了。
我们只知道他来自路易斯安那州南部的棉花田,父亲是佃农,他自己从来没上过一天学。1917年秋天,征兵令送到他手里,用他父亲的话说,那是“地主老爷的纸”。他坐了一整天的骡车到县城征兵站,然后被塞进一列火车,晃荡了两天两夜,到了北方某处的训练营。他这辈子见过的最大的建筑是县法院,两层楼,木结构,屋顶上有个小钟楼。训练营里有几十栋营房,全是三层砖楼,排列得像棋盘格子,他一走进去就迷了路。
发军装的人朝他喊话,他听不太懂——他会说英语,但那是路易斯安那乡下的土话,元音拖得老长,语法跟着感觉走,和训练营里那些北方中士的短促腔调完全是两种语言。然后有人把他领进一间大屋子,里面摆满了长条桌和板凳,墙上挂着黑板,窗户上钉着铁丝网。一个穿着军装但没有军衔徽章的人站在前面,用一种他从来没听过的语速说:“现在发试卷,听指令,不许说话。”
他拿到的试卷叫贝塔测试。这是专门给文盲和英语不好的人设计的,理论上不需要语言能力,只要看图画、走迷宫、补齐图形就行。理论上是这样。
第一道题是走迷宫。纸上画着弯弯曲曲的通道,入口处标着一只小鸡,出口处画着几粒米,要求用铅笔画出一条从入口到出口的路线。他握着铅笔的手抖得厉害——不是紧张,是他这辈子从来没拿过铅笔。
他见过铅笔,镇上杂货铺里卖,但那是记账用的,他父亲连账本都没有,因为佃农的账全在地主手里,秋后算账从来不用你写,地主说多少就是多少。他拼命想把铅笔画进那条通道,但手不听使唤。铅笔在纸上滑,铅芯划出了边界,划出一道歪歪扭扭的灰线,越过了迷宫的墙。他想擦掉,试卷上印着说明——“不许涂改”。他更慌了,额头冒汗,手抖得更厉害,铅笔尖直接戳穿了纸。
监考的人走过来,看了一眼试卷,在表格上写了几个字。他看不清写的什么,就算看清了也不会知道那几个字的意思:“智力年龄七岁。”
他十九岁,身高五英尺九英寸,能扛两百磅的棉花袋走一整天不歇气,能在沼泽地里凭星星的位置辨别方向,能记住三十多种动植物的名字和习性——哪些浆果能吃,哪种蛇有毒,哪片林地里有野猪出没。这些知识在路易斯安那的棉花田里值一条命。
但在那间大屋子里,他所有的能力都被压缩成一条迷宫和一个数字:七岁。这就是陆军测试的入场方式。它不是一场考试,而是一台翻译机器——把人的全部复杂性翻译成一条曲线、一个字母、一个让人无法反驳的标签。
现在让我们拉开镜头,看看这台机器是怎么设计出来的,又是怎么运转的。
1917年4月,美国对德宣战。心理学界迅速行动起来,美国心理学会主席罗伯特·耶基斯牵头组建了一个委员会,专门研究如何用心理学服务于战争。特曼是这个委员会的核心成员,他在斯坦福已经搞了几年智力测验,手里有刚修订完成的斯坦福-比奈量表。他带着一个明确的想法走进委员会:智力测验可以帮助军队筛选新兵。军方起初并不买账。
军官们觉得,判断一个士兵靠的是经验,不是心理学家的花招。但耶基斯和特曼拿出了一个让人无法拒绝的论证:你可以同时测几百人,一个小时出结果,用数字排名,成本几乎为零。在一个人力匮乏、时间紧迫的战争状态下,这个论证就是通行证。
委员会最终设计了两套测试。阿尔法测试给识字的人,书面题目,八类内容:常识判断、算术推理、词汇、类比、句子重组、数字序列、信息填充、阅读理解。贝塔测试给文盲和英语不好的人,七类题目:走迷宫、方块计数、图片补全、图形类比、数字符号替换、图画完成、几何构造。
贝塔测试的指令用动作示范而不是文字说明,理论上完全绕开了语言障碍。这两套测试的基本模板,在1917年秋天被迅速推广到全美几十个训练营。每一天都有成千上万份试卷被批改、打分、归档。特曼在战后报告里兴奋地写道:“我们可以在一个小时内测试五百人,结果可以用数字精确标示,这是人类历史上第一次大规模的心理测量。”
他的话里充满了一种工程师式的骄傲——他解决了一个管理难题,他把混乱的人变成了可排序的数字。但在这骄傲背后,有一个被刻意回避的问题:那些数字到底在测量什么?
让我们拆开这套流水线的每一个环节,看看它是怎么把文化差异伪装成智力差异的。
第一个环节是指令标准化。测试员必须照本宣科地念指令,不能多解释,也不能换说法。这个设计在理论上很科学——它保证了所有人在相同条件下接受测试,避免了主观偏差。但在实践中,它制造了大量荒谬的场景。
举个例子。贝塔测试里有一道“图片补全”题,纸上画着一张人脸,缺了嘴巴。要求是画出缺失的部分。这道题的设计逻辑很简单:人脸有嘴巴,缺了嘴巴就不完整,正常人应该能识别出来。但来自某些东欧村庄的移民,从小到大没见过线条画,不知道那种用几根线勾勒轮廓的图形代表什么。他们习惯的是照片或者圣像画,那种有阴影、有细节、有立体感的图像。他们盯着那张简笔画人脸看了半天,不知道那是什么东西。
测试员不能解释,只能重复指令:“画上缺失的部分。”于是他们在纸上画了十字架。这不是理解力的问题,是经验的问题。但测试规则不区分这两者,它只认结果——画不出嘴巴,就扣分。
再比如阿尔法测试里的一道常识题:“为什么电灯比油灯好?”对纽约来的年轻人来说,这是一道送分题——电灯更亮、更安全、不用添油、不会熏黑天花板。但如果你来自南卡罗来纳州一个还没通电的乡村,你只能凭想象回答,或者干脆空着。按测试规则,空着和答错一样,都扣分。而你空着的原因和智力毫无关系,只和你生在哪个地方有关。
第二个环节是时限。阿尔法测试的每类题目都有严格的时间限制,最短的只有三分钟。这意味着你必须快速阅读、快速理解、快速作答。对于受过良好教育、习惯了考试节奏的人来说,这种压力不构成障碍——他们早就学会了在限定时间内分配注意力、跳过难题、先做有把握的。但对于阅读速度慢、不熟悉书面语体的人来说,时限本身就是一道额外的筛子。他们不是不会做,是做不完。
而做不完被当作做不对处理。第三个环节是选择题格式。阿尔法测试大量采用选择题,这在当时是一种创新——它使得阅卷可以标准化,答案可以用打孔机读取,几秒钟就能处理一份试卷。但选择题天然有利于那些擅长辨认陷阱、熟悉“排除法”逻辑的人。这种能力,本质上是一种学术训练的结果。一个从没上过学的人,他面对选项时的思维方式是完全不同的——他不习惯在几个相近的答案中寻找细微差别,不习惯用排除法缩小范围,不习惯那种“考题即游戏”的默契。他以为每一道题都在问事实,而不知道有时候题在问你对题的理解。
第四个环节是百分位排名。特曼团队把一百七十万士兵的测试分数换算成字母等级:A表示最优,B表示良好,C+表示中上,C表示中等,C-表示中下,D表示差,D-表示极差。这个等级系统后来被简化成更直观的说法:A等是军官材料,C等是普通士兵,D等和D-等是“不适合服役”的人。注意这个转换——从连续分布的数字到离散的字母等级,再到社会角色的分配。
这就是我在全书里反复使用的概念:“量化分类”的运作过程。把复杂的人变成单一数字,再把数字切割成等级,最后用等级决定一个人该当军官还是该扛步枪。这个逻辑一旦确立,就不再局限于军营。
它会在战后溢出到学校、公司、政府机构,变成整个社会分配机会的基本语法。
但这里有一个更难发现的陷阱。那个路易斯安那州佃农的儿子,他在贝塔测试里被判为“智力年龄七岁”,不是因为他笨,是因为他连题目都看不懂——不是看不懂文字,是看不懂题目这种形式本身。他在棉花田里能准确判断天气变化,能修理农具,能记住复杂的种植周期,能通过水面波纹判断风向,能凭土地颜色判断墒情。这些能力在那间大屋子里毫无用武之地。测试测量的不是“智力”,而是和测试形式最匹配的那套文化技能。而这套文化技能的分布,在美国社会里极度不均衡。
但特曼的流水线不在乎这些。它只在乎效率:能不能在一个小时内测完五百人?能不能用打孔机阅卷?能不能把结果装进一张表格?它做到了这三件事,而且做得非常漂亮。
所以军方满意了,心理学家满意了,政客满意了。至于那些被误判的人——他们不会抗议,因为他们根本不知道发生了什么。
现在我要回应一个最强的反方论点。这个论点在今天仍然有很多支持者,包括一些严肃的心理学家。他们说:智商测试虽然在历史上被滥用过,但它的核心测量的是真实且稳定的认知能力,心理学上称之为“g因子”——一种普遍存在于各种认知任务中的共同因素。这个g因子对个体差异和群体差异具有预测效度,能预测学业成绩、职业成就甚至健康状况。因此,智商测试被广泛采用,不完全是政治或文化霸权的产物,也是一种理性选择。
这个论点不是没有道理。g因子的统计确实存在,智商分数确实能预测一些东西。但问题出在“预测”这个词上——它预测的是什么?在什么条件下预测?特曼的陆军测试给出了一个残酷的答案。测试分数确实能预测一个士兵在军队里的表现——因为它预测的是谁更熟悉书面指令、谁更快适应科层制管理、谁更容易接受抽象训练。
这些能力在军队里确实重要,但它们不是“智力”的同义词,而是特定文化训练的结果。
更关键的是,当测试分数被用来大规模分配角色后,这个预测就变成了自我实现的预言。那些得分高的人被送去军官培训,得到了更多训练和资源,然后表现出更高的能力;那些得分低的人被派去干杂役,没机会接触复杂任务,然后“证明”了测试的准确性。这不是预测,这是制造。
让我用一个更具体的例子说明这一点。假设两个新兵同时进入训练营,一个来自波士顿的中产阶级家庭,读过高中,一个来自路易斯安那的棉花田,没上过学。前者在阿尔法测试里拿到了B等,被送去接受无线电操作培训,三个月后成了一位熟练的通讯兵,表现优异。后者在贝塔测试里被判为D-等,被派去当炊事兵,每天削土豆,至战争结束没摸过任何需要技术的东西。战后,测试报告的撰写者指着数据说:看,测试分数高的士兵表现更好,测验的预测效度得到了验证。但他们没有指出的是,那个B等的人得到了三个月的培训,那个D-等的人只得到了削土豆的刀。
把培训机会的差异抹去,把结果当作“天赋”的反映——这就是预测变成制造的完整过程。1917年秋天,特曼团队在多个训练营同时展开测试。每一天都有成千上万份试卷被批改、打分、归档。心理学家们兴奋得睡不着觉——他们终于有了一组真正的“大数据”,可以用来证明智力测验的科学性和实用性。特曼在战后出版的《陆军心理测试报告》里写道:“这是心理学有史以来最重要的实验。它不仅证明了智力测验可以大规模实施,而且证明了智力差异是真实存在的,是可以量化的,是可以用来预测社会行为的。”
注意他这句话的措辞——“可以用来预测社会行为”。从一开始,这套装置的目标就不是理解个体,而是预测和控制群体。
它从一开始就是为管理而生的,不是为帮助而生的,不是为解放而生的。智力测验在比奈手里是一把手术刀,用来诊断那些需要帮助的孩子;在戈达德手里变成了一堵墙,用来挡住那些被认为不合格的移民;在特曼手里变成了一条流水线,用来给两百万人的命运打上标签。每一次变形,它都离最初的目的更远一步,离权力的需求更近一步。
但测试结果一出来,就暴露了让特曼和他的同事们坐立不安的东西。按字母等级分类,南方农村的白人新兵平均得分远低于北方城市的新兵,东欧移民的平均得分低于西欧移民,黑人士兵的平均得分低于白人士兵。如果这套测试真的测量的是“天生智力”,那这些差异就意味着某些群体天生低人一等。特曼本人是优生学的坚定信徒,他在私下里毫不掩饰地相信这些差异确实反映了遗传上的优劣。但军队里有很多人不太敢这么直说——不是因为道德顾虑,而是因为政治后果。
如果把这些数据公之于众,南方各州会暴怒,移民群体会抗议,黑人士兵的家庭会质疑为什么他们的儿子要为这个国家送死却被标注为“低能”。军队的士气会崩溃,征兵工作会陷入困境。
于是,军方在处理这些数据时采取了非常谨慎的策略。他们强调测试的实用价值——它帮助军队快速分类,提高了管理效率——而避开了它背后的种族和阶级含义。这种策略后来被反复使用:智商测试的推广者总是强调它的工具价值,用“效率”“公平”“科学”这些词来包装,把那些令人不安的差异归因于“环境因素”——等争议平息了,再悄悄回到遗传解释。
但纸包不住火。陆军测试的数据在1920年代逐渐流入公共领域,成为优生学运动的重要弹药。卡尔·布里格姆在《美国智力研究》这本书里,用陆军测试的数据做了一道算术题:他把士兵按原籍国分类,发现北欧移民的平均分最高,南欧和东欧移民的平均分最低。他的结论是,美国正在被低智力移民“污染”,必须立即收紧移民政策。
优生学家们拿着这些数据在国会听证会上慷慨陈词:看看,科学已经证明了,有些种族就是低人一等,我们必须限制移民,必须防止“劣质基因”污染美国血统。他们用的图表、数据、术语,都来自陆军测试的报告。他们的论证逻辑和特曼一脉相承:数字不会说谎,分数面前人人平等,低分意味着低能。
这就是1924年约翰逊-里德移民法案的知识背景。那部法案把东欧和南欧的移民配额砍到一战前的零头,理由就是“科学证明了他们的智力低下”。而那个“科学证据”的核心,就是陆军测试的数据。
一个路易斯安那州佃农的儿子,因为没拿过铅笔,被判定为智力年龄七岁。他一个人的分数,和成千上万同样遭遇的南方农民、东欧移民、黑人士兵的分数汇聚在一起,变成了优生学运动的“科学基础”,最终变成了锁死移民大门的那把锁。
这就是大规模筛选的完整逻辑闭环:测试把文化差异转化为数字差异,统计把数字差异转化为群体差异,政治把群体差异转化为排斥政策。但这里有一个更深层的讽刺。
那个在1917年秋天主导陆军测试的刘易斯·特曼,他和戈达德一样,真诚地相信自己是在做一件好事。他在给妻子的信里写道:“我每天工作十六个小时,但我从不觉得累,因为我知道我们正在拯救这个国家——我们正在用科学的方法,把最优秀的人放在最重要的位置上。”
这就是“命运技术”最危险的地方:它不需要阴谋,不需要恶意,只需要一群真诚的人,带着一套看似客观的工具,在一个巨大的管理难题面前,选择效率而不是谨慎,选择数字而不是故事,选择流水线而不是面对面。特曼真诚地相信他在促进社会公平——让最优秀的人得到最好的位置,而不是靠关系、靠出身、靠运气。他没有看到,或者不愿意看到,他手里的那套工具正在把文化差异改写成智力缺陷,把社会不公改写成自然差异。
特曼在陆军测试中建立的那套机制——标准化指令、统一时限、选择题格式、字母等级——其核心逻辑不是“了解这个人需要什么帮助”,而是“快速判断这个人值不值得放进来”。这个逻辑和戈达德在埃利斯岛上建立的逻辑完全一致,只是规模放大了上千倍。
戈达德一次只能测一个人,通过翻译和手势,在移民检查站的角落里进行。特曼可以同时测五百人,用铅笔、试卷和秒表,在任何一个大房间里进行。效率的提升意味着覆盖面的扩大,覆盖面的扩大意味着更多人的命运被那套逻辑吞噬。
那个路易斯安那州佃农的儿子,他在贝塔测试后被分到了D-等级。档案上写着“智力缺陷,建议从事最简单的体力劳动”。他被派去当炊事兵,每天削土豆、洗锅、倒泔水。他从来没有摸过枪,也没有接受过任何军事训练。
战争结束后,他回到路易斯安那的棉花田,继续当佃农,至死不知道自己曾经参与了一场人类历史上最大规模的心理测量实验。他的档案上有一个编号,那是他在一百七十万测试者中的唯一标识。那个编号和那个“智力年龄七岁”的判定,被录入统计表格,和其他人的分数一起计算平均值和标准差,一起被用来证明某些群体的智力低下,一起被用来推动移民法案的修改。
没有人问过他,你在棉花田里能做什么。没有人想过,也许那套测试本身才是问题。他成了一个统计数字,一个论证工具,一个“科学证据”的匿名贡献者。而他的真实能力——那些在路易斯安那沼泽地里救命的本事——永远留在了那间大屋子外面,没有进入任何档案。陆军测试在战后产生了三个影响,每一个都超出了特曼最初的预期。
第一个影响是模板化。军队留下了测试的模板,这个模板被学校系统、公务员考试、企业招聘迅速吸收。1920年代,美国公立学校开始大规模引入智商测试来分班,聪明的孩子进快班,迟钝的孩子进慢班,低能的孩子进特殊学校。这套分类逻辑和军营里那一套如出一辙:标准化测试、数字等级、角色分配。一个孩子六岁时拿到的那个数字,可能决定他此后十二年的教育轨迹。
第二个影响是改变了人们对“公平”的理解。在陆军测试之前,军官选拔要么靠关系,要么靠战场表现,要么靠长官的主观判断。这些方式都有明显的不公——裙带关系、偏见、运气。陆军测试的出现,给了人们一种“科学公平”的幻觉:数字不会说谎,分数面前人人平等。这个幻觉如此强大,以至于人们宁可接受测试分数带来的不公,也不愿意回到主观判断带来的不公。但这里有一个根本性的混淆:数字不会说谎,但设计数字的人会。
测试题目里隐藏的文化假设,测试形式里嵌入的阶级偏见,测试时限里暗示的受教育程度——这些都不是“天生的智力差异”,而是社会结构的投影。当这套投影被当作客观现实来接受时,社会不平等的根基就被自然化了。那些被测试判定为低能的人,他们输掉的不是智力,而是和自己文化经验的匹配度。但测试结果不会告诉你这些,它只会给你一个数字,一个等级,一个命运。
第三个影响是最隐蔽的,也是最持久的。陆军测试让“量化分类”变成了一种可复制、可推广、可工业化的操作。在此之前,给人分类靠的是主观判断——一个军官面试一个新兵,一个老师观察一个学生,一个雇主面试一个求职者。这些判断虽然充满偏见,但至少保留了人的复杂性。陆军测试用一套标准化的程序取代了所有这些判断,把人的全部复杂性压缩成一个数字,然后用这个数字来决定一切。这个操作一旦被证明有效,就迅速扩散到整个社会。学校用它来分班,公司用它来招聘,政府用它来筛选移民。
每一次扩散,都让“命运技术”变得更精细、更隐蔽、更像自然秩序。到最后,人们不再质疑为什么要用一个数字来决定一个人的价值,他们只关心怎么能让那个数字变得更高。
让我们回到那个路易斯安那州佃农的儿子。他坐在军营的大屋子里,握着一支陌生的铅笔,面对一张看不懂的试卷,手抖得厉害。他拼命想画出一条通往食物的路线,但他越紧张,手越不听使唤,铅芯越出界。监考的人在表格上写下“智力年龄七岁”。这个数字跟了他一辈子。它决定了他在军队里干什么,也决定了他在战后能找什么工作,还决定了他对自己能力的认知——他后来对自己的孩子说,别读书了,咱家脑子不行。
“咱家脑子不行”——这句话是智商神话最残忍的胜利。它不只是把人分类,而是让人内化这种分类,让人相信自己的失败是天生的、不可改变的。那个佃农的儿子,他最终相信了那个数字,就像无数后来者相信了他们的数字一样。
但那个数字不是他的智力,那是他第一次握铅笔时的紧张,是他面对陌生环境时的恐惧,是他在那套文化密码面前的无助。这些都被压缩成一个数字,然后被当作他本质的标签。
这就是“命运技术”的核心运作:把人的复杂潜能转化为单一数字标签,再据此分配生命机会。
在陆军测试的流水线上,这种转化第一次大规模实现,这是智商测试从边缘心理测量工具变成国家治理工具的关键转折点。特曼和他的同事们完成了这个转折,他们真诚地相信自己在推动科学进步,在提高社会效率,在让最优秀的人得到最好的位置。
但他们没有看到,或者不愿意看到,他们手里的那套工具正在把文化差异改写成智力缺陷,把社会不公改写成自然差异,把人的命运压缩成一串数字。一百七十万士兵接受了测试,一百七十万个数字被录入档案。那个路易斯安那州佃农的儿子的数字,和别人的数字一起,被用来计算平均值,被用来证明某些群体的低劣,被用来推动排斥性的法律。他本人回到了棉花田,继续当佃农,至死不知道自己曾经是“科学证据”的一部分。
而特曼的测试模板,在战后像病毒一样扩散开去。学校用它来分班,公司用它来招聘,政府用它来筛选。每一个被测试的人,都像那个佃农的儿子一样,握着一支铅笔,面对一张试卷,在一个陌生的环境里,被要求在限定时间内答出那些看似客观实则充满文化假设的题目。然后得到一个数字,一个等级,一个命运。
这就是军营里的实验室留给二十世纪的遗产。它不是一份技术报告,不是一套科学结论,而是一台仍在运转的筛选机器,一张仍在扩张的分类表格,一种仍在生长的关于人的数字神话。那个路易斯安那州佃农的儿子在档案上被记为“智力年龄七岁”,但档案不会告诉你,他走出那间大屋子之后发生了什么。特曼已经带着他的测试模板回到了斯坦福,在那里,他正准备启动一项更雄心勃勃的计划——这次他要证明的不只是谁能当兵,而是谁配得上成功本身。