第 1 章
巴黎的刻度
巴黎,1904年的冬天。有个父亲在街头徘徊。不是散步,不是买东西,是那种心里揣着一块石头、不知道该往哪儿走的徘徊。他的女儿在学校待不下去了。老师的话说得很绝:这孩子智力低下,送收容所吧。收容所。
这三个字搁在今天,我们可能不太容易体会它的分量。二十世纪初的巴黎收容所不是学校,不是医院,是把你从正常社会里摘出去的地方。一旦进去了,你这辈子就被钉在那个标签上。不是说你犯了什么错,而是你这个人本身就被判定为不合格。
父亲不认这个命。他四处打听,终于有人给了他一个名字:比奈。阿尔弗雷德·比奈,四十七岁,在巴黎心理学圈子里有点名气,但远算不上什么大人物。他研究过记忆、暗示感受性、儿童思维发展,在索邦大学实验室里泡了大半辈子。
这人有个特别的地方:他没上过大学。他学的是法律,心理学全靠自学。在法国学术界,他一直是边缘角色,拿不到教席,进不了核心圈子。但边缘有边缘的好处——他不靠学院体制吃饭,他真跟孩子打交道。父亲带着女儿找到了比奈。
我们现在没法复原那场会面的确切细节。没有记录留下那女孩的名字、年龄、长相,也不知道她进门时是什么表情。材料只记到这一步:父亲带着女儿来了,比奈接待了他们。
但我们可以根据比奈后来公开描述过的测试流程,知道那天大概发生了什么。比奈没有像学校老师那样问她功课。没有让她背诵课文,没有让她做算术题。他拿出一堆卡片、图片和小物件,摆在桌上。这些物件不是什么精密仪器。
比奈量表最早的测试材料简陋得让人意外:几根线条画在硬纸板上,几个数字序列要口头复述,几张日常物品的图片,还有指认身体部位这样简单的指令。比奈让女孩指鼻子、眼睛、嘴巴。让她比较两条线哪条更长。让她复述一串数字:三、七、二。她做到了。数字加到五个,她卡住了。
这不是考试。没有及格线,没有排名,没有标准答案。比奈在干的事情跟所有老师都不一样:他不是在判断这孩子“好不好”,他是在找她到底卡在哪儿。他像一个修表匠,不是在判断这块表值不值钱,而是在找哪个齿轮卡住了。
这个区别,往小了说,是一个心理学家的职业习惯。往大了说,它埋下了后来一百年所有争论的根子。
我们先停一停,把镜头从这个房间拉开,看看当时巴黎到底发生了什么。因为比奈干这件事,不是心血来潮。他是被人找上门的。找他的人,是法兰西第三共和国的公共教育部。
十九世纪末,第三共和国干了一件大事:搞义务教育。1881年和1882年的费里法案规定,所有六到十三岁的孩子,不管家里有钱没钱,男孩女孩,都得上学。这在当时是革命性的。几千年来,教育是奢侈品,是贵族和有钱人的特权。现在共和国说了:不行,每个孩子都得受教育,这是公民的基本权利。
但权利一落地,麻烦就来了。教室的门一打开,进来的不光是那些聪明伶俐、家里有藏书、父母能辅导的孩子。大量从来没摸过书本的农家子弟、工人子女、街头流浪儿涌进了公立学校。巴黎一个典型公立小学的教室里,塞着五十几个孩子。老师面对五十几个水平参差不齐的学生,只能按中间进度走。学得快的被拖着,学得慢的被甩下。甩下的那些就成了问题。
他们占着座位,跟不上进度,老师在他们身上花的时间是别的孩子的几倍,效果还不好。教育部门急了:这些人到底能不能从普通教学中受益?如果受益不了,是不是该送到别的地方去?“别的地方”就是收容所,或者叫特殊教育机构。
问题是,谁来判定一个孩子是“教不了”还是“没教对”?当时的判断全凭老师的主观印象。一个老师觉得这孩子笨,他就是笨。一个老师觉得这孩子懒,他就是懒。没有任何客观标准。同一个孩子,在这个老师手里是“智力低下”,换一个老师可能只是“开窍晚”。但孩子的命运完全取决于他撞上了哪个老师。
这就是1904年巴黎教育系统的困境:他们需要一套工具,把主观印象变成客观判断。不是为了给孩子贴标签,而是为了搞清楚到底该拿这些孩子怎么办。你不能因为一个老师心情不好就把一个孩子送进收容所,你也不能因为一个老师心软就让一个确实需要特殊帮助的孩子在普通课堂里白白浪费光阴。这个需求摆在那儿,等着人来接。比奈接到了。
1904年,法国公共教育部成立了一个委员会,专门研究“不正常儿童”的教育问题。比奈是委员之一。他接到的任务很明确:搞出一套方法,能比较客观地识别出哪些孩子无法从普通教学中受益,需要特殊教育。
比奈动手了。他没有坐在书房里凭空想。他跑到了医院、学校、收容所,一个一个地跟孩子打交道。他观察正常孩子在不同年龄能做什么,再拿这些任务去测试那些被判定为“智力低下”的孩子。他在巴黎的萨尔佩特里埃医院待过,那里有大量被诊断为“低能”的病人。他还在小学校里测试过普通孩子,建立正常发育的基准线。这个过程,放在今天的学术圈里叫“大规模样本测试”。放在当时,就是一个中年男人蹲在地上,拿着卡片和积木,跟孩子一遍一遍地试。
他试出了什么?他发现了年龄的规律。三岁的孩子通常能指认身体部位——鼻子、眼睛、嘴巴。四岁的孩子能比较两条线的长短。五岁的孩子能复述四个数字。七岁的孩子能描述一幅画里发生了什么——画上有什么人、他们在干什么。
年龄往上走,能完成的任务越来越复杂:理解抽象概念、进行简单的逻辑推理、记忆更长的数字序列。比奈的灵光一闪在这儿:他把这些能力按年龄排列出来,然后拿一个孩子的表现去对比同龄人的平均水平。如果这个孩子能做到大多数同龄人能做到的事,那就正常。如果她卡在比她小两三岁的孩子才能完成的任务上,那就说明她的心理发展水平滞后了。
1905年,比奈和助手西奥多·西蒙发表了第一版比奈-西蒙量表。三十个测试项目,从最简单的“用眼睛追随移动的光源”到复杂的“定义抽象词汇”,按难度排列。这就是人类历史上第一份智商测试。但比奈自己从来没用过“智商”这个词。他说的是“心理发展水平”。他引入了一个概念叫“智力年龄”——如果这个孩子能完成六岁孩子平均能完成的任务,那她的智力年龄就是六岁,不管她的实际年龄是八岁还是十岁。
这个区分极其重要。智力年龄不等于实际年龄。一个八岁的孩子,智力年龄可能只有六岁,也可能达到十岁。
它描述的是一种差距——这孩子跟同龄人相比,是超前还是滞后。它不是对这个孩子的本质做判断,它只是描述她目前站在哪个台阶上。比奈反复强调三件事。这三件事,后来被遗忘了整整一个世纪。
第一,他测的是当前状态,不是先天能力。一个孩子智力年龄滞后,可能是因为生病、营养不良、家庭环境差、没受过教育刺激——任何因素都可能导致暂时的发育迟缓。量表只能告诉你她现在卡在哪儿,不能告诉你她为什么会卡在那儿,更不能告诉你她将来会怎样。
第二,分数不是标签。比奈在论文里把话挑明了:这个分数不是固定不变的东西。一个孩子今年的智力年龄滞后两年,不代表明年还滞后两年。干预、训练、环境改变,都可能让她追上来。量表只是一个诊断工具,用来搞清楚该从哪里开始帮助她。诊断的目的是治疗,不是判决。
第三,也是最关键的一条:这个量表不能用来给正常孩子排名。它不是用来区分“聪明”和“更聪明”的,它是用来识别那些需要特殊帮助的边缘儿童的。
比奈说得毫不含糊:这个量表不应该被用于正常儿童群体中制造一种优劣等级。他设计的测试项目,很多在正常孩子看来都太简单了——指认身体部位?哪个八岁的正常孩子不会?这些题目的难度设置,本来就是为了筛出那些严重滞后的孩子,而不是在正常范围内分出三六九等。
比奈把话说得够清楚了。他把这三条警告写进了论文,反复讲,生怕别人误解。他像一个发明了菜刀的人,在产品说明书上大写加粗:本产品用于切菜,不可用于伤人。但历史从来不听警告。一把刀一旦造出来,怎么用就由不得铁匠了。
我们回到那个巴黎女孩身上。比奈拿着那些卡片和积木,一项一项地试。他发现了什么?材料没有记录她的测试结果。我们只知道,比奈没有把她送进收容所。
他告诉那位父亲,这孩子不是天生低能,她只是在某些方面需要更耐心的引导。她卡住了,但卡住是可以解开的。这个判断本身,在当时就是一个激进的立场。它等于在说:学校老师错了。老师看见的是“笨”——一个固定属性,一个标签,一个判决。
比奈看见的是“滞后”——一个动态状态,一个可以被改变的东西。从“笨”到“滞后”,这两个词之间的距离,就是比奈量表全部的人道关怀所在。但这个距离是可以被抹掉的。而且很快就会被抹掉。
我们再拉远一点,把比奈量表放到更大的制度逻辑里看。法国第三共和国的义务教育改革,本质上是一个国家治理项目。共和国要把散落在各个阶层、各个地区的孩子统一纳入国家教育体系,培养成合格的公民和劳动力。这个体系的运转需要一个筛选机制——把能正常接受教育的人和需要特殊处理的人分开。比奈提供的工具正好满足了这个需求。它是“客观的”——不是某个老师的个人判断,而是一套标准化的测试程序。它是“量化的”——给出的是一个数字,智力年龄,不是“有点笨”“非常笨”这种模糊的描述。
它是“可比较的”——同一个孩子可以跟同龄人比,也可以跟自己的过去比,甚至不同学校、不同城市的孩子都可以放在同一个尺度上衡量。
这些特征加在一起,让比奈量表具备了现代官僚系统最爱的品质:标准化、可复制、可比较。一个教育官员不需要懂心理学,不需要见过那个孩子,他只需要看一个数字就能做出决定。比奈的初衷是让这个工具服务于诊断和帮助。
但工具本身的逻辑一旦嵌入官僚系统,就自动往另一个方向滑:分类和筛选。诊断是为了帮助个体。分类是为了处理群体。这两件事在逻辑上是矛盾的,但在实践中常常混在一起。
比奈自己可能没有充分意识到这一点。他太专注于把工具做好,太相信使用者会像他一样谨慎。他没想过,一旦这个工具离开他的手,进入学校、医院、政府部门,使用它的人不会是他这样的心理学家,不会花一个小时蹲在地上跟孩子一项一项地试。他们会把测试时间压缩到二十分钟,把分数直接当成判决书。
这就是工具的吊诡:发明者决定工具怎么造,但使用者决定工具怎么用。比奈量表从诞生第一天起就背负着双重基因——一面是诊断与帮助的善意,一面是分类与筛选的诱惑。前者是比奈自己反复强调的。后者是制度需求自动赋予的。
我们可以把这个双重基因看得更清楚一点。比奈量表的核心技术贡献是什么?是把认知能力按年龄排列,然后拿个体去跟同龄群体比较。
这个操作本身暗含了一个逻辑跳跃:它把“发展速度”等同于“能力高低”。一个智力年龄滞后两年的孩子,在比奈的解释框架里是“发展慢”,但同一个数据在另一个解释框架里就会被读成“能力差”。比奈坚持前一种读法。他认为发展速度是可以改变的,滞后的孩子可以追上来。
但官僚系统天然倾向于后一种读法。因为“能力差”是一个更稳定的标签,更方便做长期决策。如果一个孩子只是“暂时滞后”,那你还得继续观察她、帮助她、给她机会。但如果她是“天生低能”,那就可以直接把她分流到特殊教育体系里去,省时省力。
这不是说官僚系统里都是坏人。这是说,任何大规模管理体系都有简化现实的冲动。它要处理的是成千上万的人,它没有精力去了解每一个个体的复杂处境。一个数字,一个类别,一个标签——这些是官僚系统能够高效运转的基本单位。
比奈量表恰好提供了这样一个数字:智力年龄。而“智力年龄减去实际年龄”这个差值,天然就带着价值判断的意味。滞后两年,这个“滞后”本身就是一个价值判断。比奈拼命想拦住这个价值判断,说它只是描述,不是评价。但他的拦阻注定失败。因为工具一旦进入制度,制度就会按自己的逻辑重新定义工具的意义。
1905年,这个双重基因还只是潜伏在纸面上的一丝张力。比奈还在写论文警告世人不要滥用他的量表。那个女孩的父亲大概松了一口气——他的女儿没有被送进收容所,她只是需要一些额外的帮助。但工具已经造出来了。它不会停留在巴黎。它不会只用在那些被老师判定为“智力低下”的孩子身上。它不会一直被谨慎的心理学家拿在手里。它要飘洋过海了。
在结束这一章之前,我们需要正面回应一个最强有力的反方解释。这个解释贯穿了后来一百年的争论,直到今天还在被反复提起。
它说的是:智商测试虽然有过历史滥用,但它测量的核心是一种真实且稳定的认知能力——心理学家称之为“一般智力因子”,也就是g因子。这个g因子对个体的学业表现、职业成就甚至健康状况都有预测效度,对群体差异也有统计上的解释力。智商测试之所以被广泛采用,不是因为它是一个文化骗局,而是因为它确实抓到了某种真实的东西。
这个解释不是没有道理。比奈量表测的那些项目——记忆数字、比较线条、定义词汇——确实跟认知能力有关。一个在这些项目上表现好的孩子,大概率在学校里也表现好。一个在这些项目上表现差的孩子,大概率确实需要额外的帮助。否认这一点,就等于说比奈量表完全是在瞎蒙,这不符合事实。
但问题不在这里。问题在于,从“测到了某种真实的东西”到“测到了先天且固定的智力禀赋”,这中间有一个巨大的跳跃。比奈量表测的是一个孩子在特定时间、特定环境下完成特定任务的能力。
这些任务跟认知能力有关,但也跟孩子的语言环境、教育经历、营养状况、测试时的情绪状态、对测试情境的熟悉程度有关。一个从没摸过书本的农家子弟和一个从小被父母教识字的中产家庭孩子,面对同样的测试题目,起点完全不同。比奈知道这一点。他在论文里写过:这个量表测的不是先天禀赋,而是后天习得的能力和知识的综合表现。他之所以要强调“当前”两个字,就是因为他不相信一次测试能告诉你一个孩子将来会怎样。
g因子理论的提出者查尔斯·斯皮尔曼,和后来把比奈量表改造成“斯坦福-比奈智力量表”的路易斯·特曼,走的是一条完全不同的路。他们相信智力是先天决定的,是稳定的,是可以被一个单一数字概括的。这个信念不是从比奈量表的数据里自然长出来的,它是被安上去的。比奈量表提供的是一个测量工具,而g因子理论提供的是一个解释框架。工具和框架一旦结合,就产生了一个威力巨大的东西:一个据说可以测量先天智力并且预测人生成就的数字。这个结合发生在比奈去世之后。它发生在美国。
比奈量表飘洋过海的故事,我们在下一章讲。但这里可以先点出一个关键节点:比奈量表在美国的改造,不是简单的技术升级。它是整个解释框架的替换。比奈的“心理发展水平”被替换成了“智商”。比奈的“当前状态”被替换成了“先天禀赋”。比奈的“可以改变”被替换成了“终身稳定”。比奈的“不要给正常孩子排名”被替换成了“给所有人测智商”。每一次替换都不是科学发现推动的。每一次替换背后都有制度需求在推动。军队需要快速筛选士兵,学校需要快速分班,移民局需要快速过滤入境者,企业需要快速选拔雇员。比奈量表恰好提供了一种看起来客观、科学的解决方案。“看起来”三个字是关键。
比奈量表测的到底是什么?它测的是一个孩子在特定文化环境里习得的认知技能。这些技能跟学校教育的内容高度重叠,所以它能预测学业表现——这没什么好奇怪的,它本来测的就是学校教的东西。但它能不能测出某种超越文化、超越教育、超越具体环境的“纯粹智力”?比奈自己都不信。
比奈的谨慎被后来的使用者当成了学术上的吹毛求疵,扔到了一边。他们要的是一个简单、快速、能批量操作的筛选工具。他们要的是一个数字——越简单越好。智力年龄还不够简单,因为它还得跟实际年龄对比。后来美国人发明的“智商”,用智力年龄除以实际年龄再乘以一百,一个单一数字,终身有效,这才是他们想要的。
这就引出了我们这本书要追问的核心问题:智商测试如何从一种边缘心理测量工具变成决定升学、就业乃至社会分层的命运判决书?答案不是一句话能说清的。它涉及国家治理的需要、教育筛选的惯性、商业营销的推波助澜,以及一个更深层的东西——现代人对量化客观性的迷信。我们相信数字不会说谎,相信科学工具能揭示真相,相信一个分数能告诉我们自己是谁、能做什么、值多少钱。这种信仰本身,比任何一个具体的智商分数都更深刻地塑造了二十世纪以来的人类命运。比奈量表是这种信仰的第一个载体。它从巴黎那个简陋的测试现场出发,一路被翻译、改编、简化、商业化,每一次转手都在改变它的意义。
最初它是一个诊断工具,后来变成了一个分类工具。最初它是为了帮助边缘儿童,后来它被用来给所有人排名。最初它测量的是“当前心理发展水平”,后来它被说成是测量“先天智力”。最初它的发明者反复警告不要滥用,后来这些警告被系统性地遗忘。每一次转变都不是凭空发生的。每一次都有制度需求在背后推动。每一次都有新的使用者把自己的目的注入这个工具。
观念一旦进入传播,就不再完全属于最初提出它的人。比奈量表的故事,是一个关于工具如何脱离发明者控制的故事,是一个关于善意如何被制度逻辑重新塑造的故事,是一个关于数字如何获得凌驾于人之上的权威的故事。
那个巴黎女孩不知道这些。她只知道有个耐心的先生蹲在她面前,拿出卡片和积木,一项一项地试。他没有说她笨,没有给她贴标签,只是想知道她卡在哪儿。那是智商测试历史上最干净的瞬间。这个瞬间没持续多久。1911年,比奈去世,享年五十四岁。
他没能活着看到自己的工具被翻译成英文、被带到美国、被用在移民检查站、被用来给士兵分类、被变成决定一个人能否上大学的标准。他没能看到“智力年龄”被改造成“智商”——一个单一数字,据说可以衡量一个人的先天禀赋,并且终身不变。比奈花了六年时间反复警告的事情,在他死后不到十年就被全部推翻。
推翻他的不是哪个坏心眼的政客,而是一群比他更有野心、更懂得如何把心理学工具卖给政府和学校的美国人。他们不是坏人。他们真心相信自己找到了测量人类智力的科学钥匙。他们真心相信一个数字可以告诉你一个人的价值。他们真心相信自己在为社会进步做贡献。这正是这个故事最让人不安的地方。
比奈量表的滥用,不是一群恶棍的阴谋,而是一群聪明人的真诚错误。他们把一个诊断工具变成了一个判决工具,然后真心相信这个判决是科学的。那个巴黎女孩的命运,不过是这场百年遗忘的第一个注脚。她的名字没有被记录下来,她的测试结果没有被保存,她的人生后来怎样我们无从知晓。
但她的遭遇——被老师判定为“智力低下”,然后被一个更谨慎的诊断挽救了回来——预示了后来无数人的命运。有些人像她一样幸运,遇到了一个愿意蹲下来看他们卡在哪儿的比奈。更多的人遇到的是一张表格、一个数字、一个标签,和一扇从此关上的门。比奈量表从巴黎出发,飘洋过海,一路变形,最终变成了一个全球性的命运技术——将人的复杂潜能转化为单一数字标签,并据此分配生命机会的社会技术装置。这个技术的雏形,就在1905年那个简陋的测试现场,就在那些卡片、积木和数字序列里。比奈种下了一粒种子,他以为种的是诊断,长出来的却是判决。工具已经造出来了。它要离开巴黎了。