第 13 章
量尺越洋记
“量表不是测量先天智力固定量的工具。”——这句话,正是对上一章那个悬而未决的问题最古老的回答。那个问题悬在亚马逊案之后,悬在被算法拒绝的人仍然不知道自己的简历上少了什么关键词、自己的游戏操作里暴露了什么“缺陷”的压力之上,至今没有落地。
这话是比奈说的。1905年,巴黎,他在诊所里写下这句话的时候,语气近乎恳求。他恳求后来的使用者不要把测验分数当成孩子的终身判决。他恳求教育者记住:那个数字只代表今天、此刻、在这个特定题目上的表现。换一天、换一套题、换一个环境,结果可能完全不同。
比奈的恳求飘过了大西洋,但没有飘进斯坦福大学的办公室。我们在前面的章节里已经看见,路易斯·推孟把比奈量表改造成斯坦福-比奈智力量表的时候,直接给每个孩子贴上了一个三位数的标签。这个标签叫智商。它看起来像血压、像体温、像一切可以用仪器读出的生理指标——精确、客观、不容争辩。
然后美国人把它装进了皮箱。1917年,美国参战。心理学家罗伯特·耶基斯说服陆军部,用团体智力测验筛选新兵。甲种测验给识字的人做,乙种测验给不识字的人做。一百七十万人在几个月内被塞进临时考场,填完答题卡,领到一个字母等级。A等去军官训练营,D等和E等被标记为“不适合服役”。
这套机器运转得如此高效,以至于战争结束后,没人舍得把它拆掉。相反,它的零件被打包、翻译、出口。1920年代到1930年代,智商测试开始大规模走出英语世界。它登上轮船,横渡太平洋和大西洋,在东京、上海、孟买的码头靠岸。每一个靠岸的港口都有一群教育改革者在等待。他们不是被动接受者。他们是主动伸手的人。他们相信这套工具能帮自己的国家识别出资优儿童,把有限的教育资源用在刀刃上。现代国家求才若渴,谁不想用科学方法快速找出最聪明的脑袋?
但这里有一个问题,一个从一开始就注定了的问题。量尺在巴黎出生的时候,是一根柔软的皮尺。比奈用它来量孩子的阅读能力、记忆广度、词汇量,然后告诉老师:这个孩子需要额外辅导。到了美国,皮尺变成了钢尺。推孟用它来量“先天智力”,然后告诉社会:这些人应该上哈佛,那些人应该扫大街。现在,钢尺要越洋了。钢尺不会弯曲。它是一套固定的题目、固定的施测程序、固定的计分规则。
把钢尺从英语环境直接挪到日语环境、汉语环境、印地语环境,会发生什么?说书人今天这堂课,就讲这个。
先看中国。1920年代,一位叫陆志韦的中国心理学家接手了一项艰巨的任务:修订比奈-西蒙智力量表。陆志韦在美国芝加哥大学拿到博士学位,师从功能主义心理学大师哈维·卡尔。他回国后在南京高等师范学校任教,后来主持燕京大学心理学系。他懂西方心理学的那套语言,也懂中国孩子的生活世界。
陆志韦面对的第一道坎是翻译。不是语言翻译——那个相对简单。把英文题目译成中文,找几个通晓双语的学者反复回译,确保字面意思不走样。
真正的麻烦藏在题目背后。比奈量表里有一道题:“如果你在街上捡到一个信封,上面写着地址、贴着邮票,你应该怎么办?”标准答案是:把信封投进邮筒。这个答案假定孩子生活在一个有邮筒的城市里,假定孩子知道邮筒是什么、信怎么寄、捡到别人的信应该归还。1920年代的中国,上海租界里的孩子可能见过邮筒。但四川乡村单级小学里的孩子呢?他可能从没见过邮筒。
他生活在一个靠脚夫传话、靠熟人捎信的世界里。对他而言,“捡到一封信”的合理反应可能是交给村里识字的人,或者原路找回去看看是谁丢的。另一个经典题目:“如果你上学要迟到了,应该怎么办?”标准答案是:加快脚步。但中国乡村孩子面对的上学路不是一条人行道。可能是山路,可能要涉水,可能半路被家里叫去放牛。他的“迟到”和城市孩子的“迟到”不是同一种迟到。
陆志韦知道这些问题必须改。他把比奈量表里那些依赖西方城市生活经验的题目逐条挑出来,换成中国儿童熟悉的场景。邮筒换成更通用的“失物归还”情境。涉及刀叉餐具的题目换成筷子。涉及壁炉和圣诞树的题目直接删掉。
他花了四年时间,在1924年出版了《订正比奈-西蒙智力测验说明书》。但改题目只是第一步。
更深的麻烦在后面。比奈量表的设计逻辑是“年龄当量”。一个正常六岁孩子能通过的题目,就是六岁水平的题目。比奈在巴黎找了一群不同年龄的孩子做标准化样本,测出每个年龄段平均能答对多少题。
后来的修订者沿用同样的方法:先找一批“正常”孩子做样本,再根据样本成绩定出常模。
问题来了:谁是“正常”孩子?陆志韦需要建立中国儿童的智力常模。他得找一群代表性的孩子来测试,算出每个年龄段的平均分。但1920年代的中国没有统一的学制,没有标准化的课程,没有全国性的学生数据库。上海租界里的教会学校用英文授课,学生读过伊索寓言和圣经故事。北京的新式学堂用白话文教材,学生背过胡适和鲁迅。内地乡村的单级小学可能只有一个先生、一间土房,学生念的是《三字经》和《百家姓》。
这三群孩子做同一套智力测验,成绩差异会大到什么程度?陆志韦的团队实测了。他们跑了几十个城市和乡村,收集了数千份答卷。
结果让他们头疼:同一个年龄段的儿童,城市孩子的平均得分比乡村孩子高出整整一截。不是高出一点点,是高出足以被判定为“智力落后”的差距。按美国的标准解释,这意味着中国乡村到处是低能儿童。陆志韦不信这个结论。
他在测验手册里写了一段话,语气和比奈当年的恳求如出一辙:本测验所测得的智力,受环境和教育的影响甚大。切不可将测验分数视为先天能力之固定指标。
但他写了也没用。因为修订量表的人可以控制措辞,使用量表的人却只想看数字。1930年代,中国各地教育局开始引入智力测验作为分班工具。上海的一些学校要求新生入学时做智力测验,按分数编入快班或慢班。南京的教育官员讨论过用测验筛选公费留学人选。商务印书馆甚至出版了一套“智力测验自修丛书”,教家长怎么在家训练孩子应付智力测验题目——这和一百年后求职者刷游戏化测评真题的逻辑一模一样。
说书人得在这里停一下,做一个判断。陆志韦不是傻瓜。他当然知道自己的量表有问题。但他也相信,有个问题版本总比没有版本好。
中国教育需要科学工具来打破科举时代的八股取士传统,需要客观标准来对抗人情关系和门第偏见。智力测验至少看起来是客观的。它至少给穷孩子提供了一个靠分数说话的机会——哪怕这个分数本身漏洞百出。
这是一种务实的选择,也是一种危险的选择。务实在于:二十世纪上半叶的中国积贫积弱,教育救国论者急于找到任何看起来现代化的工具。危险在于:一旦你接受了“分数决定命运”的游戏规则,你就很难再质疑这个分数是怎么算出来的。
再看日本。日本接触智力测验的时间比中国更早。1908年——比奈量表问世仅仅三年后——日本心理学家就已经开始翻译和试用这套工具。1910年代,东京帝国大学的松本亦太郎主持了日本版比奈量表的编制工作。1920年代,田中宽一推出了“田中-比奈智力量表”,成为日本学校广泛使用的标准版本。日本的情况和中国有相似之处,也有一个关键的不同。相似之处是翻译困境:比奈原题里那些巴黎中产阶级生活场景同样不适合东京或大阪的孩子。
田中宽一做了大量本土化修订,把法国面包换成米饭团子,把教堂钟声换成寺庙钟声。不同之处在于教育制度。日本在明治维新后建立了高度统一的国民教育体系,全国使用标准教材,课程内容由文部省统一规定。
这意味着日本儿童的“共同经验”比中国儿童多得多。一个北海道的农村孩子和一个东京的城市孩子至少读过同样的教科书、背过同样的课文、参加过同样格式的考试。智力测验的编制者可以依托这套共同经验来设计题目,不用担心城乡差距大到让测验完全失效。
但统一经验也带来了统一的风险。日本的教育体系本来就强调标准化和服从。智力测验加入之后,它变成了一个更精密的分流器:测验分数决定你进哪所中学、哪所高中、最终进入哪个社会阶层。1920年代到1930年代,日本军国主义抬头,国家开始把智力测验用于征兵筛选和军事人才选拔。同一套工具,在中国被用来寻找散落在民间的天才儿童,在日本被用来为帝国军队挑选最聪明的炮灰。量尺还是那把量尺。用法完全不同。
印度的情况又是另一番景象。印度在1920年代引入智力测验的时候,国家还在英国殖民统治之下。主持测验修订的不是印度本土教育家,而是英国殖民政府的心理学顾问。
他们面临的问题不仅是语言差异——印度有几十种主要语言和数百种方言——也是种姓制度和殖民教育体系叠加出的极端不平等。一个孟买上层种姓的孩子从小在家里说英语,上的是英国人办的公学,读的是莎士比亚和牛顿定律。一个比哈尔邦农村的低种姓孩子可能根本没进过学校,不识字,家里世代种地。这两个孩子做同一套智力测验,结果能代表什么?代表前者的“先天智力”更高?
殖民心理学家当然注意到了这个问题。他们的处理方式很直白:不处理。他们直接把英国版本的常模稍作调整就拿来用,然后根据测验结果把印度儿童分成不同等级。“高等种姓得分高”这个结果被拿来当作种姓制度天然合理性的科学证据——你看,测验数据证明了婆罗门确实更聪明。这里面的逻辑颠倒值得细说。不是因为婆罗门天生聪明所以得分高,而是因为婆罗门世代垄断教育资源、享有更好的营养和医疗条件、在语言和文化上与测验设计者更接近,所以得分高。
但一旦分数被解释为“先天智力”,这个因果链就被颠倒过来:得分高证明你天生聪明,你天生聪明所以你该享有特权。比奈在巴黎诊所里反复警告的正是这种颠倒。他说测验只能描述现状,不能解释成因。但越洋之后,描述变成了判决,判决变成了辩护。
1931年,国际智力测验会议在日内瓦召开。来自十几个国家的心理学家坐在一起讨论一个棘手的问题:智力测验能不能跨文化比较?会议记录显示,争论极其激烈。一派认为可以:智力是普遍的生物属性,就像身高体重一样,不同国家的人当然可以比较。另一派认为不行:测验题目依赖特定文化经验,一个在巴黎能测出天才的题目放到东京可能只测出了你对法国生活的熟悉程度。英国心理学家西里尔·伯特代表前一派。他说智力是遗传决定的,测验测的是这个东西本身,语言只是包装纸。把包装纸换掉——翻译题目、调整例子——里面测的东西不变。美国心理学家也有支持跨文化比较的。
毕竟他们在本土已经做过大量移民测验——在埃利斯岛用英语题目测刚下船的意大利农民和东欧犹太人,然后宣布其中百分之八十是“低能”。这个结论后来被证明是彻头彻尾的胡闹:你用别人不懂的语言问别人没经历过的事,答不出来只能证明你们之间隔着一整片大西洋的文化距离。
德国心理学家威廉·斯特恩则站在谨慎的一边。斯特恩是“智商”这个概念的首创者——他在1912年提出用心理年龄除以生理年龄再乘以一百来计算智力商数。但斯特恩同时也是一个对概念滥用保持警惕的人。他在日内瓦会议上说了一段被反复引用的话:我们必须区分“测验测到了什么”和“我们以为测验测到了什么”。前者是一个技术问题,后者是一个诠释问题。而我们经常把诠释当成事实。
这段话在当时的会议上没有引起足够重视。因为各国代表更关心的是技术标准化:怎么统一施测流程、怎么换算不同版本的分数、怎么建立国际通用的常模数据库。他们想建立一套全球通用的智力度量衡——就像米制公约统一了全世界的长度和重量单位一样。
说书人得在这里插一句:这个类比本身就是有问题的。一公斤铁在中国和在法国是一样重。但一道关于“寄信”的题目在中国和在法国测的东西完全不同。物理度量衡可以普适,因为物理世界的规律是普适的。心理度量衡不能普适,因为人的经验世界不是普适的。
日内瓦会议最终没有解决跨文化比较的困难。与会者达成的唯一共识是:各国应该修订自己的本土化版本,使用本国常模,不要直接拿美国分数和日本分数做对比。但这个共识本身就是一个悖论。如果每个国家都用不同的题目和不同的常模,那么“智商”这个概念还剩下什么全球通用的内核?你在中国测出的100分和我在日本测出的100分还能叫同一件事吗?
会议没有回答这个问题。各国代表带着各自的本土化量表回到国内,继续用各自的版本筛选各自的天才和庸才。量尺越洋之后变成了很多把量尺,每一把都声称自己量的是同一件东西——先天智力——但每一把的刻度都不一样。这里藏着智商神话全球传播中最深的秘密。
比奈的量表是一种诊断工具,用来找出一时需要帮助的孩子。特曼的量表是一种分类工具,用来把人放进不同的社会格子。当分类工具被带到世界各地时,它又获得了一层新的功能:为各国的社会筛选制度提供科学话术。在中国,“科学选拔”替代了科举和人情关系。在日本,“适才适所”支持了军国主义的人才动员。在印度,“客观数据”为殖民等级制披上了现代外衣。
同一套工具在不同政治体制中扮演了完全不同的角色,但所有角色都共享一个前提:把人的复杂潜能压缩成一个数字是合理的、科学的、进步的。陆志韦晚年回顾自己的量表修订工作时说过一句话:吾人引进此法,原为教育诊断之助。不意竟成社会分等之器。
这话说得很轻,但分量很重。一个心理学家在1920年代打开了一个工具箱,他以为自己在给中国教育递一把手术刀。三十年后回头看,手术刀变成了铡刀——不是他设计的铡刀,但他递出去的那把刀确实参与了铡刀的制造。同样的故事发生在每一个接过量尺的国家。
日本的教育心理学家田中宽一在战后也表达过类似的悔意:测验本应是教育的仆人,却成了筛选的主人。但这些后悔都来得太晚了。量尺一旦进入制度运转,就不再属于最初设计它的人,也不再属于翻译修订它的人。它属于使用它的学校、政府、军队和雇主。
这些人不想听比奈的恳求,不想听陆志韦的谨慎提示,不想看测验手册里那些关于“环境影响”的小字注释。他们只想看分数、排名、及格线。因为分数好管。排名好决策。及格线好操作。
一个数字能让校长决定谁进快班谁进慢班,能让教育局长决定哪个学校多拨经费哪个学校裁撤合并,能让征兵官决定谁去开飞机谁去扛步枪,能让殖民官员决定哪个族群适合管理哪个族群只能被管理。这个数字是不是准确测出了先天智力?没人在乎。
说书人讲到这里,得正面回应一个绕不开的反方论点。支持智力测验的人会说:你说的这些都是历史滥用,但测验本身测到的东西——g因子、一般认知能力——是真实存在的。大量研究证明它在预测学业成绩和工作表现方面确实有效。
如果它完全没用,怎么可能被全世界采用?这个论点有它的分量。智商分数确实和很多现实结果相关——学习成绩、收入水平、甚至健康状况。但这种相关性不等于你测到了先天固定的东西。身高也和收入相关——个子高的人平均收入更高——但不代表身高是收入的唯一决定因素,更不代表我们应该按身高分配社会资源。
关键不在于智商测验有没有预测效度。关键在于这种预测效度被偷换成了什么:从“一定程度上预测”变成了“完全决定”,从“受环境影响的相关性”变成了“先天固定的本质”,从“群体统计趋势”变成了“个体命运判决”。
而跨国传播把这个偷换过程放大了十倍。因为当量尺越洋的时候,连“一定程度上的预测效度”都打了折扣——文化差异和翻译扭曲让测验变得更不准了——但使用者的信心反而更强了。越是不准的量尺,使用者越急于用制度权威来弥补它的不准。
这就是为什么苏联后来彻底翻脸。1920年代到1930年代初,苏联曾经是心理测验最热情的引进者之一。
苏联教育人民委员会设立了专门的儿童学研究机构,大规模使用智力测验来筛选学生、规划教育路径。苏联心理学家把西方量表翻译成俄语,在莫斯科和列宁格勒的学校里建立了标准化施测流程。然后到了1936年7月4日。苏共中央发布了一项决议:《关于教育人民委员会系统中儿童学的歪曲》。
决议宣布儿童学是“资产阶级伪科学”,智力测验是“反马克思主义的工具”,所有相关研究和实践立即停止。已经印好的测验手册被销毁,儿童学研究机构被关闭,主持测验的心理学家被批判、调离甚至更糟。决议里有一段话值得细读:“所谓智力测验的理论和实践,实质上是把资本主义社会的阶级不平等搬运到社会主义教育中来,用‘先天素质’的伪科学外衣为剥削阶级子女的特权地位辩护。”
这段话的意识形态腔调很重,但你把它剥开来看里面的逻辑:苏联官方之所以封杀智力测验,不是因为他们觉得测验不准——恰恰相反,他们发现测验结果总是显示工人和农民子女得分更低——而是因为他们拒绝接受这种结果所暗示的社会分层图景。在资本主义国家,工人子女得分低可以被解释为“他们天生就不行”,然后心安理得地让他们继续当工人。在社会主义苏联,同一个结果不能被接受——因为它挑战了“人人平等”的意识形态承诺。所以苏联选择了最彻底的解决方案:把量尺砸了。
这里面有一个深刻的反讽:苏联和美国对智力测验的态度截然相反——美国拥抱它来证明社会不平等是自然的,苏联砸碎它来维护人人平等的意识形态——但两国都承认了同一个前提:测验分数反映真实的能力差异。区别只在于美国说“差异是合理的”,苏联说“差异不允许存在”。两个超级大国都绕过了比奈那个最根本的警告:差异可能根本就不是测验分数反映的那样。
德国在同一时期走了第三条路。纳粹德国也用智力测验,但用法完全不同。
纳粹种族理论家不需要智商分数来证明雅利安人优越——他们有自己的一套种族科学来干这件事。智力测验在纳粹德国的功能不是筛选天才,而是筛选“劣等”——用来识别和标记那些被认为智力低下的个体,作为强制绝育和后来安乐死计划的依据之一。同一套工具,在美国用来把聪明孩子送进大学,在苏联被砸碎扔进垃圾堆,在德国用来决定谁不能生育。量尺还是那把量尺。
说书人讲到这里,这堂课的判断应该清楚了。智商测试的全球传播从来不是科学成果的自然外溢。它是一次又一次的再编码。每一次翻译都改变了量尺的刻度——不是微调,是结构性改变——因为题目背后的生活经验被悄悄换掉了。
每一次制度引入都为当地的社会筛选提供了一套新话术——科学、客观、进步——但这套话术在不同政治土壤里结出了完全不同的果实。比奈的恳求飘不过大洋。陆志韦的谨慎挡不住制度的惯性。国际会议的争论解决不了跨文化比较的根本困难。因为问题从来不在技术上。
技术可以改进——题目可以换得更贴近本土经验、常模可以收得更广泛更有代表性、施测流程可以标准化到每一个细节。问题是使用者的信念改不了。人们相信那个数字说了真话。人们需要那个数字来做决定。
一旦信念和需要合在一起,任何技术改进都只能让量尺看起来更科学、更不可质疑——而不能阻止它继续被用来把复杂的人变成简单的数字标签。1937年,陆志韦的修订版比奈量表在中国已经用了十几年。
那一年发生了两件看起来不相关的事。第一件:日本全面侵华战争爆发。北平、上海、南京的学校纷纷内迁。那些曾经接受过智力测验的学生散入西南大山里。测验记录丢失了,常模数据作废了,“科学筛选”在炮火面前显得像一个遥远的笑话。
第二件:苏联正式关闭了最后一个儿童学实验室。《关于儿童学的歪曲》决议执行得比任何人预想的都彻底。苏联教育体系从此不再提“智力测验”这个词——直到几十年后才悄悄恢复了一些心理测量实践,但再也不敢公开叫这个名字。这两件事之间没有因果联系。
但它们放在一起构成了一个意味深长的画面:量尺越洋之后不到二十年,在两个大国里分别遭到了战争的粉碎和政策的绞杀。但这把尺没有死。它只是换了一个名字继续活着。战后它在日本重建时期复活了——改叫“学力测验”。它在中国改革开放后回来了——改叫“标准化考试”。它在印度独立后扎根了——作为公务员选拔体系的核心组件。它在欧洲福利国家里变形了——嵌入到特殊教育安置和职业指导系统里。每一次复活都换了包装、换了话术、换了制度接口。
但内核没变:把人的潜能压缩成一个可比较的数字,然后根据数字分配机会。这就是命运技术的跨国变体史。
它不是一条直线从巴黎走到硅谷。它是一张网——从巴黎出发,经过斯坦福、埃利斯岛、上海租界学堂、东京帝国大学、孟买殖民政府、莫斯科教育人民委员会、柏林种族卫生局——每到一个节点就分叉、变形、与当地制度嫁接。最后留下来的不是一把统一的量尺。而是一个统一的信念:人是可以被数字定义和排序的。
这个信念在二十一世纪变成了算法招聘里的权重系数,变成了PISA测试里的国家排名,变成了家长冰箱上的成绩单。说书人这一章讲的是越洋时代的故事。下一堂课我们要回到欧洲大陆的中心——1936年莫斯科那间被关闭的儿童学实验室里发生了什么?为什么一个曾经热情拥抱心理测验的国家会突然翻脸?那把被砸碎的量尺后来有没有重新拼接起来?这些问题留到后面再说。此刻只需要记住一件事:当量尺越洋的时候,它带过去的不是科学,而是人们对科学的信仰。而信仰一旦落地生根,就比任何具体的测验题目都更难拔除。