第 30 章
量尺之外
一边是2022年美国心理学会放出来的一份专家组报告,标题长到几乎不会有人完整念完。封面上没有惊天动地的结论,没有“智商测试完蛋了”那样的宣告。它只是承认了一件很久以来被专业人员回避的事:智商分数反映的不只是认知能力,还有家庭收入、父母教育水平、社区资源和测试时的焦虑程度。
另一边是一条社交动态。一个年轻人晒出某个在线测试给出的低分,数字停在八十几,配文只有一行——“今晚还是想吃火锅”。下面几千个赞,几百条评论。没有人惊呼,没有人安慰,也没有人急着科普智商的意义。那个数字像一张旧标签,贴在衣服上,洗过太多次,已经没有人再去看它。
一边是专业共同体迟来的反省,一边是普通人对数字的轻松拒绝。两个场景放在一起,问题就出来了:如果智商不是命运的判决书,如果我们已经知道这张量尺量不出人的全部价值,那我们该用什么来理解人与人之间的差异?这是绕不过去的一问,也是这本书最后必须回答的一问。想回答这一问,不能只靠情绪。先得面对一个强硬的对手。
在心理测量学内部,有一派人会说:你们把智商测试的历史骂得再狠,也改变不了一个基本事实——它量到了一种真实存在的东西。这种东西叫一般智力因素,专业圈子里喊它g因子。二十世纪初,英国统计学家查尔斯·斯皮尔曼发现,一个人在不同认知测验上的成绩彼此正相关。数学好的孩子,语文往往不差;
推理测验得分高的人,记忆测验也常常靠前。斯皮尔曼从这种普遍的正相关里抽出一个共同因子,把它命名为g。从那以后,这个g因子反复出现在各种测验数据里。跨文化、跨年代、跨方法,它都冒出来。支持者据此认为,智商测试不是社会建构出来的幻觉。它测量的是一个真东西,一个在人群中有差异、在一定时间内稳定的认知内核。
不光如此。支持者手里还有预测数据。智商分数能预测学业成绩,这在无数研究里得到过验证。相关系数通常在0.5上下,社会科学领域里,这已经是一个相当能打的数字。它能预测职业表现吗?能,但相关度更低,通常不到0.3。它能预测收入、健康、甚至寿命吗?
能,但相关度更低,而且只要把家庭背景、教育年限、社区条件放进去,这些相关还会进一步缩水。这个说法不可轻视。它解释了智商测试为什么能活过一百多年。它没有死在实验室门口,没有死在法官判决之后,没有死在街头抵抗之中,正是因为它的确能预测某些东西。今天我们想要严肃地讨论“量尺之外”,就不能假装预测效度不存在。科学事实必须被承认。但承认了,不等于接受对方的全部解释。
预测效度和因果解释,是两回事。一个分数能预测一个结果,不等于这个分数就是那个结果的原因。更不等于这个分数是天赋在出生时刻好的刻度。
这里要拆开来看。一个孩子从小家里有很多书,父母晚间不刷手机而读书,他三岁就听过大量词汇,五岁有幼儿园老师单独指点字母,七岁有安静的卧室和充足睡眠。另一个孩子没有这些。前者在智商测验里分数更高,在学校也更容易拿到好成绩。请问:这个高分数,是因为一种先天的认知能力,还是因为他已经被环境塑造得更像测试所偏好的那种头脑?答案并不难。
家庭收入可以同时推高智商分数和学业排名。父母教育水平可以同时影响孩子的测试表现和学校适应。社区资源可以同时支撑认知发展和教育成果。测试时的焦虑可以同时压低分数和后续表现。这些变量不是各自独立,而是互相纠缠,像一个不断滚动的循环。分数站在循环中间,浓缩了一个人被社会塑造之后的状态。
所以,预测效度是真的,但它不证明测试量到了纯天赋。它证明的是,这个分数把很多社会条件打包压缩成了一个数字。这个数字能在统计上预测未来,很可能不是因为数字包含了命运,而是因为数字本身就是一个社会不平等的翻译器。这恰恰是2022年那份专家组报告说出那句话的原因。它没有说“智商测试没有预测效度”。它说的是,智商分数反映的不只是认知能力,还有家庭收入、父母教育水平、社区资源和测试时的焦虑程度。
两句话必须放在一起看。测试有效,但有效不等于纯粹。量尺量出来的,是一个被社会塑造之后的综合结果,不是一张出生前就写好的底牌。把这一点想透,原先那个问题就松动了一些。
如果智商不是命运的判决书,我们好像并不是要走向“否认差异”。那是另一个极端,也不真实。人跟人之间确实有差异。有的孩子开口早,有的孩子认字快,有的成年人空间想象强,有的语言记忆好。否认这些差异,只会让人讨论问题时失去立足点。
真正的问题不是有没有差异,而是差异能不能被一个数字穷尽。答案是不能。把一个孩子在十二岁一次测验中的表现,当成他这一生智力总量的刻度,这在经验上荒唐,在伦理上危险。人的发展是动态的。认知能力不是一出生就固定下来的常数。它会在与环境的互动中改变,有时快,有时慢,有时被激发,有时被压制。
弗林效应已经把这一点说得十分清楚。二十世纪,多个国家的平均智商分数每十年上升约三个点。人的基因库不可能在几十年内发生这么大的变化。变的是营养、教育、城市化,是信息环境的复杂度,是越来越多孩子从小就接触现代测试所偏好的抽象符号、分类推理和快速规则切换。一个1930年代的孩子如果被放进今天的测试情境,他的得分会远远低于现代儿童。
不是他的大脑质量更差,而是他的成长环境没有给他提供那种训练。反过来,今天的孩子在野外辨识植物、手工修理、身体记忆这些方面,可能远不如祖父母那一辈。两种差异都是真实的,也都是环境和历史塑造的。没有哪一边更“天生”。
这个判断是对反方最有力的回应:说智商分数有预测效度,不等于说它在一切社会条件下都预言同样的人生。预测效度本身也依赖环境。当教育机会、营养水平、社会压力和身份威胁改变之后,个体在测试中的表现也会改变。分数不是稳定的命运标记。它是一个特定情境下的表现快照,背后站着一整套社会条件。
现在可以正面回答了。如果智商不是命运的判决书,我们该用什么来理解人与人之间的差异?用第一根量尺最初想做的事。比奈在巴黎设计量表,不是要给孩子们贴终身标签。他在找那些在普通课堂上跟不上的孩子,好把他们挑出来,给特殊帮助。比奈自己警告过:智力不是一个固定不变的数量,它可以通过训练和教育增长。他的逻辑是补救,不是淘汰。
后来发生的事,是把补救逻辑替换成了排序逻辑。美国人把比奈量表带过大西洋,斯坦福大学的刘易斯·特曼把它标准化,发明了“智商”这个词。特曼相信,人的智力基本上是先天的,由遗传决定,终其一生保持稳定。从那一刻起,比奈的量表不再只是找出需要帮助的人,它开始给人排出高低:谁聪明,谁平庸,谁低能,谁可以进资优班,谁该进弱智学校。再往后,这套东西越滚越大。学校用它分班,军队用它分派岗位,移民官用它决定谁可以进入国境,法院用它判断谁可以被处决,公司用它筛选求职者。一根原本用来识别困境的标尺,变成了分配生命机会的判决书。比奈的初衷没有被世界听见,或者听见了,又被制度盖上。
这个历史的变体,正是本书一直追踪的那种“命运技术”。什么是命运技术?简单说,就是把人的复杂潜能转化为单一数字标签,再据这个数字分配生命机会的社会装置。智商测试是这一类装置中最成功的原型。它成功的秘诀,不在于测量得绝对准确,而在于它把测量变成了一种人们愿意相信的客观程序。
一个数字一旦印在纸上,就有了不容争辩的权威。孩子考了85分,家长不知道是该欣慰还是忧虑,但多半不怀疑数字本身。他们怀疑孩子不够努力,怀疑老师教得不好,怀疑自己投入不够,却很少怀疑尺子的单位。命运技术要运转,还要依赖一个动作:量化分类。人的认知能力原本是连续分布,没有哪一点天然标示着“正常”与“低能”的分界线。
但制度必须切。班级名额有限,军校岗位有限,移民配额有限,公司的面试名额有限。于是划线。线一旦画出来,类别就好像天然存在。后来的人忘了线是人画的,只记得“天才”“正常”“低能”这些格子。这些格子在历史上不断被质疑,也不断以新的面目出现。智商70和130的分界标准换过几次,“白痴”“愚笨”“天才”这些词换过几轮,但把人放进数字等级的动作从未真正停止。
今天我们看到的资优班筛选、文法学校传统、重点学校系统、跨国公司的认知测试,乃至于社交媒体上打着“测测你的智商”旗号的小游戏,都是在延续同一个逻辑:把人放进一个由数字定义的序列,再让这个序列分配机会。问题不在于测量本身。量尺本身没有罪。问题在于我们对待量尺的方式。
打一个比方。体温计。它测你现在的体温,告诉你发不发烧。这个功能很清晰,也很有用。但没有人会拿体温计去判断一个人能活多少岁,没有人因为它量出37.2度就断定这个人善良还是刻薄,也没有人用它来决定一个人该进哪个学校、该从事什么职业。为什么?因为我们都知道体温计的边界在哪里。
为什么智商测试就不能被这样限制?因为它承载了太多测量之外的功能。它被用来分配教育资源,被用来筛选移民,被用来排序求职者,被用来解释社会不平等的合理性。这些功能不是科学本身,而是社会决策。但社会决策喜欢把责任推给数字。数字看起来中立、不动感情、不受人情影响。
于是,一个带有价值判断的权力动作,就披上了科学客观的外衣。一旦你试图把智商测试降格为“参考指标”,这些功能就会失去科学外衣,暴露出它们的社会决策本质。那时人们就得承认:我们不是在判断一个孩子是否聪明,而是在替他决定他配进入哪条轨道;我们不是在测量一个求职者的潜能,而是在用最低成本淘汰一些人;我们不是说社会的层级由能力决定,而是在用测试把既有的层级再确认一遍。承认这些,并不会让世界马上变好。但它让我们不再被数字骗得心安理得。
或许有人会问,这是不是要彻底抛弃智商测试?不是。这个问题问得不对。测工具不会因为被滥用就消失。它消失不了。学校教育要筛选,企业要招聘,机构要在有限时间里处理成千上万人。这些需求会一直存在。只要有这些需求,就会有人造出新的筛选工具。
命运技术不会死,它只会换代。今天可能是认知测验,明天可能是算法评分。硅谷的招聘算法从上千个变量中给求职者打分,看起来比智商测试更精密,实际上更不透明。
它不是在消灭命运技术,而是在给它换一张更现代的脸。所以,真正的问题从来不是“要不要消灭量尺”,而是“我们能不能限制它的权力”。限制的第一步,是承认任何量尺都是有限的。承认人的发展是动态的。承认一个数字永远无法穷尽一个人的可能性。这三句话不是空口号。体温计早就实现了这种有限性。它只提供一种信息:现在烧不烧。它不预言生命,不评判人格,不分配前途。为什么智商测试不能一样?因为围绕体温没有一整套工业和制度靠它分配资源。围绕智商有。
这里有另一种可能。心理学中早就有人提出动态评估的思路:不要只测一个人现在能做什么,而是看他在给出提示、给了教学之后能进步多少。进步空间比当前分数更接近学习潜力。但动态评估从没成为主流,因为它慢、贵、不好标准化。它指出的方向却很重要:我们可以测量变化,而不是测量一个被社会条件冻结的时刻。这层认识,会把我们带回到比奈的那句话。智力不是固定的,可以通过训练增长。这句话在今天比当年更像一句挑战。
二十世纪的平均智商上升,营养和教育干预带来的成果,为这句话提供了证据。成长性评估也显示,如果改变条件,孩子的表现并不是死水一潭。人的能力在与环境互动中改变。一个在阅读上进展缓慢的孩子,可能是因为缺少早期语言环境,因为营养不良,因为长期焦虑,因为关键阶段没有遇到合适的老师。这些都不是不可改变的。关键在于,我们愿不愿意把资源投到改变环境那一边,而不是投到给个体排序这一边。
比奈的逻辑是补救。后来制度的逻辑是排序。补救逻辑问:他需要什么?排序逻辑问:他排第几?前者花钱,后者省钱。于是后者胜出。
这个胜利很自然,自然到很多人已经忘了前者曾经存在。成绩差的学生不再被视为需要帮助的人,而被视为能力不足的人。这两者的区别细微,却致命。前者指向资源、支持、改变。后者指向放弃、淘汰、固定。一个社会如果长期用后一种眼光看人,就会把教育变成筛选,把学校变成分流站,把人生变成一场不断证明自己够不够格的考试。
美国心理学会2022年的那份报告提醒我们的,正是这个区别。它没有说“不要测试了”。它说的是,分数反映的不只是认知能力,还有家庭收入、父母教育水平、社区资源和测试时的焦虑程度。这个“不只是”里面,藏着一整部历史。藏着比奈初衷被扭曲的一百多年,藏着弗林效应对先天论的冲击,藏着数以百万计孩子被错误分类的命运,也藏着从法庭到街头那些拒绝被定义的动作。
所以,本章的判断可以这样落下来:智商测试不会消失,但我们可以改变与它的关系。把它从“天赋的刻度”降格为“当前表现的一个参考指标”。这不是技术方案。技术方案救不了这个问题。这是一个认知转变。在教育决策中,把它当作众多信息中的一条,而不是唯一决定项。在临床判断中,把它的文化偏见和社会背景纳入考虑。在社会分析中,不再用它来解释不平等的合理性。这一系列转变不需要推翻科学,只需要诚实地面对科学。科学从来不承诺确定性。好的科学家知道自己的工具能做什么,也知道自己的工具不能做什么。
温度计能测体温,不能测寿命。智商测试能测当前在某些认知任务上的表现,不能测一个人的天赋潜能,不能预测他未来的成就,更不能判断他作为人的价值。这些边界本来存在。一百年来,这些边界被制度需要、商业营销和社会焦虑反复模糊。
如今重新划清边界,不是否认工具,而是让工具回到它该待的地方。回头看,这本书从比奈的巴黎出发,穿过军队、学校、法庭、移民局、国会、硅谷和无数普通人的客厅。路上,智商分数被赋予了太多东西:科学权威、命运预言、社会地位合法性、个人身份依据。现在该把这些东西一件件拿下来,放回它们原本属于的地方。
科学权威还给科学,但仅限于科学能够证明的范围。命运预言没有依据,应当丢弃。社会地位的合法性是政治问题,需要政治而不是心理测量学来回答。
个人身份的依据,最终要回到个人的生活经历、选择和行动。一个数字不能概括你。这不是安慰,而是这本书对智商测试历史的诚实结论。
不过,要说清楚这个结论,不能只停在纸面上。它最早可以追溯到两位几乎同时代的人,一个在伦敦的统计表里找规律,一个在巴黎小学的走廊里看孩子。查尔斯·斯皮尔曼坐在一堆数字中间,发现不同科目的成绩总是一起好坏。他给这个共同因子起名g,以为找到了智力的核心。但比奈走的是另一条路。他不去追问智力的本质是什么,他只问眼前这个孩子为什么跟不上课。两个人都在1904年前后开始工作,却把尺子引向了两个方向。一个方向通向实验室里的统计推断,另一个通向教室里的补救。后来的历史选择了前者,后者被挤到了边角。
这不是说g因子没有科学价值。它是真实存在的统计现象,任何严肃讨论都不能装作没看见。但g因子被反复验证,并不等于它解释了全部差异。斯皮尔曼的同时代人、美国心理学家路易斯·瑟斯顿就不同意单一因子说。他提出智力由多个独立能力组成,言语、数字、空间、记忆各有各的轨道。这场争论持续了几十年,没有一方完全胜出。今天的主流测试仍然偏爱单一总分,但研究者都承认,测试分数下面是好几个能力模块在共同起作用。光凭一个总分,你分不清一个孩子是语言强数学弱,还是空间记忆突出。g因子把复杂的人压缩成一个数字,科学上方便,应用上危险。
这种压缩在比奈那里原本是被抵制的。他在巴黎给孩子们做的测试,根本不是纸笔考试。他会让孩子说出硬币的名称,重复几个数字,比两条线段哪条长。他在书里反复说,分数只表明孩子此刻需要帮助,不是对他的智力下判决。他甚至担心,如果老师把分数当成孩子的固定标签,那这个工具就坏了。这是他最接近预言家的时刻。
因为仅仅几年后,他的量表漂洋过海,被美国人改造成了一套标准化、可大规模施测的设备。斯坦福大学的刘易斯·特曼给每个孩子算出一个数字:心理年龄除以实际年龄,再乘一百。智商从此有了一个简洁的称谓,也有了便于比较的刻度。特曼相信智力是稳定的、遗传给的,他参与军队测试,推动把智力排序当作社会政策。比奈的补救逻辑在这里被替换掉了。
要理解替换怎么就成功了,得看1917年的美国军队。当年美国政府要给上百万新兵分派岗位,心理学家抓住机会,设计了陆军甲种和乙种测试,对约一百七十万人施测。测试题目里不时出现网球拍、美国本土广告语这类文化符号。一个新移民可能看得懂英文,却看不懂那些题目背后的生活场景。
于是他的分数低,不是认知能力低,而是不熟悉测试所预设的文化世界。军队测试的数据后来被一些人拿来证明某些族裔智力低下,直接进了移民政策的讨论。1924年移民限额法案的出台,离不开这些分数的推波助澜。到了这一步,尺子已经不仅仅是找出需要帮助的孩子,它开始决定谁可以进入国境、谁配得到机会。比奈当初担心的标签化,成了制度现实。
但历史的另一条线也在暗中生长。二十世纪后半叶,新西兰人詹姆斯·弗林整理各国智商测试分数时,发现一个奇怪现象:每隔十年,平均分就上涨大约三分。他反复核对数据,以为哪里出了错。结果没有错。基因库不可能在几十年里大变,营养、教育、城市化却可以在几代人间改变人的抽象推理习惯。弗林效应让先天论遭遇了最直接的经验反驳。
它说明人们所称的“智力”,很大一部分是社会条件养出来的表现,而不是出生时封存在大脑里的常数。把这个发现和军队测试的文化偏差放在一起看,原先那个看似坚固的g因子神话就出现了裂缝。g因子描述的是人群中的共同变异,但它回答不了这个共同变异从何而来,更回答不了为什么同一群人在不同年代、不同社会条件下整体水平会漂移。
于是,当2022年美国心理学会的报告承认分数混着家庭收入、父母教育、社区资源和焦虑时,它并不是在念一句新咒语。它只是把这一百多年积累的裂缝摆到了台面上。那些裂缝一直存在,藏在斯皮尔曼的因子矩阵里,藏在比奈的警告里,藏在军队测试的网球拍题目里,藏在弗林的折线图里。现在把它们拼起来,结论并不复杂:量尺能测出一些真实的东西,但这些真实的东西远不是它声称要测的那个全部。它测出的是一段被环境、制度和历史反复加工过的表现。这个表现重要,值得记录,但不能冒充一个人的命运。
一个多世纪的证据表明,智商分数受到太多非认知因素污染,被太多制度功能扭曲,被太多文化偏见渗透。它不是一个客观的天然刻度,它是一个社会建构的文化符号。人们对它的信仰本身,比分数更深刻地塑造了现代人的自我认知与机会结构。
这句话不是最后一章临时得出的,而是前面所有场景共同指向的地方。现在,再看开篇并置的两个场景,会多出一层理解。心理学会的专家承认分数里混着社会条件,却没有给出替代方案。年轻人的火锅动态拒绝让数字毁掉晚饭,却不会改变下一次测试被用于筛选的现实。
两个动作都不完整。但也许都不完整,才是起点。专业共同体不再假装测试是纯粹的,普通人不再因为一个数字而否定自己,量尺的绝对权威就已经在松动。接下来会发生什么,不知道。也许测试还会继续存在几十年,也许新的测量技术会取代它,也许算法评分会以更隐蔽的方式重新把人的复杂潜能转化为数字。这些都不是这一章能回答的,也不该由一本书假装回答。
我们只能把选择摆在眼前:当数字不再被当作命运,你怎么看待眼前的人?你是继续相信那个数字,还是相信自己的眼睛?这个选择不会出现在考卷上,不会出现在招聘筛选表上,也不会出现在学校的分班系统里。
但它在每一次家长看见孩子成绩单时的沉默里,在每一个教师面对所谓“差生”时的态度里,在每一个招聘者浏览简历时的判断里,在每一个为自己挑选身份标签的瞬间里。比奈没能看到他的量尺如何被世界使用。可是早在一切开始的时候,他已经说过:智力不是固定的,可以通过训练增长;量尺的任务是找出需要帮助的人。
一百二十年后,我们重新听见这句话,会忽然发现,它早就不只是一个历史注脚。它是一个尚未兑现的起点。
量尺是人造的。人也可以重新定义它。你愿意继续相信那个数字,还是愿意相信自己的眼睛?这个问题没有标准答案,但它已经不再是一道数学题。