第 17 章

变聪明的悖论

“我为‘为什么黑人比白人笨?’这个论战寻找证据时,撞上了另一边的事实。”

詹姆斯·弗林在1984年的一次学术会议上说出这句话时,台下坐着的心理学家们还没意识到,他们即将面对的是智商测试诞生八十年来最尴尬的内部事实。弗林不是心理测量学家,不研究认知发展,甚至不在心理学系任职。他是新西兰奥塔哥大学的政治学教授,研究正义战争理论,学术生涯前二十年跟智商测试没有任何关系。他闯进这个领域,纯属意外。

这个意外起源于1970年代他在美国讲课时的遭遇。弗林在课堂上讨论种族与平等,总会有学生举手问同一个问题:如果黑人和白人之间真的存在智商差距,而且是基因决定的,那追求平等还有什么意义?弗林觉得这个问题本身就不对。

他的政治学直觉告诉他,用几个世纪被奴役、隔离、剥夺教育的人群,去跟享有全部社会资源的人群比较智力测试分数,然后宣称差距来自基因——这要么是逻辑混乱,要么就是为种族秩序找科学背书。他开始搜集智商与种族的相关文献,准备写一本书反驳这个论点。1980年,那本书出版了,题为《种族、智商与教育》。

弗林在书中逐条分析了阿瑟·詹森等人的遗传决定论论证,指出他们系统性地低估了环境因素的作用。书写得很扎实,但在这场已经打了十几年的口水仗里,它只是又一本反种族主义的学术著作,没有掀起太大波澜。真正让弗林出名的发现,埋在他写书时整理数据的一个深夜。

为了论证詹森的错误,弗林调出了美国历年智商测验的常模数据——也就是制定标准时用来校准分数的大量原始测试记录。他需要这些数据来证明,黑人和白人之间的分数差距会随着社会条件改变而缩小。

但当他对照不同年份的常模时,一个数字跃出纸面:同一套测试题,同一批年龄的孩子,每一次更新常模时,新测出来的原始得分都比旧样本高出一截。弗林以为自己算错了。他又查了其他国家的标准化数据,结果完全一样。荷兰的义务兵测试,1952年到1972年,18岁男性的平均分数上升了20分以上——换算成标准智商分数,相当于在二十年里一代人“变聪明”了一个标准差的幅度。

以色列、挪威、比利时、加拿大、日本,但凡能找到跨年份标准化数据的国家,全都呈现出一致的上升趋势。有些国家收集的样本跨越五十年甚至更久,上升幅度累加起来大得惊人。弗林在1984年公开发表了这个发现,最初称之为“智商分数的代际上升”。后来心理学家们为了绕口,管它叫“弗林效应”。

这个名字一直沿用至今,尽管弗林本人到晚年仍在说,这不该叫效应,应该叫谜团——因为它至今没人能完全解释清楚。我们先把谜团的具体尺寸说清楚。

1984年弗林发表的第一篇文章,主要依靠美国斯坦福-比奈量表和韦氏儿童智力量表的常模数据。斯坦福-比奈从1932年到1972年,每次重新标准化时,都需要测试一个新的代表性样本,用来设定新的平均分基准。弗林对比了四个时间点的原始分数:1932年的样本、1947年的样本、1960年的样本和1972年的样本。他发现,在所有年龄段上,原始得分都在稳定上升。

用最直观的说法就是,1972年一个普通十岁美国孩子,在做1932年版的测试题时,能够拿到的原始分数,足以让他在1932年那个样本里排进前百分之十五。如果你把这个差距折算成标准的智商分数,大约每一代人在各项分测验上平均增长5到10分,某些分测验甚至更高。

韦氏量表的数据提供了更详细的信息。戴维·韦克斯勒在1939年编制第一套成人智力量表时,按照智商的定义,把每个年龄组的原始分数平均值设定为100,标准差为15。这意味着在任何一个年龄组中,大约三分之二的受试者分数会落在85到115之间。

1955年韦克斯勒修订量表时,需要重新常模化。新的标准化样本在旧版题目上得分明显更高。如果按照1939年的标准换算智商,1955年的样本平均智商就成了104左右。到1981年再次修订时,同样的事情重复发生:1981年的样本在1955年的题目上表现更好,如果按照1955年标准换算,平均智商又高了那么一截。

弗林把这些年份的差异累加计算,结论是:从1930年代到1970年代末,美国人口在韦氏量表上的平均智商分数大约上升了13.8分。这不是一个小波动,而是一代人比上一代人在同一套题上多得将近一个标准差的分数。

现在问题来了。按照智商测试的基础假设,智商在人群中呈正态分布,平均值固定为100。每过一段时间,样本会老化,题目会泄漏,测试编制者就需要更新常模——找一伙新的人来做题,把他们的原始分数分布重新校准为均值100。这个操作叫“标准化”。

标准化本身没问题,问题在于,每一次新样本的原始分数都比旧样本高。测来测去,人真的在“变聪明”。按照智商的定义,如果平均智商是100是一个固定的基线,那么任何一代人都不可能集体比上一代人高出一个标准差。如果是基因遗传的智力,按照进化节奏,不可能在几十年内发生如此显著的变化。

如果环境和社会条件无关紧要,跨国和跨时段的分数应该保持稳定。三种假设全部撞墙。弗林自己对这个发现的解释非常谨慎。

他最初只是指出这个现象不容回避,并没有立刻给出完整的因果理论。1987年他发表了第二篇重要论文,扩充了国家样本,把欧洲和亚洲的数据也纳入分析。日本的数据尤其明显:从1950年到1970年,韦氏儿童智力量表在日本的标准化显示,平均智商分数上升了大约7到10分。荷兰义务兵测试从1952年到1972年的样本,分数上升了20分以上。1952年通过测试的荷兰新兵不到百分之三十能达到某一分数门槛,到1972年,这个比例翻了一倍不止。

同一套数学和语言推理题,相隔二十年的一代年轻男性,作答正确率出现了系统性的全面提升。如果这些题目真的测量的是某种固定天赋,那只能说荷兰人在战后二十年里集体进化了——这个结论显然站不住脚,因为人类基因库不可能在二十年里改变到那种程度。

但弗林也注意到一些奇怪的分项差异。分数上升不是均匀分布的。某些分测验上升幅度极大,另一些则几乎没有变化。在韦氏量表中,上升最厉害的是图形排列、积木设计这一类非语言的抽象推理题目。

词汇分测验和常识分测验上升幅度相对较小,算术分测验上升也不大。这种分化本身就很有趣。如果营养改善导致了整体大脑发育加速,为什么直接测量知识和计算的分测验上升得少,而抽象推理题目上升得多?如果教育普及是关键,为什么学校教的算术词汇变化有限,而看似不需要课堂学习的拼图题却突飞猛进?

弗林后来提出了一套最有影响力的解释,他把这叫作“社会工业化假设”。核心观点是:现代社会在二十世纪经历了一场认知需求革命。

生活在1930年代的人,大多数从事体力劳动,日常语言中充满了具体操作指令和经验判断。他们需要辨认农作物病害,需要估算一袋谷物能装多少碗,需要判断天气变化——这些都是具象思维。到了1970年代,越来越多的人进入制造业、服务业和信息业,日常工作和生活中需要处理的不再是看得见摸得着的东西,而是一套套抽象规则。工厂工人要看流程图,办公室文员要填写标准表格,售货员要学会操作收银终端,家庭主妇要对照优惠券上的日期、条件和折扣规则。

学校教育也从背诵事实转向了分类、归纳、假设检验——科学思维从实验室泛化到了日常推理中。弗林认为,抽象推理能力的代际增长,主要反映的是这种认知环境的整体转型。但这只是一个方向性的解释,不是精确的因果模型。

弗林效应从1980年代开始被反复验证、争论、细化和反驳,三十多年过去,心理学界仍然没有达成共识。营养改善确实是一个强有力的因素:荷兰1944年冬季饥荒期间出生的儿童,数十年后追踪发现认知能力显著低于同胞对照样本,而二战后营养充足环境下长大的孩童在整体发育指标上都有所提高。

教育年限的延长显然也在起作用:接受更长时间教育的人,面对纸笔测验的反应速度、解题策略和专注力都更好,这是反复验证的教育心理学常识。城市化带来了更丰富的感官刺激和语言环境,家庭规模缩小意味着每个孩子从父母那里获得的交流时间更多。电视机在1950年代进入家庭,大幅增加了儿童接触标准化语言和抽象叙事的机会。所有这些因素交织在一起,构成了一个多因一果的复杂图景。

这里必须停下来做一件事。弗林效应为什么“尴尬”?它到底跟谁的什么利益过不去?

在智能研究内部,有一条持续了百年的裂痕:一边是相信智力主要来自遗传的人,另一边是强调环境和教育作用的人。比奈本人站在后者这一边,他在1905年设计量表时明确地说,测试只是为了把需要特殊教育的孩子挑出来,不是要给他们贴终生标签。但他的量表传到美国以后,被戈达德、推孟和耶基斯这群人改造成了遗传论的工具——推孟在1916年的斯坦福-比奈手册里写,智商测试可以辨认出“天赋卓越”和“智力缺陷”的个体,这些差异主要来自遗传。耶基斯在一战军队测试后的报告中声称,心理测量科学已经证明了先天智力的种族分层。

到1969年,阿瑟·詹森在《哈佛教育评论》上发了一篇长达123页的文章,标题就叫《我们能在多大程度上提升智商和学业成就?》。詹森的核心论点是:智力百分之八十由基因决定,不同的补偿教育项目之所以没能持久提升黑人儿童的智商分数,是因为他们的基因潜力本身就低。

这个推论逻辑极其清晰——清晰得像一把手术刀。首先,智商测试测量的是g因子,即通用智力,它是真实存在的认知能力,主要受遗传控制。其次,不同种族群体的平均智商分数存在差异,这个差异在多次标准化测试中都得到确认。第三,既然环境干预对智商分数的提升效果有限且不持久,那么这个差异就不能归因于环境。结论是推出来的,推到结果就是种族之间的智商差距主要是遗传造成的,社会政策的努力是徒劳且不自然的。

詹森的论点发表后,全美爆发了激烈争论。赫恩斯坦1971年在《大西洋月刊》上发表《智商》,把詹森的逻辑推进到社会分层:如果智力主要来自基因,而智力又决定了人们的职业地位和收入,那么社会阶级本身就是遗传禀赋的自然体现。富人聪明,穷人不那么聪明,这个格局不是不公正,而是自然。

1980年代赫恩斯坦继续沿着这条线论证,最终在1994年与查尔斯·默里合著了《钟形曲线》,彻底把智商拉进阶级政治的漩涡中心。弗林效应从哪个方向冲击了这套论证呢?

不是从反面说“不对,智力由环境决定”,而是从经验证据内部给出了一记致命的反问:如果智商分数主要由遗传决定,为什么同一个国家的人在三五十年内就能出现平均分数的大幅上升?基因频率不可能在几十年内发生显著变化,这是群体遗传学的基本常识。你总不能说1945年出生的一代美国人在g因子上进化了五代人。

所以这个解释只剩两条路可走:要么智商测试没有真正测量到他们声称的那个稳定不变的g因子,要么g因子本身也受环境的深刻影响。这两条路都不在遗传决定论的剧本里。第一条路意味着测验的效度出了问题——如果人的分数可以随年代漂移这么多,那么个体分数上所谓的智商稳定性能有多大说服力?第二条路意味着遗传决定论的边界被大幅收缩——即便g因子确实存在,它的表现也严重依赖于环境的配置,那么“基因决定了上限”这种粗浅陈述就失去了政策推论的基础。

弗林本人不是激进的环境论者。他不认为遗传因素为零,也不认为智商测试毫无价值。

他的判断更接近这样:智商测试确实测量到了一些真实的认知能力,但这些能力不是固定不变的天赋,而是社会发展和个人经验共同塑造的后天表现。弗林更像我刚才开头说的那种姿态——他本来是为了解答种族和智商差距的问题进入这个领域的,结果发现整个智商大厦背后的地基在晃动。他曾经在一次访谈里说,他从未预料到弗林效应会成为这么大一个研究领域。他最初以为只是发现了一个微不足道的统计偏差,等他深入数据之后才发现,偏差本身就是故事的全貌。

弗林效应从1980年代起被反复验证,涉及三十多个国家,时间跨度从二十年到一个世纪不等。研究者在每一个能收集到跨年代标准化数据的国家都发现了分数上升,只是幅度和分测验分布有所不同。肯尼亚农村儿童在1980年代到1990年代的瑞文推理测验上表现出强烈的代际增长,城市儿童的增长幅度更大。多米尼加、沙特阿拉伯、苏丹、土耳其,也都在各自的样本中确认了类似趋势。

西欧和北欧国家的上升曲线总体比较平缓,但在二战后经济快速增长的十几年里也出现过斜率明显加大的区间。这些跨国数据汇聚出一个结论:智商分数的代际上升是一个真实且普遍的全球现象,不是某个国家教育体系或测试制度的特例。

那问题就更尖锐了。如果全世界的人都在变聪明,为什么我们没有集体感觉到自己比祖父辈聪明很多?为什么一个1970年代的普通中学生如果穿越回1930年代可以在智商测试中排进前百分之十五,但这不妨碍我们仍然觉得祖辈们做事也很有章法?

弗林自己对这个疑问有一个非常精辟的回答。他说,智商测试测的不是“智慧”,不是经验判断,不是洞察力,而是一些特定类型的抽象问题解决能力。这些东西在现代社会确实变得更普遍了,但这不等于人们在所有认知领域都实现了同等提升。你可能很擅长在一堆几何图形里找出规则,但未必比你祖母更懂得怎么用有限的食材喂饱一家人。你可能做阅读理解很快,但未必比一个没上过几年学的老工匠在观察具体现象时更敏锐。

弗林效应告诉我们的是,人类认知的某些维度在工业化、城市化和教育扩张的推动下发生了显著变化。它没有说人类整体上变得更优越,更没说这一代人比上一代人更“高级”。智商测试的题目恰好捕捉到的就是那部分在变的能力。

现在可以拉回我们这本书的主线上了。本书的核心概念之一,“命运技术”——指的是这样一种社会技术装置:它把人的复杂潜能化约为一个单一的数字标签,并以此为依据来分配生命机会。智商测试是命运技术在二十世纪的典范。

它把人的认知、学习、理解和创造这些宽泛得像大海一样的东西,提炼成一个三位数(或者两位数)的分数,然后把这个分数用作分班、升学、入伍、就业乃至法庭裁决的依据。这套装置的运行前提是:它测量的东西是稳定的,至少在个体身上是基本不变的天赋。一个人六岁测出来的智商跟他十六岁、二十六岁应该高度相关。一个人出生时社会阶层赋予他的分数差距,必须在统计上可以被解释成天赋的自然差异,而不是环境的后天压迫。

不然,这套装置就失去了合法性——你不能用环境制造出来的差异反过来证明环境的合理性。弗林效应从装置内部打开了一个无法修复的裂缝。

它没有宣布智商测试是废物,但它说了比这更麻烦的话:测试本身没什么错,错的是你对分数的解释。如果你把一个孩子的智商分数当成他终生的能力上限,你就犯了一个根本性的归因错误,因为同样的分数在三十年后可能意味着完全不同的实际认知表现。1970年代一个在一百分上下的普通孩子,他的抽象推理原始得分,放到1930年代的样本里是远远高出平均的。如果1930年代的教育系统按照那时候的常模把他分流进了慢班,这套操作在技术上完全合规——因为他的智商分数确实在同龄人中偏低——但这套合规的技术产生了一个荒谬的实际后果:把一个按照后代标准很普通甚至正常的孩子,错判成了认知不足。

这里就可以清楚地看到“量化分类”这个概念在弗林效应之下的悖论。量化分类是把连续的认知能力分布切割成离散类别——天才、正常、低能——以进行社会分配的过程。

这套分类需要稳定的切割标准,否则今天的天才可能变成明天的正常,明天的正常可能变成后天的低能,整个分配体系就会陷入混乱。

测试编制者通过定期更新常模来应对这个压力。每一次重新标准化,新样本的原始分数都比旧样本高一截,所以同一个原始分数对应着越来越低的智商标准分。1932年一个9岁孩子在斯坦福-比奈上答对足够多题目换来一个120分的智商,放到1972年的换算表里,同样的原始得分可能只值105分甚至更少。这意味着智商分数的社会意义在持续贬值,同一个孩子的同一份答卷,在不同年代读出来是完全不同的命运标签。

读者可能会问:既然分数这么不稳定,为什么测试机构不干脆抛弃智商这个概念,直接报告原始得分和能力描述?答案是,这样做就违背了命运技术的基本操作原则。命运技术必须提供一个让人感到“自然”且不可协商的数字——排名、分数、综合评分、评级——以便管理者、教师、法官和招生官可以不做复杂的人际判断,直接按照数字做出决策。

智商的一百分是一个很容易理解的锚点:它就是平均,低于七十是弱智,高于一百三十是天才。任何人拿到一张智商报告,立刻就知道自己在人群中的定位。原始得分不具有这种效果——你告诉我你答对了四十三道题,我没法立刻知道这意味着什么。它还需要对照常模、对照年龄组、对照教育背景,这就太复杂了,复杂到不能稳定地进行批量分类。智商分数的通俗性,恰恰是它作为命运技术最核心的竞争力。

弗林效应在专业心理学界引发的冲击没有传导到大众认知层。这是一个非常关键的现象。1984年弗林发表第一篇论文,1987年第二篇,1994年《钟形曲线》出版时赫恩斯坦和默里甚至用了几页纸专门讨论弗林效应,承认它存在但坚持认为它不削弱g因子的预测效度。

同一年,美国心理学会成立了专门委员会,对智商研究进行全面评估,1996年发布的报告明确承认了弗林效应的真实性,认为环境因素在其中起了重要作用。

学界内部对弗林效应的争论不是“有没有”,而是“为什么”——所有严肃研究者都接受分数在代际间上升这个基本事实。

象牙塔的这一段历史讲完了,接下来是大众文化层面的故事,而这个故事几乎是一面空墙。1990年代的美国,不管你翻开任何一份报纸的教育版,看到任何一本育儿杂志,或者走进任何一间学校的家长会,智商分数仍然是判断一个孩子前途的硬通货。资优班筛选仍然看重智力测验成绩,SAT本质上仍然是智商测试的后代,人事招聘中使用的认知能力测验仍然在换算等效的智商分数。成千上万的美国父母仍然带着孩子去找心理学家做智商测试,拿到分数后焦虑或欣喜——跟1920年代的推孟时代如出一辙。

更让人惊讶的是,到了1990年代,这个信仰不仅没有消退,反而蔓延到了新的领域。智商开始被用来比较整个国家的水平。弗林效应证明了智商分数是社会条件的产物,但这个证明一点都没能阻止人们转而用国家平均智商来解释国家命运。

1990年代开始出现了一批研究者,他们把各国已有的智商测试数据汇总平均,再把平均分数与国民生产总值、经济增长率、民主制度指数、腐败程度挂勾,画出了“世界智商地图”。这张图告诉你,北欧国家平均智商最高,撒哈拉以南非洲最低,然后得出结论说,国家的富裕程度很大程度上是由人口的平均智力决定的。

这套论证是詹森—赫恩斯坦个人遗传论的放大版,只不过继承它的不是黑白智商差距,而是南北发展差距。理查德·林恩和他的合作者塔图·万哈宁在2000年代出版了两本影响极大的书,一本叫《智商与国富论》,另一本叫《智商与全球不平等》,把国民平均智商和经济竞争力直接挂钩。这些书的结论被许多极右翼媒体引用,但也被联合国和主流发展经济学界严厉批评——批评者指出,林恩使用的部分数据来自极小规模的非标准化样本,小儿麻痹后遗症地区的数据被简单平均成国家分数,而完全忽视了殖民历史、国际分工和不平等贸易体系这些结构性因素。弗林本人对这条国家智商路线极度反感。

他在2007年出版的《什么是智力?》里,花了整整一章反驳林恩的方法论。他指出,贫穷国家的低智商分数,本身可能完全就是该效应在落后社会阶段的体现——今天的低分国家放在更早的时间点看,未必低于当时的发达国家。也就是说,弗林效应蕴含了一个动态追赶的可能,而国家智商论者把它偷换成了静态的种族宿命。这是一个核心的理论赌局:究竟是人的潜力被环境限制,所以分数低,还是反过来,分数低证明了人的潜力低?

校对一下本章的进度。我们讲了弗林怎么在1980年代闯进了智商研究,怎么发现代际分数上升的规律,怎么给出了社会工业化解释。我们也讲了这个发现在认知心理学和遗传决定论之间制造的麻烦,讲了专业学界承认它而大众信仰无视它的断裂。我们也触及了弗林效应在未来几年即将引发的一个更激烈的矛盾——既然一国之内可以因为社会条件改善而大幅度提高均分,那就意味着一个国家的平均智商分数不是固定禀赋,而是可以改变的社会指标。

这个结论如果成立,那么拿当前的平均分数来预测国家前途,要么是一种幼稚的经验主义,要么就是故意的意识形态操作。

但弗林效应本身也留下了一个尚未闭合的尾巴。如果分数还在一代一代上升,那这个趋势什么时候会停下来?北欧一些国家在1990年代的数据已经显示出增速放缓的迹象,挪威和丹麦的军队测试分数出现了平台乃至轻微下滑。有人把这叫做反弗林效应。弗林自己在晚年的回应是,上升不会永远持续,因为社会认知环境不可能永远以同一速度变得更复杂。当大部分人已经习惯了抽象推理的日常使用之后,附加的认知需求就会减弱,分数的代际增长就会钝化。但这个钝化本身反过来更加强了他的核心论点:智商分数的变化,一直都在追踪着社会环境的变迁。它从来不是一个超越历史的固定天赋的读数。

弗林效应未能撼动智商信仰。应然是:逻辑和证据都证明智商分数是个弹性的、受环境强烈影响的指标,不该被用作天赋的终生判决。

实然是:教育系统仍然把智力测验分数当作分流的依据,家长仍然被“孩子的智商是多少”这个问题捆绑,人事测评行业仍然兜售着品牌不同但实质不变的各种认知能力测验。科学反证和公众执念之间的共存在这里是如此牢固,以至于很多心理学家干脆放弃了做科普,弗林自己在这一点上也很清醒。他在一次采访里说,人们需要简单的故事,而智商数字就是一个极其简单的故事。你说这孩子智力超常,大家就对他有期待;你说这国家平均智商低,大家就有地图炮的依据。

复杂的故事不方便,弗林效应太不方便。1979年加州法庭宣布智商测试不能用来把黑人孩子丢进智障班,用的是一个权利逻辑——种族平等的宪法原则不该被可疑的测量工具打败。弗林效应提供的是另一个逻辑——你测量的那个东西自己就在变,你没法把它固定成任何一个个体的终生答案。法庭扳倒了智商量表在法律上不可审查的地位,弗林效应从经验层面拆掉了量表所声称的稳定性地基。这两个逻辑在1980年代汇合在一起,本该对智商信仰形成夹击。

事实是,它们确实各打了一个漂亮仗,打赢了各自的阵地,但战争没有结束。智商测试的编制者改进了题目,调整了常模,加入了对文化偏见的审查程序,继续把测试卖向全球。分类机器换了一副更精致的模具,继续运转。

最后一件事。弗林在2012年出了一本书叫《我们真的在变聪明吗?》,写到最后一页时他已经七十八岁。他在那本书的末尾说,他这一生最满意的工作不是解决了某个问题,而是证明了之前的答案都不够好。智商测试给出的数字不是废话,但把这个数字等同于人的价值,才是真正的废话。

这就是变聪明的悖论。你真的比你的曾祖辈在解几何拼图时快了几秒,但你未必比他们更清醒地知道自己是什么,该往哪里去。而那个三位数的标签,还在继续印制,继续贴在新生儿、学童、求职者和整个国家的脑门上,安静地做着自己的旧营生。