第 25 章

基因的幽灵

柏林街头,一个穿旧军装的人站在二十一世纪的广场上。路人围上去。有人举起手机,有人要求合影,有人笑着搭话。没有谁真的害怕。就在上一章结尾,我们还在说那把悬在国家头上的尺子如何一次次挥动、改写一国的课程表,而此刻,柏林广场上这个被围观的人,仿佛正是从那些被测量、被标价、被写进国际组织下一年报告里的“智力资本”反面走出来——他不被任何排名定义,却成了另一种被观看的“客观事实”。

这是2015年德国电影《希特勒回来了》里的一幕,片子改编自2012年的同名小说,奥立佛·麦苏希演那个从旧历史裂缝里醒来的希特勒。电影里,他学电视,学网络,用脱口秀重新进入公共生活。人们先笑,后来觉得他说得有点道理。这不像智力问题,但很快你就会觉得像了。

让我们把两样东西并排摆在桌上。左边一支唾液管,二十一世纪的基因天赋检测。商家说,刮一点口腔黏膜,就能看出孩子的数学天赋、运动潜能、将来能读哪类大学。右边一张泛黄的纸笔量表,二十世纪初的斯坦福-比奈智力测验。旧档案里躺着分数、百分位、智力年龄,旁边一行小字:供分班参考。

隔着一百年,它们干的是同一件事:把一个复杂的人,换成一个可以比较的数字,然后告诉他,你值多少。

问题来了。这一百年里,科学到底往前走多远?上一章结尾那个悬而未决的问题——智力资本真能像石油一样挖出来称重标价吗——在这里换了个问法,但指向同一个核心:我们到底有没有找到那把更准的尺子?

是从纸笔变成了唾液,还是从一种粗疏的命运技术,换成了另一种更精细的命运技术?前几年,人们还在为国际教育排名改动课程,为一个国家平均分数落后于另一个国家而焦虑。道理很好懂:尺子在前,谁都不愿被量短。可是从来很少人追着问,尺子上的刻度最初怎么刻上去的,如今又被换成了什么材料。

就在这个追问还没落地的时候,另一群人已经蹲在实验室里,要给尺子找一个生物底座。时间不靠我们喊停。2005年前后,人类基因组计划完成不久,测序设备在降价,样本库在扩大,计算方法在升级。一批遗传学家心里憋着一个老问题:智力的分子基础到底在哪里?

这个老问题不是新冒出来的。十九世纪的颅相学家摸过头骨,二十世纪初的优生学家填过家系表。到了二十世纪后半叶,行为遗传学家拿出另一套办法:双生子研究。他们比较同卵双胞胎和异卵双胞胎的相似程度,借统计模型反推遗传占了多少、环境占了多少。这套办法用了半个世纪,贡献不算小,毛病却也不小。它看不见具体的基因。

它只能告诉你,遗传似乎起了作用,却交不出任何一个基因的名字。批评者说得更损:这就像隔着门听人打牌。你知道里头在赌,声音时高时低,可你始终不知道谁手里是什么牌。

人类基因组计划完成之后,事情看起来要变了。研究者手里第一次有了一张完整的人类基因地图。有人就想:地图都有了,上面总该标着几个写“聪明”二字的坐标吧?

于是,一批研究者开始动手。他们不再依赖双生子那种间接推断。他们直接扫描几十万人的脱氧核糖核酸,一次看几十万个单核苷酸多态性。

这个术语太长,我们换个说法。把基因组想成一部用四个字母写成长篇小说。人和人的区别,常常只是某些位置上的字母不同。这里换一个字母,身高差一点;那里换一个字母,眼睛颜色变一点;有的位置换了,某种病的风险高一点。研究者想知道,究竟哪几个字母变了,智力测验的分数会跟着变。

这个思路看起来干净。技术有了,样本也有了。唾液管、采血管一批批送进实验室。样本量从几千到几万,再到几十万。基因芯片扫一次,数据流进统计流水线。

一次看几十万个位点,跑出来的不是一句结论,而是一张密密麻麻的表。结果让动手的人自己都吃了一惊。找到的不是几个,也不是几十个,是成百上千个。更多研究一做,这个数字还在往上翻。可没有一个位点能单独解释智力测验分数差异的百分之一。绝大多数位点的效应量,小到千分之一量级。

千分之一是什么概念?一场满分一百的考试,某个位点换成另一个字母,能解释的差距只有零点一分左右。老师批卷时手抖一下,都不止这个数。更关键的是,这些位点加在一起,也解释不了全部差异。早期研究里,成百上千个微效位点合计,对智力测验分数差异的解释力只有百分之二三。后来样本越来越大,这个数字往上走了些,百分之五、百分之十,有的报告更高。可离“基因决定智力”,还差着很远。

这个发现本该给基因决定论泼一盆冷水。它第一次在分子层面说明,智力的遗传结构不是开关,不是几颗命运按钮。它更像是无数细弱信号,跟环境、教育、营养、文化、测试本身复杂地交织在一起。

严格讲,你找不到一条从碱基直通“天生聪明”的直线。可问题恰恰出在这里。科学结论走进公共传播的通道,就变了形。报纸标题写着:科学家发现智力基因。网络文章跟进:聪明是天生的?基因告诉你。家长群里转发一张截图,几条曲线,几个术语,看起来权威得很。

没有人会去读那些小数点和置信区间。他们看见的只有“基因”和“智力”并排出现。而只要这两个词并排出现,许多人脑子里浮现的还是那部旧脚本:生来如此,改不了。一个设计出来瓦解简单决定论的工具,反过来成了简单决定论的新证据。

这正是二十一世纪初智商话语遭遇的一场内部裂变。行为遗传学重新激活了“天生智力”的古老命题,只不过这一次,它披上了全基因组关联分析的科学外衣。外衣是真的,技术是真的,数据和计算也是真的。可这一层层真的东西裹在一起,最后产生出来的公共认知,却是假的。

为什么?有人会问,科学已经精细到成百上千个位点了,为什么公众理解反而更粗糙?这个板子不能只打在媒体标题上,也不能只怪读者没耐心读论文。

事情比这深。先看科学产业自身的结构。基因研究的产出是论文。论文要发表,发表要引用,引用要影响因子。一篇谨慎报告“几百个微效位点”的论文,和一篇被放大成“找到智力基因”的新闻稿,哪个飞得快?当然是后者。但把责任全推给新闻编辑也不公平。

科学界自己还造了一个新词,叫多基因评分。这个名字听起来很厉害,道理也简单。既然单个位点效应那么弱,那就把成百上千个微效位点的效应加总起来,给每个人算出一个总分。这个总分再去跟教育年限、学业成就、收入水平做相关。于是新工具出现了:一个从基因组算出来的数字,能被拿去预测。

预测指标用多了,就会成为筛选指标。筛选指标用顺手了,就会成为政策参考。这个链条并不需要哪个坏人半夜开会策划。它需要的只是每一步都有人觉得合理。

再看制度安排。到了二十一世纪,教育系统已经高度依赖可测量能力。学校要分班,大学要招生,教育部门要评估投入产出。

一百年前,斯坦福-比奈量表进入美国学校,校方要的是便宜、快、看起来客观的工具,用来管理大量涌入的移民子女。一百年后,学校还是这个需求。纸笔量表便宜、快、看起来客观,可它的合法性越来越弱,法律上、政治上、文化上都有争议。

这个时候,一个更新、更“科学”的工具出现,制度会不会心动?会。因为制度从来不是在寻找终极真理。它在寻找能解决眼前问题的工具。

最后看关键主体的选择。家长为什么买天赋基因检测?未必真信一口唾液能看透孩子。很多人半信半疑。可选择的压力摆在那里。别人都测了,我不测,会不会耽误孩子?报告说孩子数学潜能高,是不是该给他报个奥数班?报告说语言潜能低,是不是该放弃第二外语?公司只需要给出一份漂亮报告,剩下的事,家长自己会做完。

这个结构并不新鲜。二十世纪初,心理学家特曼拿着斯坦福-比奈量表,追踪加利福尼亚的天才儿童。他相信这些孩子是美国未来的精英。他为什么要追踪?因为他想给天才一个科学定义,再用这个定义去发现人才、培养人才。

今天的基因天赋检测广告,几乎是同一套话术:发现孩子天赋,因材施教。差别只在工具。那时是纸笔量表,现在是基因芯片。逻辑没变:先量化分类,再分配机会。

量化分类,这个词值得再停一下。人的能力分布本来是一条连续的长带,没有天然的裂缝。但制度要分配资源,就得在这条带上划几刀,分成天才、正常、低能,或者数学型、语言型、运动型。这一刀怎么划,从来不只是科学问题。它关系到谁进好班,谁拿资源,谁被允许往前走。

基因研究进来之后,划线方式变了。它像是给每一个类别找了个分子基础:数学潜能对应一组位点,语言潜能对应另一组,运动潜能对应第三组。分类于是看起来更硬了。可如果你去问做研究的遗传学家,他们会说:多基因评分只能解释很小一部分个体差异,还受人口分层、教育条件、测试方法影响。用它去判断一个人适合做什么,远不够格。

有意思的是,科学上的“不够格”,在商业上并不构成障碍。公司不要多基因评分完全准确。它只要让家长觉得“比没有强”。

报告做得专业一点,术语多放几个,结尾再给出几条建议,产品就有市场。这正是命运技术的新版本。

命运技术,这本书一直在追踪的东西,指的是这样一种社会技术装置:它把人的复杂潜能压缩成唯一的数字标签,再以这个标签为依据来分配生命机会。二十世纪,这个装置叫智商测试。二十一世纪,它慢慢换成了基因评分。技术变了,社会功能没变。

如果基因评分只留在商业货架上,那还不算最要紧。可它往更严肃的领域走了一步。2018年,一篇基于英国生物银行数据的论文引发震荡。英国生物银行是一个大规模生物医学数据库,存着数十万人的基因数据、健康记录和社会经济信息。研究者用这些数据计算多基因评分,再与参与者的学业成就做相关。结论是:多基因评分预测学业成就的准确率,已经接近传统智商测试。

请把这句话放在脑子里再读一遍。不是超过,是接近。一口唾液算出来的分,和一张纸笔考出来的智力分,在预测学业表现这件事上,已经能一较高下。

教育政策圈里立刻有了声音。有人问:既然基因评分这么准,还投钱缩小教育差距干什么?

有人问:为什么不用基因评分替代智商测试?也有人问:那些评分低的孩子,学校该怎么对待?

这些问题各不相同,但后面有一个共同倾向——把基因评分当成命运读数。一个数字一旦被当成命运读数,就不再只是描述过去,而是开始分配将来。它会影响老师对孩子的期待,影响家长对孩子的判断,影响政策制定者对学校、社区的算账方式。

这个过程不会突然发生。它像水渗进墙。先是一些研究用多基因评分做教育预测,再是一些政策报告引用这些研究,再是一些学校试点个性化教育,再是一些公司推出定制学习方案。每一步都显得很小、很合理。可每一步都在把基因读数往命运技术的位置上推。

这里必须停一下,认真回应一个反对意见。有人说,智商测试虽然在历史上有过滥用,但它核心测量的是真实且稳定的认知能力,也就是所谓g因子。这个g因子对个体和群体差异具有预测效度,所以智商测试被广泛采用,是理性选择,不是盲目信条。这个说法有它硬的地方。g因子不是空中楼阁。

二十世纪初,英国心理学家斯皮尔曼就注意到,不同认知任务之间的成绩存在正相关,统计上可以抽出一个共同因子。它也确实能预测学业、职业和健康等多种结果。我们不能因为历史上有滥用,就说这东西完全不存在。那既不诚实,也无助于理解问题。

但请注意这个推理里的跳跃。g因子存在,不代表它就该被当成命运读数。预测效度存在,不代表它就能决定个人机会结构。这是两回事。

一个工具能预测,可能不是因为它揭示了一个内在固定的本质,而是因为它与现有社会安排同构。说得直白一点:智商测试能预测学业成就,部分因为学校本来就奖励和培养与测试类似的能力。它能预测职业成就,部分因为职业筛选本来就把学历和认知测试放在重要位置。它能预测收入,部分因为社会已经按照这些能力分配资源。预测效度的一半秘密,不在基因里,也不在g因子里,而在制度安排里。把制度安排造成的稳定差异,简单归结为能力本身的稳定差异,是倒因为果。那么多基因评分接近智商测试的预测准确率,到底说明什么?

基因的幽灵之所以赶不走,不是因为它的科学证据突然变硬,而是因为它学会了绕过旧争论。它不再像一百年前那样宣布谁的头骨更大,也不像冷战时期那样在测验手册里写满种族曲线。

它改从一部旧电影里学会一件事:真正持久的归来,不必推翻现场,只需走进直播间,顺着现有的镜头和笑声,把自己变成节目的一部分。《希特勒回来了》里的那个人没有炸掉电视台。他学会看提词器,聊移民、就业和民族自尊。人们先笑,后来觉得他说得有点道理。

基因话语在二十一世纪也走了一条相似的路。它没有重新推崇优生学。它进了手机推送,进了早教机构的宣传页,进了教育政策的论证材料。它还是旧脚本,但这次披着“个性化”的外衣。旧式种族主义者退场了,新式基因话语以“天赋检测”“因材施教”的名义进入消费市场。谁能反对发现孩子的潜能呢?可“发现”的工具本身,已经决定了“潜能”长什么样。

要理解这次回归,得回到早一步。2005年前后,人类基因组计划刚刚把一张基因序列的地图铺开。第一次兴奋过去之后,研究者并没有马上读懂这张地图。他们先做的是翻字典:翻到几个最可能出现的词。这叫候选基因研究。有人看神经递质系统,有人看神经发育相关蛋白,有人看脑内信号传导。他们希望在这些地方找到一两个“聪明基因”。结果几乎全是坏消息。小样本里偶尔冒出的显著结果,一换另一批人、另一个测验,就消失不见。重复失败十次后,学术界开始怀疑这条路。智力的遗传基础如果真由少数几个基因主导,不可能这么难抓。必须换个思路。显微镜于是转向全基因组。

这一转带来了一个研究者没预料的组织后果。全基因组关联分析需要的样本量,超过任何实验室能独自招募的规模。一个研究生跑几年,能收几百人已算好成绩。可要抓千分之一量级的效应,几百人的统计效力像用一把米去称一艘船。唯一办法是合并。合并队列,合并数据库,合并资金。研究者从实验室的工匠变成巨型协作网络里的施工员。

这个处境很少写进论文,却塑造了后来一切。为把几十个队列的数据统一起来,他们必须约定同一套质量筛选标准、祖先校正方法和智力测量口径。每个国家测试不同,有的用韦克斯勒,有的用瑞文,有的只是学校成绩。只能折合成标准化分数。标准化看起来技术中立,却给误读埋线。分数越抽象,离具体的人越远;越抽象,越容易被当成真东西。

这些大型数据库里,英国生物银行最有象征意义。它不是为某个智力项目临时搭建的。它是制度机器:数十万成年人留下血液、唾液,同意把医疗记录交给科研使用。英国国民健康系统给它一条通向住院记录和保健数据的管道。公益资金为它长期输血。没有这些制度条件,就没有后来几十万人的分析。

但它也有自己的偏好:参与者平均年龄不小,几乎全是欧洲血统,自愿参加者通常比人口平均更健康。这些偏差不会出现在新闻标题里。后来用多基因评分预测学业成就时,有人问:换到其他人群身上还准吗?答案很扫兴:常常打折。

多基因评分不是天然标尺。它取决于你用什么样本定刻度。可到了公共传播里,这些限制被简化成一句:基因能预测你的孩子。甚至更糟,基因能解释你的孩子为什么不行。

商业产品是简化最彻底的地方。你无须理解什么是单核苷酸多态性,也无须知道效应量怎么算。广告只说:把拭子在孩子嘴里刮几下,寄回实验室,几周后拿到彩色报告。报告上画着柱状图、雷达图,写着“逻辑推理”“语言记忆”“耐力”。

一项能力旁一个百分比,像体检时的骨密度参考值。家长深夜下单时可能没有全信。但报告给了他们一个此前没有的东西:一个看似客观的比较点。孩子同学在学奥数,你在犹豫;孩子作文写不好,你在自责。报告说数学潜能排名较好,奥数班报了;说语言潜能一般,第二外语停了。

没有专家在旁提醒,这个百分位来自与孩子成长环境可能完全不同的人,且单个位点的预测力只有千分之一量级。公司不需要说假话。它只需要把真的部分裁下来,贴在旧脚本上。旧脚本说,人的未来写在身体里。新报告说,现在能读出来了。

学校系统同样不是被动接受。特殊教育要分类,资优班要筛选。纸笔智商测试在这个系统里运行近一个世纪,法律和道德成本越来越高。

这时候一个基因领域的新数字出现,会怎样?它不会马上取代笔试,但会先成为补充材料。老师多一项发育档案,家长多一张图,教育公司多一个卖点。

研究里也多一种变量:有人拿多基因评分控制“先天能力”,再去估计学校的作用。意图可能很好:把基因差异控制住,看教育还能不能起效。但这一步已经先把基因差异当成需要控制的“真实底数”。一旦成为底数,后续判断都会绕着它转。

政策制定者最想知道的不是基因决定多少,而是这一分能否换算成预算。如果能,为什么不把资源给评分高的?如果资源给了评分低的,又能追回多少?这些问题听起来是技术问题,其实已把社会不平等改写为生物账本。

这账本上的数字,最好冷着看。找到的相关位点不是一两个,而是成百上千;每个单独拿出来,能解释的智力测验差异通常在百分之一以下,很多时候只有千分之一量级。把它们加总而成的多基因评分,对学业成就的解释力早期只有百分之二三,后来样本扩大,上升到一成乃至更高,但距离传统智商测试仍差着不小一段。人们说“接近”,多少带着兴奋劲。

可把这个“接近”嵌进现实,它意味着同一个孩子换一个样本定刻度,评分可能上下浮动;换一个测试口径,位点权重会变;换一个社会条件,分数和结果的关联也会松动。真正稳定的只剩下一件事:人先被简化成数字,数字再被拿去做决定。基因的幽灵没有藏起来。它站在所有的数字后面。它并不要求你相信科学,只要求你不敢不信。

它说明基因研究在进步,说明遗传因素与学业成就之间确实存在统计联系。但它不说明学业成就是由基因决定的。它更可能说明,基因评分和智商测试捕捉到的是同一层与机会结构相关的信号。两把尺子量同一块布,量出来都是三尺。这既可能是两把尺子都很准,也可能是这块布本来就被同一套工艺裁剪过。当一个新工具与旧工具高度相关,我们不能急着说,新工具独立测到了某种深层本质。

该用冷一点的方式收束一下了。全基因组关联分析找到的智商相关基因位点,不是几个,不是几十个,而是成百上千。每个位点的效应量微乎其微,单个解释不了百分之一的差异。多基因评分能解释的学业成就差异,早期只有几个百分点,后来有所上升,但离“看基因就知道孩子能不能考上大学”还差得远。

每一支唾液管寄出去之后,家长最想得到的那个答案,恰恰是目前给不了的。可这是科学上的答案。社会上流行的,是另一套。听说“智商与基因有关”,被唤醒的依然是“天生注定”四个字。基因的幽灵就是这样回来的。

它借着一份图表、一个评分、一条标题,重新站在我们面前。它不再说头骨,说碱基。不再说优生,说潜能。不再要求把人关起来,只要求你相信。

这个幽灵为什么赶不走?不是因为我们不知道答案。答案很清楚:智力是多基因、多环境、复杂交互的产物。教育可以改变智力表达,营养可以改变认知发展,收入差距可以改变测试分数。

可我们仍然愿意相信一个简单版本。因为简单版本能减轻选择的焦虑,能让一部分人不必感到亏欠,也能让另一部分人不必感到被制度辜负。它不科学。它管用。

基因研究还会向前走,位点会更多,样本会更大,预测力可能还会升一点。可在这些数字越来越多、越来越细、越来越像客观事实的时候,我们对“智力”的理解反而更单薄了。以前是一个分数,现在是一组位点。以前是一张纸,现在是一管血。以前是从天才到低能的一条线,现在是从高多基因评分到低多基因评分的一条线。线还在,只是换了一根更细的笔去划。

人们还不满足。他们想真正看见智力,看见它在大脑里的位置。这个欲望,是下一场科学探索与下一场误读的共同起点。