第 26 章
脑成像的承诺
一边是巴黎。一间小学教室里,一个孩子被扶上高凳。有人拿软尺绕过他的头,量周长;又换铜制卡尺,仔细量两耳之间的宽度。那是比奈和他的合作者在一百多年前做过的事。他们以为,智力这种东西也许可以从头颅的大小看出来。
另一边是伦敦。一所大学的地下室里,一台磁共振机器嗡嗡作响。一个成年人躺在圆环里,头上套着线圈,屏幕上一点点显出灰白色的脑图像。研究者盯着显示器,想从褶皱的脑皮层里找出一块发亮的区域。
时间隔了一个多世纪,场景从木尺换成了磁共振,但问题惊人地相似:聪明到底藏在哪儿?我们能不能把它看见?
这两个场景并排放在一起,不是为了嘲笑前人的天真,也不是为了贬低今天的仪器。我想请各位先感受一下,这两个动作里藏着同一种顽固的期待。比奈量头围的时候,心里想的是:如果智力有高低,那它一定会在身体上留下痕迹。今天的研究者盯着脑图像时,心里想的其实还是同一句话。工具变精密了,欲望没有变。各位要问了,量头围和扫大脑,能是一回事吗?
一个是江湖术士般的粗糙手段,一个是现代科学的精密仪器,怎么能放在一起比?别急。
先看一个具体的事件。2007年,一篇论文发表在《自然》杂志上。研究者声称,通过分析大脑皮层的厚度分布,可以预测一个人的智商分数,准确率相当可观。他们扫描了一批健康成年人,把脑图像和个人智力测验的成绩放在一起比较,发现某些区域的皮层厚度和智商分数之间有稳定的对应关系。报道很快传开。媒体干脆省去限定语,标题写成“科学家发现智力中枢”“智力写在脑子里”。配图是一张彩色的大脑图,某个区域在解题时亮起来。读者一眼看去,仿佛一个多世纪以来关于智力的所有迷雾都被这台机器照亮了。
这里要停一下。为什么一张彩色脑图会有那么大的说服力?因为图像和数字的语法不同。一个智商分数,比如一百零七或者九十二,它是抽象的,你需要读懂量表、知道常模、理解标准差,才会明白它意味着什么。而一张脑图不一样。它看起来像一张照片,指向一个实体。额叶红了一块,顶叶蓝了一块,人们就觉得看见了智力本身。
它不是让你理解,而是让你观看。观看不需要训练,只需要眼睛。这正是脑成像比智商测试更有修辞力量的地方:它把心理测量变成了肉眼可见的“肉体证据”。
这个说法非常诱人。因为它符合我们最深的期待:智力应该有一个看得见摸得着的物理位置。如果它能被扫描出来,那就不再只是一个心理学的假设,不再只是一张量表上的数字。它成了一件东西,一件可以指给人看的东西。
可是问题恰恰出在这里。先说说这项技术为什么会在那个时间点爆发。2000年以后,功能性磁共振成像逐渐普及。机器的价格虽然还很高,但已经不是只有少数尖端实验室才用得起。扫描速度加快,数据分析软件也越来越容易上手。一个原本用于临床诊断的工具,开始大规模进入心理学和认知神经科学实验室。在临床里,医生用它来定位病灶,检查病人大脑受伤之后哪些功能区还活着。但研究者很快发现,它可以用来观察正常人的认知活动。一个人在做记忆任务时,脑里哪些区域耗氧增加;在调动注意时,又是哪些网络在活动。
于是记忆、注意、情绪、语言,一项一项被装进扫描仪。智力当然也不会被放过。方法看起来顺理成章:让人做智力测验,同时扫描他的大脑,看哪个区域在活动。哪个区域的活动强度跟分数相关,就宣称找到了智力的神经基础。逻辑上似乎无懈可击。
看起来顺理成章的方法,往往藏着最深的假设。这个假设就是:智商测验已经替我们界定了什么是智力。
但这里面有一个很容易被忽略的循环。研究者先用智商测试来定义智力。
这句话很关键。智力的标准是什么呢?在大多数这类研究里,就是韦氏成人智力量表的分数,或者瑞文推理测验的分数,或者其他某套已经存在的智商量表。研究者把这个分数当作“智力”本身,然后去大脑里找它的对应物。找到某个区域的皮层厚度或者神经活动跟这个分数相关,就宣布找到了智力的生物学证据。可这到底证明了什么?这只证明了,那个区域的某些特性和某个特定测验的得分有关系。它并没有证明这个测验真正测量了“智力”,也没有证明那个区域是“智力”的所在。
它不过是把原本写在试卷上的分数,投射到了一张脑图上。用个比喻来说,这就像先画一个靶子,再射箭,然后宣布箭射中了靶心。靶子是你自己画的,箭是你自己射的,最后还要用这个结果来说明靶子画得对。脑成像研究干的事情,在很多时候就是这样。它没有给智商测试提供独立的生物学验证,它只是用更昂贵的设备,把智商测试的逻辑重新演了一遍。
有人会反驳:智商分数确实有预测作用。它能预测学业成绩,能预测某些职业表现,甚至和健康、寿命有些关联。既然如此,它就不可能只是虚构。
说得对。我没有说智商分数是虚构。它确实抓住了人的某些稳定差异。这个事实需要正面回答。
智商测试的得分不是随便填的,它在统计上和心理测量学上都有相当扎实的基础。一个孩子得到高分,他在学校里表现好的概率确实更大。这一点不能否认。
这个反方的意见必须认真对待。如果我们只是一味批判智商测试,却无视它在现实世界中的预测作用,那就成了架空批评。智商分数不是假的。
它测量了一些真实存在的东西——至少是在现代社会中会被奖励的那些认知习惯。正因为如此,这个制度才那么难以动摇。你不能对一个确实能预测学业成绩的工具说它毫无意义。
一个工具越有用,它就越容易被误当成对“人的本质”的完整描述。可正因为智商分数有预测效度,脑成像的循环论证才更值得警惕。因为它让一个本来有限的、特定文化背景下形成的测量工具,看起来像是一个自然事实。当人们说“看,智力就在这里”的时候,他们指的不是那个孩子怎么理解问题、怎么应对新情况、怎么在真实生活里做出判断,而是那个孩子在一套标准化试题上的得分。脑成像没有超越这套试题,它只是把这套试题的分数搬进了颅骨。原本“测量”出来的成绩,一下子变成了“发现”出来的自然物。
那2007年的那篇论文后来怎么样了?后续研究很快暴露出问题。不同实验室用不同方法分析同一类数据,得出的结果互相矛盾。有的研究说额叶皮层厚度和智商相关,有的说顶叶更重要,有的说关键在海马旁回。
同一批数据,换个统计参数,结果就变了。更麻烦的是,当研究者把在一个样本里找到的预测模型拿到另一个样本去验证时,准确率大幅缩水。原来可观的预测力,一换人群,就变得很微弱。
这意味着那个最初被媒体报道的数字,很大程度上是过拟合的产物。什么叫过拟合?就是模型太贴合当前这批人,以至于到了新一批人身上就不灵了。研究者在不自觉地把噪声也当成了信号。比如,在几十个被试里找到几条脑区与分数的相关,换个样本就消失,这种现象在脑成像研究中相当常见。不是研究者在造假,而是分析方法给了他们太多自由度。
还有技术本身的限制。功能性磁共振成像记录的是血流变化,不是神经元的直接放电。它有时间上的延迟,有空间上的模糊。人躺在机器里,头稍微动一下,数据就会受影响。一次扫描产生几万个数据点,怎么从里面找出有意义的模式,全靠研究者事后选择分析策略。同一个数据集,用不同的软件流水线、不同的多重比较校正方法、不同的兴趣区界定,可以得出完全不同的结论。
这不是说每个研究都在造假。恰恰相反,绝大多数研究者非常认真地做分析。但这个领域里,分析的灵活性实在太大。
当每个人都诚实地选择自己认为合理的方法时,结果却可能互相对不上号。这说明问题不在个别人的品行,而在整个研究路径的根基。
如果同样一批数据可以同时支持“额叶决定智力”和“顶叶决定智力”两个结论,那问题就不是哪个实验室错了,而是“寻找智力中枢”这个提问方式本身就有缺陷。
更重要的一点是,脑成像研究意外地揭示出一个和“一般智力因素”假设不太合得来的图景。按照传统智商理论,存在一个贯穿各种认知任务的共同因素,通常叫一般智力因素。智商测试的理论基础就是,人的各种能力背后有一个共同的智力核心。可是脑成像研究发现,当我们做不同类别的认知任务时,大脑的活动模式并不集中在一个单一的“总机关”。完成记忆任务时,是一张网络在工作;完成推理任务时,是另一张网络在工作;处理速度、词汇、空间想象,各自调动的脑区组合都不同。
它们之间当然有重叠,但那个重叠并不像“一般智力因素”这个说法听起来那么单一、那么集中。大脑在执行不同认知任务时的活动模式,远比智商测试假设的那个单一因素复杂得多。一个简单的数字,怎么装得下这么多网络、这么多路径、这么多相互协作又相互替补的系统?脑成像技术越精密,它显示出来的画面就越不像那个被称作“智力”的单一体。
这是一个非常有意思的发现。它本应该促使人们反思智商测试的简化逻辑。既然脑中并不存在一个清晰的“智力中枢”,那我们为什么还要用一个数字来概括一个人全部的认知能力?既然不同任务调动不同网络,那我们为什么还相信一个单一的分数可以代表这个人的脑子?脑成像本身给出的答案,恰恰是拆穿智商神话的最佳材料。
但历史没有往这个方向走。媒体的报道重心放在“科学家发现了智力在大脑中的位置”上。政策层面也没有因此放松对智商测试的依赖,反而出现了更耐人寻味的现象:脑成像的“科学光环”被用来加固智商测试的权威。
法庭上开始出现脑部扫描作为智力残疾的证据。学校用“脑科学”包装传统的智商分班。脑图像被当成一种更硬、更无可辩驳的科学证物,仿佛只要把一张彩色脑图摆在桌上,关于某人智力水平的争议就可以一锤定音。
可那张图本身,并没有提供任何独立的生物学验证。它的预测力在实验室里都还站不稳,在法庭上却被当成铁证。法官、陪审团、教育官员,他们不是神经科学专家,也不需要是。他们看到的是“科学”两个字,是一张来自机器的图像,是一个听起来确定无比的结果。
在司法和教育决策中,这种确定感比科学本身的复杂性更有用。一条曲线、一片颜色、一个统计显著的星号,都可能进入决定别人命运的流程。
各位想一想,这是一个多深的讽刺。脑成像本来是一把可以撬动智商神话的杠杆,结果反而被用来给这个神话镀金。原因不复杂。社会对智商测试的需求太大,对“智力可以客观看见”这个想法的信念太强。当一种新技术出现,最有力的使用者往往不是想颠覆旧制度的人,而是想把旧制度说得更科学的人。
那些学校、法院、保险公司、教育科技公司,他们需要的不是脑成像研究里那些复杂的、不确定的、互相矛盾的结论,他们需要的是一张看起来无可辩驳的图。脑成像正好提供了这张图。于是命运技术又升级了。
以前,智力是通过一张试卷、一个面试、一套量表来测量的。那些方法不管有多少问题,至少还保留着把人作为整体来判断的余地。现在,脑成像给人一种错觉,以为智力的证据可以脱离人的语言、文化、教育背景,直接从肉体里提取出来。脑部扫描图被当成一幅不证自明的肖像,仿佛它可以绕过所有复杂的解释,直接告诉我们:这个人就是这样。
这就是量化分类的一个新阶段。过去,人们把连续的认知能力分布切割成“天才”“正常”“低能”等类别,靠的是分数。现在,人可以用一张图来显示这种分类,图上某个区域的颜色深浅成了比言语更硬的新证据。数字变成了图像,图像又回头来加固数字。这个循环越来越难打破。
这里要说明一下“量化分类”的意思。人的认知能力本来是一个连续分布,高低之间没有天然的断点。
但当社会需要决定谁能进特殊班、谁能免于刑罚、谁能获得保险赔付时,就必须在连续带上切出几刀。智商测试的分数线正是这样的刀。现在脑成像加入进来,等于给每一刀配了一张彩图。人们不再只说“你的分数低于七十”,而是指着一张图说“你看,你的脑子这里发育不够”。
后者听起来更科学,实际上更危险,因为它把社会划出的界限伪装成了自然界的断裂。
理解到这一层,我们就可以回答开头那个问题了:量头围和扫大脑,真的是一回事吗?从技术上说当然不是。一个是物理测量,一个是代谢成像,精度相差何止百倍。但从思想结构上说,它们有深刻的亲缘关系。比奈量头围,是因为他相信智力会在肉体上留下痕迹。今天扫大脑,是因为研究者同样相信,智力一定在大脑的某个地方,等着被看见。这个信念本身没有问题。问题在于,他们拿来做标准的“智力”是从哪里来的。比奈拿的是教师对儿童的判断,后来的人拿的是智商测试的分数。那个被寻找的东西,其实在一开始就已经被规定了。
把一张彩色统计图变成命运的证据,中间到底发生了什么?这里需要把镜头推近一点。
法庭上,律师把脑部扫描图投影在墙上,指着额叶外缘的一小块蓝色说,这是发育不足的区域。陪审团看到的是颜色,不是统计参数。他们不知道这张图用什么软件处理过,不知道选的是哪个阈值,也不知道这个区域和智商之间的相关在另一个样本里几乎消失。他们看到的是,机器拍了人的脑子,脑子上的颜色不一样,专家说那是缺陷。于是缺陷就成了事实。
法庭接受这类证据,不是因为它通过了重复验证,而是因为它符合一个更古老的标准:身体上的痕迹。指纹、伤口、X光片——这些身体证据在法庭上有天然说服力。
脑图恰好穿上了这件外衣。它看起来像X光片,像解剖图,像一张照片。可是它不是照片。它是统计推断的图形化。
它显示的并不是某个细胞、某条神经、某块组织,而是一堆数据经过平滑、对齐、阈值化之后留下的彩色斑点。把彩色斑点当伤口看,等于是把概率当成了部位。
教育系统比法庭更早学会这一套。一所学校要分层,最稳妥的说法仍然是智商测试。
但有的学校已经不再直接说“智力分班”。他们改叫“脑发育评估”,发给家长的报表里除了分数,还配一张脑图。图上某些区域被标红,某些被标蓝。
老师解释说,这是孩子的优势回路和待发展回路。家长听着像科学,其实那张图跟分层结果高度相关,因为它是用同一套测验做标准画出来的。脑图并不是独立的第二证据,它只是第一证据的视觉翻译。
可这个翻译一出现,家长就不好意思再质疑了。质疑一个数字,还可以说“一次考试不能代表孩子”;质疑一张脑图,就好像在质疑孩子的大脑本身。
学校用脑科学包装传统分班,不是把科学引进了学校,而是把学校的旧决定搬到了科学的招牌下。脑图在这里没有多做任何判断,它只是让已经做好的判断变得难以争辩。
福利和保险的窗口也出现了类似情形。申请认知障碍补助的人,光有心理测验报告还不够,办事员可能说“分数有主观性”。
如果再加一份脑扫描报告,说某区域灰质体积低于平均水平,材料就显得很硬。可是灰质体积和智商之间的关系,在跨样本验证中并不稳定。同一个申请人,在不同机构扫描,选不同测量方法,结论可能从“低于平均”变成“在正常范围”。
但窗口不会去比较这些。窗口要的是快速、可归档、看起来客观。一张彩色脑图比几十页量表更能让审批流程继续下去。
这个流程并不关心脑图是否能预测智力,它关心的是有没有一个可以写入档案的医学物证。于是本来属于实验室内部争论的测量误差,被制度性地下沉到每一个需要证明自己智力的人身上。
谁碰上那一年、那台机器、那个阈值,谁就被标成某种样子。这不是科学的失败,这是科学图像被剥离了不确定性之后,进入行政程序的必然结果。
机制在这里已经很清楚了。脑图不提供独立验证,却提供了一种新的证据语法。这个语法把“可能是”改写成“就是”,把“相关”改写为“部位”,把“这一样本里”改写成“这个人的脑子里”。一旦进入这个语法,原来的循环论证就被遮住了。人们不再问智商测验是怎么定义智力的,不再问脑区与分数的相关是否在新样本中成立,不再问图上的颜色经过了几次加工。
他们看到的是一具身体的横截面,一个没有语言、没有文化、没有教学条件的自然物。这正是脑成像最危险的地方:它把人为测量重新命名为自然事实。比奈当年用木尺绕着孩子头围转一圈,至少那张脸还在尺子旁边。今天的脑图常常把整个人都省略掉,只留下一个颅骨的轮廓和几条彩色标记。人的部分越少,证据看起来越客观。
这也解释了为什么技术越不确定,它越容易被拿来加固旧制度。因为旧制度需要的是不可争辩的证据形式,不是可以继续争论的新知识。学校要分层,法院要认定能力,保险要决定赔付,这些机构没有时间等待脑成像的预测效度被反复验证。它们只要一个能结束争论的场景:一台机器、一个专家、一张图,然后所有人闭嘴。脑成像正好提供了这个场景。它的科学光环不是用来打开智力的黑箱,而是用来关闭公共讨论。那些最想“看见智力”的人,往往就是最不想继续讨论智力定义的人。图出来,问题就结束。这是比任何测量误差都更深的讽刺。
现在回看2007年那张图。它最初印在《自然》杂志论文页里时,只是研究者用来证明皮层厚度与智商存在相关的一张统计图。图上有颜色,但颜色旁有误差条,有样本量,有相关系数,有统计显著性。
到了媒体上,这些参数被剪切掉,只留下颜色最鲜明的一块。再往后,到了科普讲座、教师培训、法庭展示,连原始论文链接都不再出现。它变成了一张可以被任意命名的图像:智力中枢、理性区域、认知核心。
每经过一次传播,它离那篇论文的限定条件就更远一步。但它离权力决策却更近一步。
这不是图像在说谎。图像从来不会说谎,说谎的是那些把统计孢子当成解剖切片的用法。
这张图从实验室出来时,身上系着很多根绳子:样本、方法、模型、阈值。传播过程把绳子一根根剪掉,最后只剩下一个光滑的、不会反抗的图形。这样的图形才方便入档、上墙、呈堂。
木尺量头围的年代,人们留下的是一个数字:头围多少厘米。今天扫描大脑的时代,人们留下的是一个影像:某某区域亮暗。数字和影像都曾被当成智力的身体证据。但身体证据的两面性也在此:它越具体,就越容易脱离产生它的条件和语境。头围数字脱离了比奈当时对教师判断的依赖,就只剩下一圈木尺。脑图脱离了智商测验的定义和统计模型的参数,就只剩下一片伪彩色。两者都没有独立说出智力的真面目。它们只是在不同时代里,用不同的身体记号重复同一个循环:先按已有的社会判断画出智力的轮廓,再到身体里把这个轮廓找出来,最后宣布身体证明了判断。量头围如此,扫大脑也如此。
但脑图的处境比头围更麻烦。头围只是记录在档案里的一行数,它不会被当成一张脸。脑图则不同。它可以被观看,可以被指认,可以被投影,可以被复制。它像一张肖像,一张由机器代言的肖像。肖像一旦挂在墙上,就没有人会问画家为什么这样画。脑图一旦进入法庭或教室,也没有人会问研究者为什么这样统计。这个区别很关键。
数字可以被质疑,因为它抽象;图像却常常让人停止质疑,因为它看起来已经在那里。观看先于解释,目光比训练更早抵达结论。脑成像的承诺,恰恰是在这个不需要训练的地方,完成了最有力的说服。
但它承诺的“看见智力”,从来都只是“看见事先定义好的智力标签”。等到这张图开始决定一个人的教育、自由和福利时,那个被看见的东西,已经不是智力,而是标签本身。
于是,2007年的那张脑成像图,在经历了杂志、媒体、讲座、法庭、学校这一长串旅程之后,含义已经彻底变了。它从一个科学问题——智力有没有神经基础——变成了一个制度工具——能不能用脑图把人分类。问题变了,图没变。变的只是它被谁拿在手里。
再用找到的结果反过来证明规定是对的,这不是科学,这是循环。只不过在比奈的时代,循环用木尺完成;在今天,循环用磁共振完成。
木尺量出的周长被当成了智力的线索,磁共振扫出的亮度被当成了智力的面貌。两者都没有跳出那个圈。当我们把一张2007年的脑成像图从杂志上截下来,贴到媒体上时,它是一则科学新闻。
人们惊叹于技术的力量,以为从此可以看穿智力。几年之后,当这张图被递进法庭,投影在墙上的时候,它就不再是一则新闻了。它成了一份证据。
这份证据可能决定一个人是否被认定为智力残疾,是否可以得到特殊教育资源,是否在量刑时获得某种考量,是否被认为有能力管理自己的财产。它从实验室的论文里走出来,走进了司法程序、教育政策、保险理赔。
它不是科学共同体内部争论的对象了,它开始分割真实的人生机会。可它背后的那套测量逻辑,还是老一套。它没有回答“智力是什么”,只是把智商测试的框架再一次复制到新的媒介上。
脑成像的承诺——更客观的测量——最终没有兑现出独立的生物学解释,但它的光环已经足够让旧有的命运技术换上一件更体面的外衣。于是那个老问题又回来了:如果脑图本身并不比智商测试更客观,它凭什么被用来加固那些以智商测试为基础的决定?
这个问题并没有随着2007年的那篇论文沉寂下去。因为需要答案的人太多,而能够提供答案的技术太少了。脑成像图已经从一篇论文里的彩色斑点,变成了法庭上的一张证据,变成了教育讲座里的一张投影,变成了公共话语里“科学证明智力”的方便说法。
它的含义变了。变了的不是图本身,而是它被使用的位置。当一张科学图像被放上审判桌,它就不再属于最初那些研究者了。
它开始属于所有想用它来决定别人命运的人。这张图还在那里。它被折叠、复制、引用、误读。它的颜色也许在新一轮分析中变淡了,它在跨样本验证中的预测力也许已经缩水,但它已经不再需要那些预测力了。只要它看起来像科学,只要它指向脑,指向那个被认为是自我的最后的、最硬的所在,它就可以继续工作。这个循环不打破,屏幕上的下一把尺子,就还在等着被造出来。