第 11 章
论证从洛夫特斯在七十年代开始的一系列误导信息实验
但这个伏笔需要一个更直接的承接。上一章我们谈到,遗忘是记忆的管理者,它通过“主动修剪”让信息网络保持高效。米勒在二十年前就从另一个方向窥见了同一机制:当信息洪流袭来时,大脑的第一道防线不是全盘吸收,而是设定容量上限,主动筛选。这个“7±2”的魔力数字,既是短时记忆的瓶颈,也是长期记忆得以存活的前提——正因为处理不了那么多,我们才被迫对信息进行加工、取舍和重组,而这个过程本身,就已经是重建的开始了。
1956年,乔治·A·米勒在《心理学评论》上发表了一篇论文,题为《神奇的数字:7±2——我们信息加工能力的局限》。这项实验设计简洁到可以在任何一间本科实验室里复现:让被试听一串随机数字,然后要求他们按顺序复述。数字序列从三位开始,逐渐加长。到了七位左右,大多数人的表现开始崩溃。到了十位以上,几乎没有人能完整复述。米勒由此画出了人类短时记忆容量的一道硬边界:大约五到九个信息单元。超出这个范围,新的信息进来,旧的信息就被推出去。
这个发现对认知心理学的影响怎么强调都不过分。但在我此刻重读这篇论文时,最受触动的不是那个“7±2”的结论本身,而是米勒在论文结尾处写下的一句话。他说,这个容量限制不是记忆系统的缺陷,恰恰相反,它是记忆系统在面对信息过载时发展出来的一种适应策略。大脑不是在被动地漏掉信息,它是在主动地筛选。这个判断,和我们上一章结尾处留下的那个认识——遗忘是记忆的管理者——形成了跨越近半个世纪的呼应。米勒在五十年代就已经看到了这个方向,只是他没有用“再巩固”“主动修剪”这些后来才出现的术语。
但米勒的论文还埋着另一条线索,一条他自己未必充分展开、但对我们接下来要讨论的问题至关重要的线索。如果实时存储都如此狭窄而脆弱——如果连十几位数字都无法在几分钟内原样保存——那么那些被存储了数周、数月、数年,其间被反复提取、反复讲述的记忆,又能在多大程度上保持原样?这个问题,在米勒发表论文的那个年代,还没有直接撞进司法系统的核心地带。但撞进去,只是时间问题。
1974年,伊丽莎白·洛夫特斯和她的合作者约翰·帕尔默在《言语学习与言语行为》期刊上发表了一项实验。这项实验后来被引用了太多次,以至于有些教科书在复述它时几乎把它简化成了一个段子。但重复不等于不重要。恰恰相反,它被反复引用,正是因为它揭示的那个效应太大、太稳定、太直接地挑战了一个所有人都曾信以为真的假设。
洛夫特斯给被试看交通事故的录像,然后问了一个问题。问题的措辞,就是实验变量。一部分被试听到的是:“两车相撞时,车速大概有多快?”另一部分听到的是:“两车接触时,车速大概有多快?”动词换了——“撞”和“接触”在物理上描述的是完全不同程度的冲击。结果,听到“撞”的被试给出的速度估值显著高于听到“接触”的群体。这个差异不是边缘性的,它在统计上是干净的、可靠的。
但这还只是第一步。一周后,洛夫特斯把这些被试叫回来,问了另一个问题:“你在录像里看到碎玻璃了吗?”录像里根本没有碎玻璃。
然而,那些之前听到过“撞”这个动词的被试,有相当比例的人报告说他们看到了。一个事后植入的词,不是在回忆时被当作外来信息被识别和拒斥的,而是在回忆时被当作原始记忆的一部分被接纳和缝合进去的。而且被试对此毫无察觉。
他们不是在说谎。在脑成像技术尚未普及的七十年代,洛夫特斯还没有办法直接观察这些被试的脑区激活模式,但她通过行为数据已经能够推断:这些人是真的“记得”那些碎玻璃。他们的记忆系统已经把那个被植入的细节当作发生过的事实来处理了。
这个实验范式后来被洛夫特斯和她的同事们在各种条件下反复改进和验证——不同的录像材料、不同的提问措辞、不同的时间间隔、不同的被试群体。结果的方向从未改变:事后信息可以被整合进原始记忆,整合的过程对当事人完全不可见,整合后的记忆可以搭载极高的主观确定感。正是这一点——主观确定感——把我们接下来要讨论的一切推到了一个远比实验室更残酷的舞台上。
在洛夫特斯的误导信息实验中,有一个现象从一开始就出现在数据里,但它在早期论文中并没有被当作独立的研究焦点来单列。这个现象是:那些被成功植入虚假记忆的被试,在报告自己看到了根本不存在的碎玻璃、不存在的谷仓、不存在的让行标志时,他们的确定程度与那些记忆基本准确的被试相比,没有统计学上显著的差异。
让独立的观察者来看这些被试的录像,单凭说话者的语气、表情、叙述的流畅程度,观察者完全无法分辨谁在报告真实的记忆、谁在报告被污染的记忆。换句话说,确定感和准确率之间,不存在我们有权利期待的那种正相关。一个人可以完全没有任何说谎意图、完全相信自己说的是真话,同时完全弄错。
这个发现如果只停留在认知心理学的期刊里,它不过是一个迷人的学术议题。但它不可能停留在那里。因为在那之前大半个世纪里,全世界的法庭都在把一样东西当作定罪的核心依据来使用——目击证词。而法庭评估目击证词是否可信时,最常用的那个指标,恰恰就是证人在证人席上表现出来的确定程度。
在进入具体案件之前,我需要先做一个坦诚的交底。接下来要描述的案件细节,来源是公开的案卷记录和后续的无辜者调查。它没有被拍成著名的纪录片,也没有进入每一本法学院教材。它之所以被写进本章,恰恰是因为它的“普通”——正因为它在司法误判的谱系中不算极端案例,它才更能代表系统性问题是如何在常规操作中悄无声息地发生的。
案件发生在七十年代中后期的美国。一名女性在夜间回家途中遭到袭击。袭击过程持续了几分钟。受害者在挣扎中看到了袭击者的脸,时间不长,光照条件不理想,但她确信自己记住了一些特征。案发后不久她向警方做了第一次陈述。警方手里没有任何物证能将任何一个特定的人与犯罪现场联系起来——没有DNA,当时DNA检测技术还没有进入司法应用;没有指纹;没有任何物理痕迹。他们只有受害者。
于是他们开始排查,找到了一个符合部分初步描述的男性。我们叫他D。D住在附近,有过一些轻微的前科,案发当晚的行踪无法被完全证实或证伪。警方决定做一次列队辨认。列队辨认,在法律程序的设计逻辑中,被视为一种保护措施。它的初衷是避免单人指认的强烈暗示性——不让证人单独面对嫌疑人,而是把嫌疑人混在其他填充者中间,让证人从中挑选。如果证人能准确地挑出嫌疑人,这份辨认结果就可以作为证据呈上法庭。
这个设计的法律理性是自洽的。但它从根子上接受了一个没有经过任何科学检验的前提:证人脑子里存着一份对案发当晚的准确记录,辨认只是把这记录调出来跟眼前的真人比对。洛夫特斯在同一个十年里用实验数据反复敲打的就是这个前提。但在真实的警局里,在那个具体的晚上,她的论文还没有进入警察培训手册,也没有进入检察官的办案指南,更没有进入法官对陪审团的指示文本。
第一次列队辨认。受害人站在单向玻璃后面,面前是一排五个人。D在其中。她看得很仔细,没有急着做决定。然后她指向了一个人——但不是D,是旁边的填充者。她对警察说,那个人“有点像”,但她不确定。她说袭击者的头发好像更长一些,当时光线太暗,她不想认错人。案卷里有这一段的记录。第一次辨认,她没有指认D。
如果记忆是一盘录像带,这个结果应该得到尊重。录像带里没有找到清晰匹配,证人也承认模糊,程序在逻辑上就应当停止——至少对于D来说应当停止。但调查没有停止。警察觉得D“看起来很像”。他们不认为受害人的不确定是否定信号,他们把它解释为紧张、距离太远、光线太差,或者需要再看一次。
几天后,第二次列队辨认。这次D站的位置变了,周围的填充者也换了一部分。受害人再次站到玻璃后面。这次她看的时间更长。然后她指向了D。“就是他,”她说。这一次,她的语气不一样了。她说她确定。
案卷记录了这一次的指认,但没有记录清楚是什么在这几天里改变了。是列队的排列方式?是警察在辨认前后对受害人说了些什么——那些在洛夫特斯实验中精确控制过的、一两个词就足以扭曲记忆的引导性信息?是受害人在反复回忆案发过程时,自己用内部叙述逐渐把模糊的影像填实了?案卷对此沉默。
但洛夫特斯的实验数据给出了一个有据可查的解释框架。每一次回忆,都是一次再巩固窗口。受害人在两次辨认之间的那些天里,一定反复回忆过袭击者的体貌特征。她的记忆系统不是在调取一份封存的档案,它是在用当前的原材料重建那个夜晚。每一次重建,都有细微的材料被替换、被填充。当她第二次站到单向玻璃前时,她脑子里那个袭击者的脸,已经不是案发当晚她实际看到的那张脸了。那是一张经过多次重建的合成影像。而D的面孔——第一次辨认时她看过的、警察认为“很像”的那张脸——很可能已经被缝合进了那份合成影像。她对此没有察觉。这不是一个关于诚实的问题,这是一个关于神经机制的问题。
庭审是一个新的阶段。检察官在开庭前按常规流程和受害人做了准备工作。这种庭前准备在司法实践中被视为必要——检察官需要确保证人在庭上的陈述清晰、连贯,经得起交叉质询。但每一次排练,从记忆系统的角度看,都是一次高度结构化的再巩固。检察官的问法——“你确定你看到的是被告吗?”“在列队辨认中,你是怎么认出他的?”“你当时能看清他的脸吗?”——这些问题不是在帮助证人“回忆”,而是在帮助证人“巩固”。每回答一次,那些被后期植入的细节就被加固一次,而那些残留的不确定感就被削弱一层。
等到受害人站到证人席上的时候,她不是在回忆一个一年前的夜晚。她是在复述一个在过去几个月里被反复讲述、反复修改、反复排练过的叙事。她的语气不再有第一次辨认时的那种犹豫。她能描述袭击者的身高、体型、衣服颜色,以及她自己认为在袭击过程中注意到的面部特征。而案卷记录显示,这些细节的一部分,在案发后最初的警方笔录里要么是模糊的,要么根本没有出现。
陪审团看着她。他们看到一个诚实的、受过伤害的、努力配合司法的女性。她说话的方式、她的眼神、她对细节的确定——这一切都符合日常经验中“说真话的人”的标准。陪审员们没有理由怀疑她。他们在行使自己被赋予的职责:观察证人,评估可信度,做出判断。D被判有罪。主要证据就是这份目击证词。
多年后,DNA技术进入司法应用。当年案发现场保留的部分生物样本被重新送检。检测结果排除了D。真正的袭击者是另一个人,一个因为其他暴力犯罪后来被定罪的罪犯,其DNA与现场样本完全匹配。目击证词——那份在法庭上听起来如此确凿、如此不可撼动的证词——从一开始就错了。不是受害人在说谎,不是警察在故意陷害,不是检察官在隐瞒。是一个诚实的、在程序中被反复重建记忆加固过的证人,用百分之百的确定感,指认了一个完全无辜的人。
让我们把这个案件中记忆的演化轨迹完整地追踪一遍。这不是为了指责谁,这是为了看清程序本身的结构性盲点。
案发当晚:昏暗街道上的模糊面孔。记忆编码本身就信息贫乏。高度应激状态下,注意力收窄到威胁来源,周边细节——包括袭击者的面部特征——被更糟糕地编码。这是神经系统在危机时刻的优先取舍,不是任何人的错。
初次询问:受害人和警察交谈,努力回忆细节。这是第一次重建。警察的问题结构本身就可能带入了引导。不是故意引导,而是任何提问都不可避免地会圈定回答的范围。“他有多高”把注意力聚焦到身高上,“头发什么颜色”聚焦到发色上。每一次聚焦都在加固某些信息,让另一些信息沉降。这不是警察的错——他们不可能不问问题。
第一次列队辨认:受害人在五个人面前寻找匹配。但匹配的标准不是原始的案发当晚影像——那份影像已经不存在了,它已经在初次询问中被重建过一次。她现在比对的标准,是当前记忆中那张已经被轻微编辑过的脸。她没有选D。她不确定。她的不确定在那一刻是对记忆可塑性的一个真实反应。但程序无法消化“不确定”这个结果。程序的逻辑不允许“这一排里没有他”作为一个正常选项被轻易接受。
第一次辨认后的间隔期:她在反复回想的内部叙述中继续重建。警察可能在不经意间传递过自己的判断——“没关系,再看看”——这类在日常对话中完全无害的安慰,在记忆还在巩固窗口期时,可以是另一种形式的误导信息。她可能在其他场合看到过D的照片,即使是走廊上的偶然一瞥。这些碎片都可能被记忆系统收编。
第二次列队辨认:她指认了D。她感到确定。这份确定感不是基于原始记忆的准确性——原始记忆已经不存在了,它在反复重建中被替换了。这份确定感是基于叙事在反复重述后获得的连贯性。她不是在回忆,她是在相信自己反复讲述的那个版本。
庭前准备和法庭作证:检察官帮她排练。每一次排练都在巩固叙事,消除犹豫。当她最终面对陪审团时,她的记忆已经不是一个事件,而是一份经过多次编辑的终稿。而编辑过程对她自己完全不可见。
这个演化轨迹的每一步,在洛夫特斯的实验数据中都可以找到对应的机制解释。误导信息效应不只是发生在实验室的录像和问卷之间,它发生在每一次再巩固窗口打开的时候。而司法程序——列队辨认、调查询问、庭前排练、法庭作证——所有这些环节,在设计之初都没有考虑过一个基本事实:记忆在每次提取时都会被重建。这些程序按“档案提取”的模型设计出来,用来操作一个“动态重建”的系统。结果是:模糊的记忆被善意地、程序化地、以正当程序之名,逐步加固成了斩钉截铁的错误证词。
有人会在这里说:你讲的这些都是特例。大多数目击证词肯定还是准确的,否则人类不可能在演化中存活下来。这个异议必须被正面回应。
洛夫特斯从未主张所有记忆都是虚假的。她的主张要精确得多:记忆是可塑的,这种可塑性在特定条件下会被显著放大,而司法程序恰好系统性地创造了那些条件。效应量的问题需要如实交代。在误导信息范式的各种变体中,通常有百分之十五到四十的被试会将事后植入的信息整合进自己的记忆报告。这个比例因具体条件而浮动——误导信息的性质、时间间隔、提问方式都会影响它——但它的方向始终稳定。在心理学效应的光谱上,这是一个中等到较大的效应量。它不是那类“只在百分之二的人身上出现”的边缘发现,它是那种“如果你把条件设对了,你可以在本科教室里当场演示”的可靠现象。
而且,司法场景中的实际条件比实验室更有利于误导信息效应的发生。实验室有严格的伦理限制:不能让被试以为自己经历了真实暴力犯罪,不能让被试处于高压应激状态,不能反复施加误导性暗示。但在真实案件中,这些保护全都不存在。受害人经历的是真实创伤,伴随高度应激。当神经系统处于高肾上腺素状态时,注意力收窄是神经生物层面的硬编码反应——不是为了更“准确”地记录一切,而是为了在威胁面前快速聚焦逃生或反击。事后的反复询问、多次辨认、媒体报道,每一次都是潜在的误导信息植入窗口。
所以,当洛夫特斯从实验室走向法庭,以专家证人身份解释记忆可塑性时,她面对的最常见质疑是:你们的实验用的是录像,真实犯罪中的应激会让记忆更清晰,你凭什么把实验室结果推论到刑事司法?她的回答反映了一个更细致的科学理解:应激确实会让某些类型的记忆更鲜明——杏仁核相关的情绪记忆强度会增强。
但同时,应激会缩小注意力范围,导致周边信息被更差地编码。袭击者的面容、衣着细节、出现时间——这些正是目击证词所依赖的“周边信息”。也就是说,应激让一个人“感觉上记得更清楚”,但对目击证词所实际需要的那类细节的准确性,它恰恰是有损害的。这不是相互矛盾的发现,这是在说,主观感受和客观准确是两回事。
这就回到了本章最核心的那个判断:信心与准确率脱钩。这个脱钩在D案中不是偶然发生,它是被程序设计一步一步制造出来的。
警方列队辨认从设计上隐含着一个从未被说出口的假设:列队里一定有一个罪犯,你的任务就是找到他。这个假设深嵌在程序结构里。当证人站到单向玻璃后面,面对一排人,她会自然地假定——否则为什么要被叫来做这件事?——袭击者就在其中。她的真正任务不是判断“袭击者在不在这一排里”,而是被默认为“从里面挑出那个人”。洛夫特斯在实验室里直接验证过这个盲点:当列队中没有真正的“罪犯”时,被试中有相当比例的人仍然会挑出一个人。他们不是乱选,他们是在找“谁最像我记得的那个人”。而当被问到“你有多确定”时,他们的确定感与准确率无关。
这种程序性暗示的后果是灾难性的。它将一次开放性的“你认得这个人吗?”的询问,悄然转换成了“这些人里哪个最像?”的强制选择任务。洛夫特斯后续的研究甚至表明,即便在辨认前明确告知“罪犯可能不在队列中”,暗示效应依然显著。因为辨认的形式本身——站成一排供人挑选——就是一种强烈的、超越语言的暗示。它让“不确定”和“不在这里”这两个本应是合理选项的答案,在认知上变得极其困难。
这就是列队辨认的根本困境。它设计出来是为了防止单人指认的强烈暗示,但它在无意中创造了一个新的暗示:列队里一定有答案。这个暗示从来不写在操作手册里,它存在于程序的形式本身之中。D案中的受害人,在第一次辨认时没有正确指认袭击者——因为袭击者根本不在那排人里。她的记忆在那一刻做出了相对诚实的反应:不确定。但程序的逻辑不能终止于此。程序的逻辑把她推向了第二次辨认,直到她找到了那个“最像的人”。
等到了法庭,程序的锁定机制进一步收紧。检察官的问题结构本身就在压缩不确定性,它要求的是一份干净、连贯、可供陪审团采信的叙事。那份叙事一旦在庭前准备中被排练纯熟,就会在正式作证时以高度的自信被陈述出来。而陪审团评估这份证词时,本能地依赖那个最不可靠的指标:自信程度。
日常经验告诉我们,如果一个人说得磕磕绊绊、前后矛盾,他可能在说谎或者并不确定。如果一个人直视你的眼睛、语气坚定、细节丰富,你就倾向于相信他。这个日常判断直觉在处理大多数人际互动时大致管用。但在法庭上,面对一个记忆已经被反复重建加固过的证人时,它就成了系统性偏差的最强放大器。
于是整个闭环完成了:警方程序鼓励证人在列队中做出选择,选择之后的确定感通过重复叙述和庭前排练被不断强化,证人在庭上以极高自信陈述被编辑过的记忆,陪审团依照自信程度采信这份证词,无辜者被定罪。这个闭环的每一步,都是善意且合乎既定程序规范的人在履行自己的职责。没有人需要故意做坏事。但整个系统作为一个整体,恰好构成了一台不断加固虚假记忆的装置。
洛夫特斯在八十年代出版的一本著作里写过一段话,大意是:我们建造的司法机器,每一个齿轮都在正常运转;但因为它所处理的那种叫“记忆”的原材料具有设计者没有预料到的属性,所以这台机器在特定条件下,会规律性地输出错误的结果。这是一个结构性的诊断。它的分量不在于指控任何人,而在于指出:如果程序本身在每次提取记忆时都在污染记忆,那么仅在程序末端加一道警告——“陪审团请注意,目击证词可能不可靠”——是不足以防止系统性错误的。那就像在一个漏水的水管末端放一个桶。桶会装满,水管还在漏。
八十年代DNA检测技术进入司法应用之后,美国“无辜者计划”组织开始对被定罪案件进行系统的DNA重检。他们发现的冤案中,目击证词的错误识别是所有错案原因中占比最高的单一因素。这不是证人说谎导致的,这不是警察腐败导致的。这只是程序按设计运转,而记忆按本性工作,两者之间发生了结构性的错配。
1956年,乔治·米勒告诉他的同行:人类实时信息加工有物理上限。超过七位左右的数字,我们就无法原样保存。他当时只是在讨论短时记忆的容量,但他发现的这个“7±2”,对二十年后洛夫特斯提出的那个问题其实已经给出了方向性的提示。如果连实时存储都如此脆弱,那么那些被搁置、被反复提取、在每一次提取时都被重建的长期记忆,怎么可能像一份封存档案那样稳定?司法系统对记忆的期待——在一年后准确地提取一份未经编辑的原始记录——是在要求人类认知系统做一件它在演化史上从未被设计去做的事。把重建性的记忆当作录像回放来使用,这个要求本身就建立在错误的前提上。
当我们这一章走到底时,落点不在任何个人身上——不是证人、不是警察、不是检察官、不是陪审员。落点在那套程序本身的设计假设上。如果连辨认程序在结构上都在制造它试图避免的错误,那么仅仅批判证人的不可靠就远远不够了。我们必须审视辨认程序本身的设计,审视那个默认了记忆是录像带的整套证据规则。
这不是一句“改革列队辨认程序”就能收尾的问题。因为在辨认程序设计得到改善之后,在警方和检方都接受了记忆科学的基本发现之后,我们每个人仍然要面对属于自己的那一部分困境:作为自己记忆的唯一拥有者和终身使用者,我们该怎么和这个每次回想都在重拍的剧组相处?怎么判断哪些记忆在为当下的自己服务,哪些记忆在用虚假的确定感把过去的错误锁死在今天的判断里?但那是之后要展开的问题。
但那种与自我记忆相处的个人困境,之所以重要,恰恰是因为它预示了下一个更普遍的陷阱。如果我们连对自己的记忆都无法保持审慎,那么当面对他人的记忆——无论是作为陪审员、治疗师,还是朋友——时,我们又该如何评估那份斩钉截铁的“确定感”?这种主观确定感与客观准确率的系统性脱钩,不仅发生在法庭上,它弥漫在我们每一次凭借记忆做出判断的时刻。正是这一点,把我们引向了全书下一个需要厘清的核心概念。