第 19 章

可证伪的边界

人们常常以为,把决定推给系统就能取消判断,但这其实只是把判断藏在了对结论的依赖背后。那些结论常常贴着“科学”的标签。

科学这个标签究竟意味着什么,很多人并不清楚。要看清它,可以回到一份只用了五十天就写完并出版的科学报告。

在维尔茨堡大学的物理实验室里,威廉·伦琴于1895年11月注意到一块本不该发光的荧光屏。他没有立刻宣布自己发现了真理。他继续用书本、木板、橡胶、玻璃和金属片逐样测试,让妻子的手放在射线前,看见了骨骼的阴影和金属戒指的轮廓。五十天后,也就是1895年12月28日,他把这些观察写成一篇只有几页的报告,标题是《一种新的X射线》,提交出版。

论文的措辞极为克制。它描述了一种能穿透某些不透明物质的新射线,列举了可穿透与不可穿透的材料,并承认尚未完全理解其本质。伦琴用数学里代表未知数的“X”来命名,没有声称发现新自然力,也没有构建一套完整的理论体系。1896年1月5日,奥地利一家报纸报道了这一发现。

随后全球媒体蜂拥而至,X射线迅速成为医学诊断的工具,伦琴后来获得首届诺贝尔物理学奖。公众的反应热烈而急切。

但伦琴本人的步调却慢得多。在1895年到1897年间,他一共只出版了三篇关于X射线的论文。他不急于宣布自己掌握全部真理,而是继续验证和测量,甚至一度秘密进行重复实验,担心最初报告存在谬误。

这种看似迟疑的态度,并不是科学进程中的可选项,而是科学进程的本来面目。

伦琴的故事提示了一件容易被忽略的事:科学知识在诞生那一刻,通常不是以真理的形态出现的。它是一份初步报告,带着已知的局限和未知的边界,邀请同行检验、质疑、修正或推翻。论文末尾那些“尚未理解”“有待进一步研究”的话,不是客套,而是科学工作的引擎。

可是,当科学知识进入养育领域,这种边界感常常消失得干干净净。一位家长听完一场关于儿童早期发展的讲座。讲师展示了彩色脑图,用非常肯定的语气说,科学研究证明听莫扎特能提高儿童空间推理能力,还说识别孩子的学习风格能事半功倍。

家长如获至宝,回家开始调整音乐播放列表,判断孩子的学习偏好。几个月后,她参加另一场讲座,同样权威的讲师却告诉她,莫扎特效应未能被独立重复,学习风格缺乏严格证据。她坐在那里,感到自己此前相信的东西突然失去了坐标。

这不是两个讲座之间的矛盾,而是科学知识生产方式与公众理解方式之间的错位。科学生产的是带着误差范围和可修正边界的初步结论,公众消费的却是一种确定的、简单的、可以直接照做的真理性论断。当这两种逻辑在养育现场相遇,混乱几乎是必然的。

要理解这种错位,得先理解一个词:可证伪性。它听起来像学术黑话,直觉其实简单。一个陈述是可证伪的,意思是它允许自己被证明是错的。“所有天鹅都是白的”允许你找到一只黑天鹅来推翻它。“听莫扎特音乐能提升空间推理能力”也允许你设计实验来检验它。如果反复检验的结果不支持它,它就错了。

反过来,“孩子需要被爱”“教育应尊重个性”这类陈述虽然可能正确,但并不是可证伪的科学命题,因为无法设计实验推翻它们。

它们属于价值判断。把价值判断包装成科学结论,或把科学结论当成不可动摇的信仰,都是误用。

以学习风格为例。这个理论声称,孩子有视觉型、听觉型、动觉型等偏好,教学方式与偏好匹配,学习效果更好。这个说法符合直觉,也符合个性化教育的愿望。但问题在于,检验它并不复杂:把学生按偏好分类,随机分配匹配或不匹配的教学,看成绩是否有差异。2008年,一项严格的元分析对现有研究做了系统筛选,结论相当直接:几乎没有证据支持匹配教学能带来可观测的学习提升。在实验设计最严格的研究中,效应量趋近于零。

这不是说孩子之间没有差异。差异当然有。而是说,用“视觉—听觉—动觉”这个分类框架去解释差异并据此调整教学,并没有带来可测量的好处。孩子有偏好,不等于按偏好教学更有效。有时挑战非偏好通道反而引发更深的加工。

莫扎特效应走了相似的路。1993年,研究让大学生听十分钟莫扎特奏鸣曲,随后做空间推理任务,发现成绩暂时提高。

这个效应只出现在空间推理上,只持续大约十五分钟,样本也只有几十人。但公众接收到的版本变成“听莫扎特让孩子聪明”。后来二十多年里,研究者不断重复这一实验。到2010年,一篇汇总约四十项研究、涉及数千名被试的元分析显示,整体效应量极小,统计上不显著。那些微弱结果也仅限于特定空间任务,和“变聪明”无关。

类似反转也发生在关键期假说上。语言学习曾被说成有一个非常刚性的截止年龄,过了就学不好。后来的证据表明,这个所谓的截止线更像一条逐渐变陡的坡道。成人和青少年学习第二语言也能达到高水平,只是路径和难点不同。当初写入教科书的刚性说法,被修正成了一个概率性的描述。

这些事后看被修正的结论,并没有因为证据变化而退出大众视野。学习风格仍然活跃在育儿手册和测评工具中,莫扎特音乐仍在幼儿园背景里循环。原因不复杂。一个带有许多限定语的、可被推翻的概率陈述,不如一个确定、简单、立刻能用的行动指南有市场。

科学论文的读者可能只有几百名同行,而一句“测测你的孩子是哪种学习类型”可以抵达十万个家庭。两条传播链的不对称,让已经被修正的结论在公众认知里继续活很久。更深的根源,是家长对确定性的渴望。养育每天都要做决定,不会等到证据齐备。面对模糊性极强的孩子,一个简单的分类框架,一个明确的操作步骤,能极大降低焦虑。这种确定感有真实价值。

问题只出在,当确定感压倒了对证据质量的判断,伪科学就有了空间。最流行的不是证据最强的,而是语气最确定的。

那么,普通家长能做什么?可证伪性提供的不是一套养育方法,而是一种思维方式。它包含三个习惯。

第一,面对任何声称“基于科学”的养育建议,问一句:这个结论在什么条件下可能被推翻?如果对方说它在任何条件下都成立,不需要被检验,那就不属于科学命题,而是教条。可靠的科学结论总带着边界:在什么条件下成立,在哪些人群中效应更强,在哪里可能失效。第二,当新证据出现时,要有勇气承认自己以前的做法可能不是最优解。

承认自己信错了,不只是换一个方法,还意味着承认过去的付出建立在错误前提上。这有情绪成本。但科学之所以能进步,不是因为人不犯错,而是因为犯错后愿意改。伦琴发表那三篇论文后没有假装穷尽一切,他留下问题,让别人继续修正。养育同样如此。今天基于现有证据的最好判断,明天可能被修正。这不等于今天做错了,只等于条件更新时决定也更新。

第三,也是最重要的,不要把不确定性误解为“什么都说不准,那就随便来”。科学虽然不给确定性,但给概率和趋势。

学习风格没有通过检验,但本书前面讨论过的间隔重复、提取练习、交错练习在大量实验中反复出现稳定效应。它们不是百分之百有效,但有效的概率远高于无效。在不确定中决策,不等于无视概率。正是因为不确定,才更需要概率来指引。

一个使用概率思维的家长,面对一个声称“训练大脑、提升注意力”的在线课程时,不会只问它有没有效。她会问:注意力训练在独立研究中效果有多大?训练能否迁移到课堂学习?这个课程本身有没有被独立评估过?

如果证据说某些注意力成分可以改善、但迁移很窄,很多商业产品独立效果远不如自我宣传,她就能形成一个概率估计。在现有证据下,这个课程带来实质帮助的可能性不大,时间和金钱成本却是确定的。于是她可以不报,也可以报但降低预期,把它当作一个实验而非投资。关键不是最后选哪一个,而是她知道自己依据什么选,也清楚这个依据可能在未来被修订。如果后来研究证明某种特定注意力训练有效,她不会说当初错了,只会把新信息纳入下一次判断。

这种思维方式放到全书的中心矛盾上,会显出一个更冷的原因:标准化评价体系之所以难以撼动,部分是因为它提供虚假的确定性。分数明确、排名清晰、录取线固定。即使这些尺度再粗糙,至少让人踏实。而个性化成长道路到处都是模糊和不确定:无法精确测量好奇心,无法给内在动机打分,无法比较两个孩子元认知的强弱。放弃确定的标尺,进入模糊地带,既需要认知理解,也需要情感承受力。

有人会说,既然科学不确定,人工智能时代又需要知识基础,不如回到记忆与服从的老路,至少方向明确。可这个说法把两种不同的问题混在了一起。记忆与服从本身不是错的,错的是把它们当作无需检验的唯一答案。标准化训练之所以诱人,正因为它承诺了一条几乎不要求判断的路径。但算法把标准答案抽走之后,真正贵的恰恰是判断。训练出来的服从无法替代判断,只能掩盖判断的缺席。

这种边界意识,在几十年前一项关于表扬的经典研究里已经能看得很清楚。研究者让一些学生做困难题目,然后分别告知他们“成绩很好”“你一定很聪明”“你一定很努力”。随后让他们在“可能出错但能学新东西”和“不易出错”的任务中选择。被夸聪明的孩子更倾向选简单任务,被夸努力的孩子更愿意挑战。这个发现后来被无数育儿书简化为“表扬努力,不表扬聪明”。

但不太被引用的是,研究者在论文讨论部分提醒:样本来自中产阶级社区的学校,数量有限,结论能否推广到其他人群有待检验;

这种态度听起来抽象,但在另一场著名的科学反转中,可以看到它的具体形状。面孔反馈假设最初来自一场很小的实验:研究者让参与者用嘴唇含住铅笔,抑制微笑肌肉,或者用牙齿咬住铅笔,使面部接近微笑,然后请他们评定漫画的趣味程度。第一批数据里,用牙齿咬铅笔的人给出的评分更高。这个发现很快进入社会心理学教科书,也被一部分育儿内容简化成“强迫自己微笑就能改善情绪”。

但原始研究规模不大,只有几十名大学生,效应量虽在统计上显著,却不足以支撑后来那些确定的话。在后来的几十年里,不同实验室重复这一实验,结果开始分化。有的小型研究得到了相似效应,有的没有。2016年,一项覆盖多个实验室、近两千名参与者的预先注册复制研究给出清晰结论:在严格的分析中,面部反馈效应没有达到统计显著,效应量接近零。

研究者没有指责原始实验造假,而是指出单一实验室的小样本偶然波动,可能被误认为一条稳定规律。这里的数据对比很直接:从几十人到近两千人,从显著到消失。它和学习风格案例的共同点是,不是说现象完全不存在,而是当初被传播的版本过于确定,边界被抹掉了。

为什么结论会翻转?不是因为后来的研究者更聪明,而是因为小样本本身就容易产生偶然的显著结果。一个实验室里,一批恰好心情不同的被试,就可能让微笑组的评分高出一截。如果这个结果被发表,而几百个没有发现效应的实验留在抽屉里,公众看到的就只是那些支持效应的少数研究。科学通过要求预先注册、报告全部结果和扩大样本来减少这种偏差,但它不能一夜之间消除已经流行起来的简化结论。这就是为什么效应量消失会反复出现:早期的小样本阳性结果被放大,后来的大样本阴性结果却只在专业期刊里传播。

在这类反转当中,最值得读的往往不是某篇论文的结论,而是论文里的图表。面部反馈复制报告里有一张森林图,把十几个实验室得到的效应量排成一列。有的点在零的右边,有的在零的左边,整体置信区间穿过零。异质性分析显示,不同实验室得到的结果差异很大。

这种差异不是要让读者陷入怀疑,而是科学证据的一部分。它说的是:如果一个效应只在某个实验室、某批被试、某种情境中出现,就不能把它当成放之四海皆准的规律。

学习风格的元分析也呈现了相似的图景。2008年那篇综述在筛选上千篇文献后,只找到少数几项严格设计的研究,而那些研究中的效应量最高的往往来自未随机分组或样本很小的实验。一旦把随机分配和前后测作为标准,原本看起来支持匹配教学的结果就趋于消失。元分析报告在讨论部分写得很直白:现有证据不支持把教学方式与学习风格匹配当作有效做法;但这不等于学生没有偏好,而是偏好不等于效果。原始研究提出者们在更早的论文里也承认过这种边界,只是后来的传播链条把承认的部分丢掉了。

一个家长如果愿意花十分钟读原始论文,也会看到边界信息其实都写在文件里。伦琴1895年12月28日发表的那篇报告,在描述X射线时用的词是“新射线”,而不是“万能射线”。他列举了木板、橡胶和金属片的不同穿透程度,说明不同物质有不同的吸收率,这种边界信息后来变成放射学的基础。

在养育领域,可靠的证据文件也以同样的方式工作。它们不给你一个放之四海皆准的按钮,而给你一张表格:哪些条件下生效,哪些人群效应更强,哪些地方还说不清。比如早年的表扬研究,研究者不仅报告了被夸努力的孩子更愿意挑战,还报告了样本来自哪里、用了哪些词、哪些变量没有控制。后来跨文化研究修正它,不是因为原来的结论完全错了,而是因为边界被更精确地画出来。

对家长而言,读这种文件的意义不在于成为统计学家,而在于培养一种条件语感:当一句话里没有“在……条件下”“在……人群中可能存在”,你就该多问一句。这个条件语感,比记住任何一个育儿结论都更耐用。

这种修正并不会停留在专业期刊里。它会落到一个家庭晚上八点的餐桌上。一位家长正在两个暑期安排之间做决定。

一个项目声称基于执行功能训练,引用了几项小样本研究,说训练后孩子在停止信号任务上反应变快,效应量大约0.4,但样本只有三十几人,而且没有长期追踪。另一个项目是每天增加四十分钟户外自由活动,有公共卫生研究支持对注意力和情绪的温和改善,效应量在0.2左右,但证据来自数千人的观察性研究,混杂因素很多。两个项目价格相近,时间只能选一个。

她开始列条件:第一个项目直接针对孩子最近在课堂上走神的问题,但训练迁移到课堂行为的证据很弱;第二个项目不直接针对注意力,但成本低,还有身体活动的好处。

她又问:如果孩子参加了第一个项目后没有变化,自己能否接受?如果选择第二个项目,是否错过了针对性训练的机会?她没有得到确定答案。

她没有把“效应量0.4”和“效应量0.2”直接相减来选。她知道0.4来自一个三十几人的小样本,置信区间很宽,真实效果可能接近零,也可能更大;而0.2来自大样本观察,虽然更稳定,但混杂因素让它不能直接解释为因果。她最后决定先不报第一个项目,给孩子一个学期户外活动,同时每周记录老师反馈和作业完成时间。她对自己说:如果一学期后走神没有改善,再去试执行功能训练也不会太晚。

这个决定不是建立在“户外活动一定更有效”上,而是建立在失败风险和调整空间上。第一个项目一旦无效,时间和金钱不可回收;第二个项目即使不直接改善注意力,带来的身体活动仍可能有益。她还设了一个检查点,要求自己到时候看记录,而不是只凭感觉判断。

“聪明”“努力”这两个词在不同文化中含义可能不同。后来的跨文化研究确实发现,东亚情境下两者常被同时强调,不能照搬。这个修正没有推翻核心洞见,而是把它从一句口号变得可以定位边界。

伦琴在1895年报告结尾说,关于这种新射线的本质,尚有许多问题有待解答。他没有假装掌握全部答案,只把观察到的事实连同边界和未知摆到桌上。

百多年后,一个家长在养育迷雾里找路标,需要的可能正是这种东西:不是一张完美地图,而是学会辨认哪些路标自己在该有边界的地方画了线。那些画了边界线的路标不会说“跟我走保证没错”。

它只说:根据目前的观测,这条路的概率更高;但观测有限,你的孩子可能不同于样本平均;所以一边走,一边看。这个说法不如确凿的承诺让人安心,但它有后者没有的东西:它说的是实话。走到这里,压力不再来自某一种养育方法被证明无效。

它来自更具体的地方:当科学承认自己只能提供概率和趋势,家长仍必须在明天早上决定是否报那个班、是否限制屏幕时间、是否用一次对话去理解一道错题。科学不会替他做这些决定。它能做的,只是让他在做决定后,如果证据变了,知道该往哪里看。这个仍站在边界上的位置,就是每一个养育者每天早上都要面对的地面。