第 8 章

冷战的量尺

一个国家的命运,不取决于它有多少聪明人,而取决于它能不能把聪明人从人堆里认出来。这话听着像管理学鸡汤,但它在1957年之后的美国,是一种被写进法律、拨出专款、渗入每所公立学校的集体信念。我们后来看到的一切——从小到大层层加码的考试、按分数排名的学校榜单、家长为孩子几分之差夜不能寐——所有这一切的起点,不是哪一位教育家提出了什么深刻理论,而是一颗苏联卫星从天上飞过,把一个超级大国的焦虑逼成了一套测量工具。

这个说法有点反直觉,所以这一讲,我们得从那个秋天说起。1957年10月,苏联发射了人类第一颗人造卫星斯普特尼克号。放在整个冷战的时间线上,这件事发生在一个极其微妙的年份。前面我们看到,1947年英国已经把十一岁考试落到了每一个孩子头上,智商测试在欧洲完成了第一次大规模制度落地。但英国那套逻辑,说到底是分配已经定型的社会阶梯,它关心的是一个孩子该进文法学校还是现代中学。

到了1957年,轮到美国人登场了,他们把同一把尺子拿过来,不只是量孩子,更量国家。尺子还是那把尺子,量的对象变了,整件事的性质就完全不同了。我们先把那颗卫星看个仔细。苏联人从拜科努尔发射场送进近地轨道的东西,重八十三点六公斤,直径五十八厘米。今天任何一个大学生搞的小卫星项目都可能比它复杂,但在当时,它每九十六分钟绕地球转一圈,带着一个不断发出无线电信号的发射器,从美国本土上空一遍一遍地掠过。任何有短波收音机的美国人都能听到那个声音。

苏联人在发射之前就公开了计划,美国媒体也做了报道,这事不构成偷袭。但一颗实实在在的外国金属球在头顶上飞,跟听到敌人有了新武器,是两码事。美国社会的反应远远超出了情报系统的预期。

《纽约时报》在随后一周内刊发了近三百篇相关报道,放在今天,相当于所有新闻平台的流量加在一起集中砸向同一件事。恐慌的焦点很快就清楚了。不是军事。

那颗卫星虽然挂在改装的洲际弹道导弹上,意味着苏联人已经有了把载荷扔到美国本土的能力,但真正让美国精英阶层睡不着觉的,是一个受教育问题。1957年10月到11月,报纸和政论杂志的社论反复追问同一个问题:苏联人是不是比美国人聪明?这个问题一点都不修辞。提问的人认真去查了两国科学课程的课时数,去对比中学数学教材的难度,去数两国工科大学每年的毕业生人数。一个八十三点六公斤的金属球,就这样被换算成了智力比较的分数。苏联卫星上天,等于苏联教育更成功,等于苏联人智力更强,等于美国正在集体变笨。这套换算逻辑当然是粗暴的,但它击中了美国社会最深的那根神经。

为什么偏偏是教育?原因在于二战之后美国人的自我认知有个脆弱环节。军事上,美国有原子弹,有轰炸机,有全球基地网络。工业上,美国占全球产出的最大份额。可偏偏在基础科学和工程技术人才培养这件事上,美国自己清楚,它不如苏联组织得狠。

苏联从1930年代起就建立了高度集中的理工科人才培养体系,数学物理从小学开始层层选拔,进专门学校,进大学,进研究所,整条流水线为国家目标服务。美国那套分散的、地方主义的、强调通识和自由的公立教育,跟它一比,显得松散、低效、没有方向。所以当那颗卫星飞过来,美国精英圈的第一反应不是“我们的火箭不行”,而是“我们的教室不行了”。

这个反应很快就变成了一连串动作。1958年初,美国联邦政府和军方开始资助一批“天才搜索”项目。这些项目资助方有空军、海军、国家科学基金会,也有新成立的与国防挂钩的教育机构。它们想做的是同一件事:把那些最聪明的孩子从美国城乡各个角落里捞出来,给他们上等资源,让他们代表美国去跟苏联天才竞赛。逻辑很直:苏联科技领先,说明他们发现了自己的智力精英;美国要追赶,就得先把美国的智力精英找出来。至于普通孩子学得怎么样,那是次要的事。这个先后顺序,是整个冷战教育逻辑的起点。

艾奥瓦州一个乡村中学的数学天才,就是在这样的背景下被捞出来的。他十五岁,住在得梅因以东一个小镇上,父亲在洗衣机工厂做维修工,母亲在家照看四个孩子。按他后来的回忆,他当时的人生规划就是高中毕业进工厂,攒钱,结婚,一辈子不离开老家。这个计划不是因为他没有抱负,而是因为在他能看到的世界里,没有别的路。但他数学极好,好到中学数学老师玛格丽特·沃克在他课后塞给他一本高等代数教材,他三个周末读完。这件事发生在1956年春天。如果斯普特尼克没有上天,这个男孩的数学才能大概就会停留在沃克小姐的记忆里,顶多变成地方报纸的一则小故事,然后被工厂车间收编。

但1957年10月之后,情况变了。1958年春天,联邦资助的天才搜索项目延伸到艾奥瓦州。这个男孩被叫去参加一场学术能力测试。题目里涉及的概念,有些他只在沃克小姐给的那本书里见过。最终他的数学部分得分进入全州前百分之零点五。接下来是一封来自州立大学的邀请函,六周暑期科学训练营,费用全免。

他父亲起初不愿意,家里需要他暑假打工的收入。沃克老师上门做工作,说了一句话:这个孩子如果不去,可能一辈子都会想“如果”。父亲最终点了头。那个夏天,他第一次走进大学实验室,第一次摸到了占据整间屋子的计算机,第一次听到了“轨道力学”这个词。十二年后,他坐在了美国国家航空航天局约翰逊航天中心的控制台前,参与阿波罗计划。

这个故事是真实发生过的制度事实。它讲的是一个人如何被一套选拔机制发现并改变命运。

但如果只讲个人奋斗,就会漏掉更重要的东西。真正改变那个艾奥瓦州男孩命运的,不是他个人的天才——他的天才一直都在——而是一套被冷战激活的机制。这套机制叫大规模天才筛选。它的关键在于“大规模”:不是说找一个两个聪明孩子,而是把所有适龄青少年都放进一张由考试构成的大网里,用统一的题目、统一的评分规则、统一的标准,在最短时间内把数百万人筛一遍,按分数排序,把排在最前面的那些人挑出来。这里我们要把“标准化测试”这个概念讲透。

它不是柏拉图的理想国,也不是孔子说的因材施教,它是二十世纪的产物。简单说,就是用同一套题目、同一个评分标准、同一种考试程序,面对大量人群同时施测,追求的是效率和可比。打个比方:你要从一万个西瓜里挑出最甜的十个,最快的办法不是让老师傅一个一个敲,而是把一万个西瓜都切一小块,用同一台糖度计测数字,然后按数字从高到低排。标准化测试就是那台糖度计。它测出来的不是西瓜的全部品质——香气、口感、水分、纤维感全都忽略了——但它快,而且每个西瓜都用一个数字表示,方便排序。这就是为什么它在战争动员和冷战竞争里特别受青睐。

美国人对这种大规模标准化测试并不陌生。第一次世界大战期间,陆军心理测试用阿尔法和贝塔两种量表,在几个月内给一百七十万士兵打分,把士兵按智力分成从士兵到军官候选人的不同层级。那是一战,时间紧,兵员多,标准化测试第一次显示了它在国家动员中的威力。到了冷战的1958年,同样的事情发生在平民教育上。

只是这次的对象从士兵变成了中学生,规模更大,范围更广,影响更深。天赋搜索项目只是第一波浪潮,紧接着,本来就已存在的SAT——那个最初只是为少数东海岸大学服务的入学参考考试——被推到了全国舞台的中央。

这里值得插一句,关于那种认为“测试即便有历史问题,它测的东西是真实稳定的认知能力,所以被普遍采用是理性选择”的观点。我们可以先承认一部分事实。标准化测试确实能测出某些真实存在的能力,尤其语言推理、数量关系和逻辑抽象能力,这些能力在预测某种特定类型的学术成功方面,确实有效。这不是伪科学。

问题在于,当这种测试从个体诊断工具变成群体比较工具之后,它追求的不再是“测准这个孩子”,而是“给这个孩子排个名次”。这是两件完全不同的事。测准一个孩子,你会想知道他的背景、他的语言环境、他紧张不紧张、他饿着肚子来考试还是睡足觉来的。排名次,这些全都变成误差项,被统计程序抹平。

抹平的代价,就是有些孩子被放错了位置,而这个错误不进入决策者的视线,因为它不体现在平均分上。换句话说,标准化测试越是大规模使用,就越精确地把自己做成了粗糙。

这个张力在1958年的国会听证会上表现得很清楚。斯普特尼克上天后不到四个月,艾森豪威尔向国会递交特别咨文,要求紧急拨款强化科学教育。国会两院教育委员会搞了为期六周的联合听证,记录超过一千页。

听证会上,心理学家和教育学家作证,几乎人人带数据。其中一个来自伊利诺伊大学的心理学家,名字叫劳埃德·汉弗莱斯,留下一段话,大意是,美国的问题不是苏联人天生比美国人聪明——他明确否定基因差异的说法——而是苏联教育体系更有效地利用了他们人口的智力资源。他用了一个当时还算新鲜的词:人力资本。

他说,美国的智力资源就像地下的石油,储量很大,但不打井不开采,它就永远是潜在的东西,不算真正的力量。这个类比非常有力,因为它避开了“谁更聪明”的种族火药桶,把问题转成了一个资源勘探和开采问题。

教育问题变成了资源管理问题。怎么勘探智力资源?用测试。怎么评估储量?用群体平均分。怎么比较开采效率?拿美国的数据和苏联比。整个逻辑链条,就在这场危机中完成。

1958年9月通过的《国防教育法》,把这个逻辑变成了制度。法案名字本身就说明一切:教育和国防联姻。它授权联邦政府拨出巨款,改善数学、科学和外语教学,扩大大学贷款,设立研究生奖学金。

但最要紧的条款之一,是授权各州开展大规模天才识别项目。法案文本里没有出现“智商测试”这个敏感词,立法者已经学会了用更中性的语言包装。

但实际操作中,识别天才的主要工具,就是各类标准化智力测验和学力考试。联邦的钱通过这个条款流向测试机构,测试机构用这笔钱开发更多测试,测试反过来产生更多数据,数据被用来向国会证明更多拨款是必要的。一个循环就此形成。这个循环对中国读者来说可能很熟悉,但请记住,在1958年的美国,这是一个全新的开始。SAT的前身是1926年由卡尔·布里格姆根据陆军智商测试改编的大学入学参考。

很多人不知道,布里格姆本人后来都承认,用群体测试直接决定个体命运是危险的,他在1930年代就公开警告过这种做法的风险。但到了1950年代,SAT虽然被不少大学采用,却还不是主流。大多数美国高中生不考SAT,他们凭高中成绩和推荐信申请本州的大学或学院。

斯普特尼克危机改变了这一切。《国防教育法》通过后,联邦政府要求接受拨款的地方提交人才储备数据。数据从哪来?测试机构。以SAT为主业的教育考试服务中心抓住了这个机会。他们的宣传口径是:要比较不同地区的教育质量,要识别隐藏的天才,要确保美国不浪费任何一个高智力个体,就必须有一套全国统一的标准化测试。各地学校打的分数没有可比性,一个艾奥瓦州小镇的“A”和一个纽约私立学校的“A”可能是两码事,但SAT的分数,至少在理论上,是放在同一把尺子上的。这个逻辑很强。它也确实解决了真实存在的问题:美国教育分散,各地标准千差万别,一个统一测试提供了前所未有的可比性。

但代价是,测试的逻辑开始反过来塑造教育的逻辑。当SAT逐渐变成大学升学的关键门槛,当《国防教育法》的资金开始和测试成绩挂钩,高中的课程就变了。老师的口头禅变成了“这个会考吗”。学校开始比较各自的SAT平均分,然后调整教学重点。出版商开始推SAT备考教材。课外补习产业从几个小作坊起步,逐步变成连锁生意,最终是一个数十亿美元的市场。SAT考生人数从1958年的几十万,到1970年代接近每年两百万。这个数字背后是更深的变化:美国公立教育的核心目标,从“教育公民”悄悄变成了“培养人才”,又从“培养人才”悄悄变成“提高分数”。

这里要提出本章的核心论断。人们通常以为,斯普特尼克危机刺激了美国教育质量的提升。钱是多了,课程是加了,更多孩子进了科学工程领域。但如果你仔细看制度演化的轨迹,斯普特尼克真正催生的不是更好的教育,而是更系统的测试。美国政府没有直接接管课程设计,但它通过测试体系间接地控制了课程方向。

这个闭环一旦转起来,就不只是国会山和测量机构的事了。它开始落到每一间教室里,落到每一个教师的教案本上,落到每一张发到家长手里的成绩单上。

1959年秋天,宾夕法尼亚州兰开斯特县的一所公立高中做了一件事:校长把上一届毕业生的SAT平均分抄在教师休息室的黑板上,旁边用红粉笔写着全县排名,再旁边是邻近几个学区的数字。没有一位老师被正式要求改变教学,但黑板上的红字每天都看着他们。

到了期中考试前,教十年级英语的马丁森太太把原先计划的两周诗歌单元压缩成三天,把节省出来的时间用来讲词汇类比和阅读理解。不是她喜欢这样,而是她发现,词汇类比在PSAT和SAT里反复出现,而诗歌分析基本不出现在标准化阅读题里。她对同事说了一句话:“我得先帮他们过关,才能谈别的。”这类决定在无数个教师休息室里重复发生。

它不涉及任何行政命令,却比行政命令更稳定,因为它源自一种很实际的判断:当分数决定学生能不能上大学、学校能不能拿到联邦项目资格、老师能不能继续教高年级课程时,课程内容就会自动向考试内容倾斜。标准化的尺子量什么,课堂就教什么;尺子不量的,就慢慢从课表上消失。

这个过程不像斯普特尼克上天那样戏剧化,它是一格一格发生的。1958年《国防教育法》通过后,联邦拨款流入各州的科学、数学和外语教学项目,但这些钱并不都是买新设备、建新实验室的。有相当一部分流向了“测试和指导”事务。各州教育局成立了新的测试办公室,负责组织大规模测验,整理分数,向联邦教育机构报送人才储备数据。这些办公室一开始很小,只有几个职员,使用从测试公司租来的答题卡评分机。

没过几年,它们就变成了各州教育行政体系里最忙碌的部门之一。一个印第安纳州的县学区督学在回忆1940年代末自己做教师时的工作时说,那时候一个学生的成绩单上,四五门课的等第就够了;到了1963年,他开始收到长达三页的成绩报告,上面有全国百分位、全州百分位、学区百分位、性别差异和语言推理分项。

他说,他第一次看那张纸时,脑子里只有一个念头:这些孩子在这个表格里,怎么看都不像孩子了,全成了百分位。这个人的原话没有被当作名言留下来,但他描述的那个瞬间,是当时许多教育工作者共有的感觉。标准化测试开始重新定义“学生”:学生不再只是坐在教室里的人,而是一组能够被比较的数字。

这套系统之所以能迅速扩张,还有一个原因:它迎合了美国政治里对“客观”的偏好。

二十世纪中叶的美国,越来越不相信地方教育官员的直觉和老师的主观判断。一个人说这个孩子聪明,凭什么?你的标准跟我的一样吗?受训练的心理测量学家会说,凭的是同一套题目,同样的施测程序,同样的评分规则。这不是你我说他聪明,而是分数说他排在前百分之二。

这种话术在国会听证会上尤其有效。当参议员问起如何保证联邦资金不被浪费在平庸的孩子身上,心理学家不必替这个孩子的人格辩护,他只递上一串常模和相关系数。数字有说服力,因为它看起来不带感情,也不带地方偏见。

但“看起来客观”和“真的公平”之间,隔着一条很宽的沟。标准化测试确实把一部分主观判断挤了出去,可它同时把另外一些偏见藏进了题目、常模和抽样设计里。哪些知识值得考、哪些能力叫“高智力”、哪些背景的孩子更容易得分,这些标准本身就是人定的。只是它们一旦被统计程序包装成百分位和平均分,就不太像人定的了,倒像是自然规律。

这正是1958年之后美国公立学校里发生的最深的一层变化。学校本来的任务,是教具体的人:这个孩子不会算分数,那个孩子写句子没有标点,另一个孩子看见数字就发怵。这些麻烦都要一个一个解决。但标准化测试把问题换掉了。

它不问这个孩子卡在哪一步,它问的是,这个孩子的得分和全国同龄人相比排第几。一个学生分数低,老师第一反应不再是“我该怎么补”,而是“他会拖累班级平均分”。学校也一样。

一所学校SAT平均分高,就被认为是好学校,哪怕它把三分之一的精力花在备考上;平均分低,就被认为出了问题,哪怕它的学生两年间从一个阅读水平很低的起点进步了很大一截。进步不容易被看见,排名一眼就看得见。所以排名赢得越来越彻底。

到1960年代中期,一些州开始用测试分数给学校分等,随后又把教师评价和成绩增长挂钩。每一项措施听起来都在“问责”,都在“提高”,但落下去的时候,人们盯着的都是同一把尺子上的刻度,而不是被量的人。

这种对排名的执念,与冷战的国家安全逻辑完全同构。斯普特尼克危机把美国人的目光从个体上升到群体,再上升到国家。一个个小孩算不算得对分数,原本是家庭和教师的事;但在1957年10月之后,每个孩子的分数都成了国家脑力库存的一部分。苏联人每多考出一个理工科毕业生,美国就多一分焦虑。反过来,美国每发现一个艾奥瓦州小镇上的数学天才,就觉得自己在冷战的资源账本上多记了一笔。

群体比较需要全国统一的数据,全国统一的数据需要标准化测试,标准化测试需要制度依托,制度依托需要持续不断的政治焦虑。斯普特尼克提供了第一推动力,国会提供了法律外壳,测试机构提供了技术基础,三者一旦咬合,就形成了一个不依赖苏联卫星也能自我维持的增长机制。

后来苏联再没有重复斯普特尼克那样惊人的第一,但美国的教育测试没有因此减速。因为这时它的功能已经不只是应对苏联了,它成了学校之间、学区之间、州之间互相比较的基础设施。

这套基础设施还有一个更隐蔽的后果:它改变了公众理解“聪明”的方式。过去,一个人聪明不聪明,是在具体生活里判断的:这个孩子能修好收音机,那个孩子能记住几十首民歌,另一个孩子能凭眼睛把木料刨平。学校和社区里,多种能力可以被同时承认为“有天分”。但标准化智力测试只抽取其中窄窄的一层,主要是语言推理、数量关系和抽象符号操作。这些能力可以被快速测出来,也方便在大群体里做比较,但它们在人类实际能力的总谱里只占一小段。

测试一旦成为高风险的官方通道,其他能力就自动降为业余爱好。那个艾奥瓦州男孩的弟弟正是如此。

他的手感、听觉判断、对机械故障的直觉,在他自己的修车生涯里是实打实的本事,但在升学排序面前,这些能力根本不被输入系统。这不是说他被“冤枉”了——系统本来就不测量那些。系统只是假装它测量的东西,已经覆盖了“聪明”的全部。这是一种很安静的暴力,没有冲突,没有申诉,只有一个孩子从学校走回家,手里拿着自己说不清为什么比别人低的百分位数字。

到1960年代末,越来越多的心理测量学家自己也开始感到不安。一些人不是否认测试有用,而是担心测试所引导的制度正在把教育简化成训练。1965年,各州报送联邦的教育数据已经显示出一种明显的趋同:课程内容向语言和数学推理看齐,艺术、音乐、机械技能和体育在课表里的比重逐年下降。学校之间的差距没有缩小,但分数使用的频率却在增加。

教育政策的核心问题,不再是“孩子学到了什么”,而是“美国孩子排第几”。一个明显的证据是,1960年代,美国联邦教育机构开始定期发布各州的教育进展评估数据。这些数据的来源是大规模抽样测试,呈现方式是排名和比较。媒体跟进报道,标题不外乎“某某州教育水平全美垫底”“某某学区成绩大幅下滑”。公众反应是焦虑和问责。改革措施是增加测试频率,把教师工资和学生成绩挂钩。

测试引发排名,排名引发焦虑,焦虑引发更多测试。这是一个闭环,而这个闭环的起点,就是1957年秋天那颗绕地球哔哔作响的苏联卫星。

我们回过头,再看那个艾奥瓦州男孩。他后来确实进了NASA,参与了阿波罗计划。那不是他一个人的故事。他有一个弟弟,也参加了同一个天才搜索测试,分数没有达到选拔门槛。弟弟不是不聪明,后来成了一个很有天赋的汽车修理工,能听出发动机最细微的异常声响,能用手解决别的技师束手无策的故障。但在那套测试体系里,这种能力不被测量。哥哥向上进入精英序列,弟弟留在原来的地方。

两兄弟的命运在青少年时期的一个上午被一套题目分开。这不是悲剧,弟弟的人生并不比哥哥更差,他有自己的尊严和满足。但两个孩子的机会结构,的确是被一套他们并不完全理解其由来的标准化程序决定的。而这个程序之所以在那一年降临在他们的生活里,是因为一个超级大国在冷战焦虑中决定,把所有孩子的智力都放到一把尺子上量一量,然后跟另一个国家比比高低。

这把尺子一旦拿出来,就没有收回去。冷战结束了,苏联解体了,那颗卫星早在1958年1月就坠入大气层烧毁了。但它在天上响的那三个月,在美国社会里刻下了一个顽固的信念:国家的未来,取决于它最聪明的那一小部分人;识别这些人的唯一可靠方式,就是让他们参加统一的标准化测试,然后按分数从高到低排好。

这个信念漂洋过海,和被上一章定在十一岁前途上的英国孩子一起,构成了此后六十年全球教育竞争的基本脚本。它还会继续向前推进,在1960年代末撞上一个更激烈的问题:如果排名的不只是个体和国家,而是种族呢?那把量尺将面对它诞生以来最炽烈的争论。而争论的燃料,此刻已经堆在加州的大学校园里了。