第 24 章

全球治理的分数

上一章末尾,家长攥着孩子的智商分数,在特殊教育的格子前面排队。那个数字决定孩子能不能拿到额外辅导,决定他被归为“学习障碍”还是“可教育性智力落后”。分数是开关,开门或者关门。但图纸早就漂洋过海了。

现在换一张桌子。这张桌子摆在一个东欧国家的教育部会议室里。桌上两份文件并排放着。左边是国际学生评估项目最新排名,本国阅读、数学、科学三科排在四十名开外,比上一轮又掉了两位。右边是课程改革方案。方案里的乡土历史、母语文学、音乐、哲学,被财务部门用红笔圈出来,旁边批了一行字:课时不足,建议压缩非核心科目,腾出时间用于测评训练。坐在桌边的教育官员要做一个决定,说起来也简单:要不要为了明年的国际排名,把课程表改掉。不做,排名可能继续下滑。财政部已经在等着看数字了。排名一掉,预算报告会先递上来,议会里会有人拍桌子,报纸标题会写“我们孩子不如邻国聪明”。

做了,短期内分数也许能上去,但那些被红笔圈掉的课,可能再也没有机会回到课程表里。他问旁边的人:排名掉下去,最坏会怎么样?答:预算被削,还有,下次大选前,教育部长会被换掉。这位官员不是虚构的极端例子。二十世纪末到二十一世纪初,从里加到索菲亚,从基辅到布加勒斯特,许多国家的教育部门都坐过同一张桌子。他们未必共享同一份试卷,但共享了同一种焦虑:国家在外面排第几,比学生在里面学了什么更紧迫。

这一章要讲的是一个变化:智商测试怎么从一国的内部管理工具,变成国际比较和全球治理的指标。问题不在某个国家分数高低,而在那把尺子怎么变成了各国都不得不看的钟。更准确地说,要看的是:一个国家越相信排名,就越可能为了分数改变教育,结果让测量工具反过来塑造了它声称测量的对象。先别急着归咎于某一份排名。我们得先问:为什么一张测试排名表,能让主权国家的课程表动起来?答案不在教育本身,而在“比较”这两个字。

国际学生评估项目的背后,是经济合作与发展组织,总部在巴黎。这个项目从上世纪末开始,定期对几十个国家和地区的十五岁在校学生进行阅读、数学、科学三科测验,然后公布排名。排名依据样本学生的平均成绩,精确到小数点后一位。芬兰曾经多年占据榜首,赫尔辛基的学校里挤满了从世界各地来取经的教育官员。后来东亚经济体接连上位,上海、新加坡、韩国轮番拿到第一。每一次榜首易主,都像一场小型地震,震源在巴黎,余波却在各国教育部的走廊里。

表面上看,这不是智商测试。它不叫智力测验,不测所谓的“一般因素”,也不发智商分数。它测的是“学业能力”。但你细看它的题目设计、分数呈现方式、媒体报道口吻、政府应对策略,就会发现它与智商话语有深层亲缘关系。因为两者共享一个核心前提:认知能力可以被标准化测量,测出的数字可以相互比较。学生之间能比,学校之间能比,国家之间也能比。比出的结果被解读为:排名高的国家拥有优质“人才储备”,排名低的国家正在浪费“人力资本”。

这一套前提不是国际学生评估项目凭空发明的。它从比奈量表那里继承下来,在美国的移民检查站、军队征兵、企业招聘、特殊教育体系里一路打磨,到二十世纪末已经非常顺手。国际学生评估项目不过是在国家之间把这套工具用了一遍。

这就引出了本书反复提到的一个概念:命运技术。所谓命运技术,是指把人的复杂潜能转化为单一数字标签,并据此分配生命机会的社会技术装置。它先是处理个人,然后处理群体,最后处理国家。每一步都是下一步的台阶,不需要任何密谋。

比奈量表处理法国学童,戈达德在埃利斯岛处理移民,军队处理士兵,学校处理学生,企业处理求职者,特殊教育处理家长和孩子。到了二十世纪末,这架机器开始处理国家。处理方式不再是给一个人贴标签,而是给一个民族、一个经济体、一个政府贴标签。

但是,国际组织为什么会看上这套东西?这要从发展经济学的转变说起。二十世纪后半叶,经济学家们为“国家为何穷富”争执不休。有人讲地理,有人讲制度,有人讲资本积累。

到了二十一世纪初,一批研究者把答案推到“人力资本”上。人力资本这个概念,要落到可操作层面,就变成了“认知技能”。认知技能怎么测?测验分数。于是逻辑链搭起来了:穷国穷,部分是因为劳动力认知能力偏低;要发展经济,就要提高认知能力;要提高认知能力,就要抓教育;要检验教育抓得怎么样,就看国际测试分数。这个链条一旦变成政策共识,教育的重心就悄悄滑了。

同一时期,国民平均智商研究热闹起来。一些研究者把各国已有的智商测试数据汇总,再与经济增长、政治稳定、公共卫生等指标做相关分析。结论往往非常干脆:国民平均智商与经济表现高度相关。这个结论一出来,争议极大。批评者说,早期跨国智商数据质量参差不齐,样本缺乏代表性,文化偏差没有剔除。支持者说,误差固然存在,但大趋势无法否认。双方的争执本身就是一个信号:智商话语已经不再只是心理测量学界内部的游戏,它进到了全球治理的场域。为什么进得去?因为“有用”。

如果国民平均智商可以测量,还能预测经济表现,那么对世界银行、联合国开发计划署、国际货币基金组织、跨国投资机构来说,它就是一个现成的工具。评估一个国家的人力资本质量,可以用它;决定贷款条件的优先序,可以用它;写人类发展报告附注,可以用它;判断投资风险,可以用它。于是,国家也可以得到一个智商标签。这个标签一旦落地,就会像贴在个人身上的那个数字一样,开始参与资源的分配。

这里必须停下来,看清楚“量化分类”在起什么作用。量化分类,指的是把连续的认知能力分布切割为离散类别,比如天才、正常、低能,以进行社会分配。在个人层面,这种切割已经做过无数次。埃利斯岛移民检查站把不懂英语的东欧少年归为“弱智”,州立机构据此决定谁该被绝育,军队征兵时划一条淘汰线,特殊教育体系把边缘孩子划成“可教育性智力落后”。每一次切割,都改变了具体人的命运。现在,同一套切割被搬到国际层面。国家的认知能力也被分作几档。某个门槛以上,是“高智力资本国家”;

某个门槛以下,是“低智力资本国家”。原本连续分布的经济、文化、历史差异,被压缩成几个等级。每个等级对应一套政策建议、贷款条件、投资评价。国际组织使用测试指标,命运技术就进入了全球治理。这不是说有一个世界政府拿着智商表在分配地球资源,而是说各国政府自愿或不自愿地接受了这套分类逻辑。参加排名,就等于承认了比较框架。不参加排名,会被视为数据不透明,或者更糟,被视为不敢面对现实。参加了,排名低,就被归为“需要改革”。改革的依据是什么?往往是那些测验题目。

现在再回到那位东欧教育官员。他的国家排名下滑,国际组织和经济学家的建议会是什么?通常是加强基础学科训练,增加测试频次,建立教学质量监测体系,调整课程设置。这些建议背后有一个看起来合理的假设:国际排名反映学生的真实认知能力,而认知能力可以通过教育提高。这个假设不算错。但它忽略了一个更实际的机制:如果排名波动很快,而教育改革周期很长,那么短期内最有效的提分办法是什么?熟悉测试。

补习班、模拟题、答题技巧训练、考试策略指导。学校加班,学生提前一年备考,教师在课堂上讲怎么更好地填答题卡。这些做法确实可能提高分数。但分数提高,是否意味着学生更会思考?是不是只会应付这一种测试?

这一步追进去,问题就扎到了制度根源。为什么排名会逼着学校做测验训练?因为排名把复杂的教育目标简化成一个数字。为什么一个数字就能评价一个国家的教育?因为国际比较需要一个可比的量。为什么可比的量只能是分数?因为分数看起来客观、精确、不受文化干扰。为什么分数看上去客观?因为智商测试一百多年来不断培育这种印象。

追问到这里,根源露出来了。学校教育的功能从来不只是传授知识。它还承担公民教育、文化传承、社会整合。一个在里加读书的中学生,除了会解方程,还需要知道自己的国家从哪里来,母语里的诗歌怎么读,社会为何如此运转。这些内容很难进国际测验,因为它们没法标准化。当教育政策的目标从“培养公民”转向“提高排名”,那些无法进入测验的内容就会被系统性地边缘化。

那位教育官员并非不知道代价。他知道砍掉艺术课、哲学课、乡土史,也许会换来数学和阅读成绩的小幅上升。他也知道这种上升来得快,去得也快。明年测试方向一变,分数又会滑下来。到那时,课程已经砍掉,教师已经转岗,教材已经改版。再要恢复,成本比当初省下的高得多。但他仍然可能选择砍。

因为他面对的不是一道教育学的题,而是一道政治经济学的选择题。排名下降,财政预算跟着收紧。预算一紧,教师工资、校舍维修、设备更新都要受影响。排名上升,预算不仅宽裕,财政部长在国际会议上也更有面子。在这种激励结构下,课程自主是奢侈品,测验分数是硬通货。

这位官员有他的难处。他不是不知道教育的本义,他是被一排数字按在椅子上,动弹不得。国际学生评估项目与国民智商研究的互动,给这种压力又加了一层。前者不承认自己是智商测试,但它和后者共享“认知能力决定国家命运”的叙事。国民智商研究者说,一个国家的平均智力水平制约其经济发展潜力。

国际学生评估项目用排名暗示,一个国家的教育质量决定其未来竞争力。两套话语加起来,给各国政府制造了一种持续的焦虑:你不抓分数,就是在透支国家的未来。

但并不是所有国家都乖乖就范。一些国家对“低智商”标签发起抵制。有的公开拒绝参与某些国际测评,理由是这些工具带有文化偏见,不能兼容本国的学习方式与文化背景。有的提出,国际排名低估了非认知能力的重要性——坚持、合作、创造、道德判断。这些反驳不是没有道理。

然而,抵制的姿态常常落入同一个框架:不是质疑把国家推向“智力资本”竞争的制度动力,而是试图在排名之外另建一套排名,或者把“国民心理素质”“社会情感能力”也做成可比较的指标。抵制排名,反而在抵制中承认了排名的权威。这不是说这些国家虚伪,而是在这种全球治理结构里,反抗的语言已经被提前写好了。

那个“低智商”标签,一旦被拿来讨论,就很难再从桌上拿下去。你说“我们的分数低是因为文化偏差”,你就已经承认了分数可以衡量文化偏差之外的东西。

你说“我们重视道德教育”,你就已经把自己的优势放进了对手提供的比较框架里。这就是量化分类的权力:它不只是给事物贴标签,它还规定了辩论的词汇表。

现在有人会站出来说:智商测试虽然有过历史滥用,但它核心测量的是真实且稳定的认知能力,也就是一般因素。这个因素对个体和群体差异具有预测效度。因此,它被广泛采用,不是社会建构,而是理性选择。

这个反驳值得正面回应。第一,一般因素的存在,在心理测量学界有很强的实证支持。众多认知测验的得分确实高度相关,也确实可以通过统计技术抽出一个共同因子。说智商测试“完全是骗局”,是不严肃的。第二,但“存在一个统计因子”与“这个因子应当成为分配资源的依据”之间,隔着一条不可跳跃的鸿沟。统计上的稳定不等于社会意义上的公平。身高也很稳定,遗传度不低,测量起来误差很小,但没有谁会主张按身高分配教育机会。智商之所以被用来做这件事,不是因为它在科学上更“硬”,而是因为它在一整套社会制度中已经被赋予了分配权力。

第三,跨国比较中的“国民平均智商”问题更严重。个体测试中尚可控制的样本偏差、语言偏差、动机偏差,到了跨国层面会成倍放大。一个在特定文化环境中长大的孩子,面对一套源于另一文化语境的抽象推理题,表现会受到许多非认知因素影响。把这些分数汇总为“国民平均智商”,再与腐败指数、经济增长率做相关分析,统计上可能得出显著结果,但这不构成因果推论。只能说,那些经历过殖民、内战、营养不良、公共卫生崩溃的国家,在多项指标上都表现更差。这并不奇怪。真正需要解释的,不是“为什么他们分数低”,而是“为什么我们只盯着分数”。

第四,最关键的一点是:即使智商测试测量了真实的认知能力,它进入全球治理的方式仍然值得警惕。因为一旦“认知能力”变成国际组织手里的治理指标,它就不再是中立的科学事实,而是一种分配工具。它影响贷款条件、援助项目、教育改革的优先序。它让一些国家的课程表被改写,让一些家庭的孩子提前进入备考流水线。

测量真实的东西,不等于测量所有重要的东西,更不等于用测量的结果来统治。所以,问题的核心从来不是“智商存在不存在”,而是“智商话语在全球治理中重新塑造了它声称只测量的对象”。当各国政府为了提高排名而改革课程,测验对教育的回火效应就完成了。教育本来要做什么,已经不重要。重要的是下一轮分数。

这个结论很重,但可以验证。翻看那些排名上升的国家,它们的教育体系是否变得更加多元?更多的时候,是测验训练增加了,教师自主空间缩减了,课程表上留给非测验科目的时间变少了。排名上升与教育质量改善之间,不能画等号。排名上升只是告诉世界:这个国家更擅长应付这一套测量了。

就在这一章进行的同时,还有更多国家正在加入测评体系。它们怀着相似的焦虑,担心被排除在排名之外,担心被国际社会看作“数据不透明”。它们也想证明自己有“智力资本”。于是测量网络越铺越大,命运技术越织越密。东欧的那位教育官员,只是这张网上的一个节点。现在把目光从东欧会议室挪开,看一看更早的一张表。

古巴的孕产妇死亡率,在2015年高于巴巴多斯、伯利兹、智利、哥斯达黎加、墨西哥和乌拉圭等拉丁美洲国家。这个数据来自《1990至2015年孕产妇死亡趋势》。它看起来和智商测试毫无关系。

但如果我们把它放进全球治理的指标化进程里看,就能发现一个更大图景:国家被贴上各种数字标签,有的是产妇死亡率,有的是经济增长率,有的是腐败指数,有的是国民平均智商。这些数字之间会相互关联、相互解释。一个数据低,会被用来解释另一个数据也低。然后,一个“低水平国家”的形象就由这些互相关联的数字拼装起来。

为什么会这样?因为国际组织和跨国机构需要处理大量国家,它们不可能逐国做民族志式的研究。数字标签成了最有效的认知捷径。一个排名,一个指数,一个平均数,就能让总部办公室里的人快速判断一个国家的状况。这种判断未必准确,但它足够快,足够“客观”。

量化分类在这里发挥了最大威力:那些不进入数字的东西——历史经验、文化逻辑、制度韧性、社会结构——通通被推到背景里,变得不可见。

那么,这样的治理方式带来了什么具体后果?举一个类型化的例子。某国为了响应国际组织对其“人力资本质量”的关注,开始改革小学课程。数学和阅读课时增加,艺术、体育、社会课被压缩。教师被要求参加“教学效能测评”,学生的月考成绩被逐级上报。几年后,该国在某一轮国际测评中排名上升了几位。教育部召开新闻发布会,宣布改革成功。但几乎没有记者去乡村小学问一问:那些被压缩掉的艺术课,原来承担着什么功能?那些因为反复测验而失去学习兴趣的孩子,后来怎么样了?

这就是“国家为排名改变教育”的微观后果。它不一定是某个人的恶,而是系统的激励结构使然。教育部需要业绩,财政部需要数据,国际组织需要报告,媒体需要头条。每个人都在自己的环节里做“理性”的选择,最后拼出一个非理性的整体:教育的工具价值吞没了它作为公民养成的价值。

把那张古巴孕产妇死亡率的表放在一边,我们不能只看见一个公共卫生数据。它之所以会出现在全球治理的文件夹里,是因为它和智商分数一样,可以被放进互相关联的指标网络。

一个国家在这些指标上位置低,不是因为每一个指标都精确描述了它的某一部分,而是因为国际组织、援助机构和投资顾问需要用少数数字拼出一个可比较的整体。孕产妇死亡率高,便被读作公共卫生体系薄弱;公共卫生弱,便读作人力资本损耗大;人力资本损耗大,再读作认知能力难以积累。链条的每一环都需要统计支持,但真正把链条焊死的,不是数据本身,而是对“国家智力资本”越来越迫切的竞争逻辑。

东欧教育官员桌上的课程改革方案,就是这样一步一步从一份测评报告变成政策文件的。报告说本国十五岁学生的数学平均分低于某参考线,教育部便要解释为什么;解释不了,财政部便要求调整课时;课时调整后,课程表上消失的是乡土历史、母语文学、音乐和哲学。这些科目没有一个出现在下一轮排名的公式里。

它们不会影响国际组织对本国“人力资本质量”的判断,却会实实在在地改变学生的知识结构和自我理解。

这个过程中,没有任何一个机构发过一道命令,要求牺牲公民教育。命令是分散的,藏在贷款条件的附注里、欧盟入盟谈判的评估框架里、国际投资者风险报告的数据表里。每个环节上的行动者都在做自己的分内事。

教育部要提高分数,财政部要保住预算,国际组织要发布可比报告,媒体要找一个能上头条的排名。于是,改革就出现了。

它不叫“智商测试改造国家”,而叫“以国际标准提升教育质量”。可标准一旦落到课堂里,就变成了更频繁的模拟测验、更紧的答题技巧训练、更少的非测验科目。

东欧的那位官员未必愿意这样选择,但他面对的选项已经被数字固定住了:要么接受短期、可见的排名上升,要么承受预算削减和部长下台的政治代价。至于五年后学生们是否还能读懂本国诗人的句子,不在任何一张年度评估表上。所以答案几乎是注定的。

这不是说那些国家不知道自己在失去什么。有些加勒比海国家曾公开拒绝把 PISA 或类似测评作为教育拨款的前提条件,它们自己建立区域比较框架,试图把本地语言、社区参与和非认知能力纳入指标。但这类抵抗并没有真正摆脱比较逻辑。建立新框架,等于承认指标是必要的;指标一出来,学校又开始为新的分数忙碌。教师、学生、家长,还是被装进另一套数字标签里。抵抗排名的行为,常常只是换了一张表,而不是跳出表外。这也许是最让人泄气的地方:在全球指标网络中,反抗的语言已经被提前写好。你可以质疑某一份试卷的文化偏差,但很难质疑“有可比数字才能治理”这个更底层的假设。

现在我们可以把本章的历史判断说清楚。智商话语的全球化,并没有传播更科学的测量。它传播的是“国家智力资本”的竞争逻辑。

这个逻辑让各国政府把教育政策的目标从培养公民转向提高排名。它把测量工具从教育服务者变成教育指挥者。一个国家的课程表、教师培训、教材编写、学校评价,都开始围着那只温度计转。

温度计本来只是测量温度,现在却开始给房间供暖。当取暖的行为反过来又影响温度计的读数,人们就更相信温度计准确了。回火效应就这样自我强化。

这不是哪个人邪恶,也不是哪个国家愚蠢。这是一个制度性的循环。排名提供焦虑,焦虑推动改革,改革围绕测试,测试再提供新的排名。在这个循环里,真正被改变的对象不是排名,而是教育本身。

那位东欧教育官员最后会怎么选?材料没有告诉我们。但选项已经很清楚。

他大概率会部分牺牲课程自主,增加测评训练。不做,近期的代价太大。做,远期的代价分散而滞后,不会在下一届选举里被看见。这个结构不是他一个人能改变的。他只是在替这个结构签一次字。

全球治理的分数,就是这样一种运行法则:它把长时期的、难以量化的损失,换成短期可看见的分数上升。

它不需要任何人撒谎,只需要每个人都盯着那张表。一个国家的教育可以为了排名改,一所学校可以为了排名改,一个教师可以为了排名改,一个学生也可以为了排名改。

最后,测量工具没有受到质疑。它还在那里,而且比以往任何时候都更像“客观事实”。

这不是说测量不能提供信息。信息提供的方式,决定了信息会被如何利用。

到了全球治理层面,信息就是权力。谁掌握测量的定义权,谁就在定义国家的前途。

我们用一句话给这章收口:国家越相信排名,就越可能为了分数改变教育,让测量工具反过来塑造它所测量的对象。这把尺子现在悬在国家头上,每一次挥动都能改写一国的课程表。但从来没有人问,尺子上那些刻度,最初是什么人在什么情况下刻上去的。而那些被不断测量的“智力资本”,真的可以像石油储备一样,挖出来,称一称,标个价,然后写进国际组织下一年的报告里吗?