第 11 章
上海的分数
人们总以为拒绝智商测试的社会,必然对用数字给人贴标签这件事抱有戒心。但中国提供了一个反例:它几乎不使用智商测试,却把人从头到脚用数字标记清楚。这不是一个关于东方如何复制西方的故事,恰恰相反,这是一个关于数字信仰如何在不同文化土壤里长出不同果实的故事。果实的外形截然不同,但你咬下去,会发现种子是一样的。
我们先从一个冰箱说起。上海,2009年。一个十三岁的女孩每天放学回家,第一眼看见的不是母亲的问候,而是冰箱门上那张表格。各科分数、班级排名、年级排名,精确到小数点后一位。语文92.5,数学97,英语95,班级第3,年级第21。这张表格每周更新一次,位置从来不变——就在冰箱门正中央,比任何家庭照片都显眼。这个女孩后来参加了PISA测试。她不知道什么是PISA,也不知道这个测试的结果会在几个月后像炸弹一样扔进西方媒体的版面。她只知道那天不用上课,要填很多选择题,题目比平时的模拟考简单得多。她做完题就忘了这件事。
几个月后,经济合作与发展组织公布结果:上海学生在阅读、数学和科学三个领域全部排名世界第一。这个消息在西方引起的震动,怎么说呢,就像1957年苏联发射斯普特尼克卫星时美国人的反应——只不过这一次,恐慌的焦点不是“他们比我们聪明”,而是“他们的教育体制比我们更会制造高分”。《纽约时报》的标题问:“上海的秘密是什么?”《卫报》说这是“教育领域的斯普特尼克时刻”。美国教育部长阿恩·邓肯公开表示,这个结果应该让美国人“惊醒”。
但我要告诉你,真正值得惊醒了问的,不是上海学生为什么考得这么好,而是另一个更根本的问题:当一个社会用考试排名替代智商测试,它到底是在拒绝数字标签,还是把数字标签做得更彻底了?
让我们先回到那个冰箱。那张成绩单上没有智商数字。中国学校不测智商。这不是因为中国人不相信智力可以被测量,而是因为中国有一套更古老的测量系统,古老到它比西方心理测量学早了一千多年。它叫科举。它的现代版本叫高考。
在中国,考试排名本身就是智商测试的替代品。而且这个替代品比原版更厉害——智商测试一年只测一次,或者一辈子只测一次;中国的考试排名可以每周更新,每月更新,每学期更新。智商测试给你一个数字,你带着它走一辈子;中国的排名系统给你一串数字,它们像股票指数一样波动,每一次波动都在告诉你:你升了,你降了,你超过谁了,谁超过你了。
那个上海女孩的母亲不需要知道女儿的智商是多少。她只需要知道女儿这次月考比上次掉了两名,数学退步了三分,英语阅读丢了不该丢的五分。这些数字已经足够她做出判断,做出反应,做出安排——周末的补习班要不要加,钢琴课要不要停,晚饭时的谈话该用什么语气。
这就是我要说的第一个关键点:中国没有大规模使用智商测试,但它的教育筛选机制比任何智商测试都更彻底地把人分层。
你可能会问:高考不就是一次考试吗?它和智商测试能一样吗?问得好。让我们把两样东西放在一起看。智商测试的经典定义是什么?它测量的是所谓“一般智力因素”,也就是g因子。
它的支持者说,这个g因子是稳定的,遗传的,不受教育影响的。高考考的是知识,是技能,是可以通过努力和训练提高的。从表面看,它们完全相反——一个测天赋,一个测努力;一个是先天判决,一个是后天竞赛。
但你再往深看一层。高考的分数被用来做什么?它被用来决定谁能上什么大学,谁读什么专业,谁进入哪个社会阶层。一个数字,决定一个人的命运轨迹。这和智商测试在美国曾经扮演的角色有什么本质区别?更关键的是,高考虽然不宣称自己测量先天智力,但它的社会功能承载了一个隐含假设:分数高的人配得上更好的机会。这个假设一旦被全社会接受,它和“智商高的人配得上更好的机会”在逻辑结构上就一模一样了。
区别只在于,中国版本的合法性不是建立在生物学基础上,而是建立在“公平竞争”的道德叙事上。但这个叙事忽略了一个事实:竞争从来不是在同一个起跑线上进行的。那个上海女孩的母亲是大学毕业生,父亲是工程师。家里有书架,有电脑,有安静的书桌。
她从小学一年级开始上英语补习班,三年级开始学奥数。她所在的初中是区重点,入学时要考试,录取率不到百分之十。她的同学和她一样,都来自类似的家庭。
PISA测试测的不是“智力”,至少不是智商测试定义的那种脱离教育内容的纯粹认知能力。PISA测的是十五岁学生在阅读、数学和科学方面应用知识的能力。这些能力是教育的结果,不是教育的前提。上海学生拿第一,是因为上海拥有中国最集中的教育资源、最严格的选拔机制和最长学习时间。根据可获取的调查数据,上海十五岁学生平均每周学习时间超过五十个小时,远高于OECD国家平均水平。他们的高分数是用时间堆出来的,用服从磨出来的,用竞争逼出来的。这不是智力测试的结果。这是工业化的教育生产线的结果。
现在我们要回答一个更难的问题:既然PISA高分不等于高智商,为什么西方观察者会感到恐慌?答案藏在历史里。
从二十世纪初智商测试传入美国开始,西方社会就建立了一个根深蒂固的信念:智力是可以被客观测量的,测量结果可以解释社会不平等。这个信念在二十世纪经历了多次挑战——比奈本人反对智商固定论,李普曼批判军测,古尔德拆穿伯特的数据造假——但它始终没有被彻底推翻。到了1994年《钟形曲线》出版,这个信念甚至变得更顽固了。但《钟形曲线》引发的争论也让一部分人感到疲惫。种族与智商的争议太烫手了,基因决定论太政治不正确了。西方社会需要一个新故事来解释为什么有些人成功、有些人失败,为什么有些国家富裕、有些国家贫穷。
上海PISA第一恰好提供了这个新故事。这个故事说:你看,智力差距不是问题的关键,教育体制才是。中国人不比你聪明,但他们比你努力,他们的学校比你严格,他们的考试比你残酷。你们西方人太松懈了,太放纵了,太不重视教育了。这个故事听起来比基因决定论舒服多了。它不涉及种族,不涉及遗传,只涉及制度和努力。
它给了西方政策制定者一个可以公开讨论的话题:我们要不要学中国?要不要加强考试?要不要延长学时?
但这个故事有一个致命的漏洞。它假设PISA分数高就意味着教育成功。它没有问:那些高分是怎么来的?代价是什么?那些分数背后的人,他们变成了什么样子?
让我们回到那个上海女孩。她在PISA测试中拿了高分。她的数学应用能力超过了芬兰和新加坡的同龄人。但她的日常生活是这样的:早上六点半起床,七点到校早自习,上午四节课,午休时做一套数学卷子,下午三节课,放学后去数学补习班,晚饭后做作业到十一点。周末上午英语补习,下午物理补习。她已经三年没有完整地读过一本课外书。她对科学实验的兴趣仅限于考纲范围内的知识点。她不知道自己喜欢什么,只知道哪一科能拿高分。她的母亲说:“我不需要知道她的智商。分数就是她的价值。”
这句话是整个故事的钥匙。在中国,分数就是价值。不是比喻,是事实。一个学生的价值——在学校眼里的价值,在老师眼里的价值,在家长眼里的价值,甚至在他自己眼里的价值——都可以被几个数字精确地表达出来。班级排名告诉你你在五十个人里排第几,年级排名告诉你你在五百个人里排第几,区统考排名告诉你你在几万个人里排第几。这些数字层层嵌套,像俄罗斯套娃一样,每一个数字都在定义你。
这比智商测试厉害多了。智商测试只给你一个数字。100是正常,130是聪明,70以下是低能。这个数字是静态的,你改变不了它。但中国的排名系统是动态的。你可以通过努力改变排名。每次月考都是一次重新洗牌。你今天排第三十,下个月可能排第十,也可能排第五十。这个系统的厉害之处在于,它让你相信命运掌握在自己手里——只要你够努力,你就能往上爬。
但问题恰恰出在这里。如果排名是可以通过努力改变的,那为什么来自贫困家庭、父母教育程度低的学生,排名总是靠后?
为什么重点中学的学生几乎全部来自中产以上家庭?为什么农村学生在高考中的劣势越来越大?答案很简单:努力本身是需要资源的。时间、金钱、信息、环境——这些资源不是均匀分布的。那个上海女孩之所以能每天学习十几个小时,是因为她的家庭承担了所有的经济成本和后勤支持。她的母亲可以接送她上补习班,她的父亲可以辅导她数学,她的家里有独立的书房。这些条件,一个农民工的孩子不可能拥有。
但排名的叙事掩盖了这一点。它把所有结果都归因于个人努力。你排第一,是因为你努力。你排倒数第一,是因为你不努力。这个叙事如此强大,以至于连那些被淘汰的学生自己也相信了。他们不抱怨制度,他们抱怨自己。
这就是中国版本的数字信仰:它把社会不平等转化为个人道德问题,就像智商测试把社会不平等转化为生物学问题一样。
现在我们来看中国高考制度的历史。高考的前身是科举。科举是什么?简单说,就是通过标准化考试选拔官员的制度。它从隋唐开始,到1905年废除,运行了一千三百年。
科举的核心逻辑是:不管你爹是谁,你考得好就能当官。这在当时是革命性的——它打破了门阀贵族对权力的垄断。但科举也有一个隐含的逻辑:考试分数可以衡量一个人的价值和能力。这个逻辑被现代高考完整继承下来。1952年,中华人民共和国建立全国统一高考制度。当时的设想是,通过统一考试公平地选拔人才,为国家建设服务。这个制度在文化大革命期间中断了十年,1977年恢复。
恢复高考是中国现代史上最重要的事件之一——它重新确立了“分数面前人人平等”的原则,给了无数普通人通过努力改变命运的希望。但“分数面前人人平等”和“智商面前人人平等”在逻辑上是同一个东西。它们都假设存在一个客观的、中立的衡量标准,可以根据这个标准公平地分配社会机会。它们都忽略了标准本身的社会建构性质。
高考考什么?考语文、数学、外语、文综或理综。这些科目是谁定的?为什么考这些不考别的?为什么数学比音乐重要?为什么外语比体育重要?
这些选择本身就是价值判断,它们反映了特定时期国家对社会成员能力的需求。1977年恢复高考时,国家需要的是能快速掌握现代科学技术知识的人才。所以数理化权重极高,“学好数理化,走遍天下都不怕”。到了1990年代,市场经济需要外语人才,英语权重上升。到了二十一世纪,综合能力被强调,素质教育写入政策文件。每一个阶段的考试内容变化,都是国家意志的体现,不是“客观能力”的发现。
这和智商测试的历史一模一样。比奈测的是巴黎小学生是否需要特殊教育,戈达德测的是移民是否“低能”,美军测的是新兵能否当军官——每一个阶段的测试内容,都服务于特定时期的社会筛选需求。
区别在于,智商测试在西方经历了从诊断工具到命运判决书的转变,而高考在中国从一开始就是命运判决书。重点学校制度把这个逻辑推到了极致。1953年,中国开始建立重点中学制度。当时的想法是集中有限资源培养急需人才。
这个制度在改革开放后迅速扩张,形成了从重点小学、重点初中、重点高中到重点大学的完整金字塔。每一层都有选拔考试,每一次考试都产生新的排名,每一个排名都决定下一阶段的机会。到了二十一世纪初,这个金字塔已经变成了一台精密的分层机器。一个孩子在六岁时参加的小学入学测试,可能影响他十八岁时能上什么大学,进而影响他一生的职业和收入。这不是智商测试那种“测一次定终身”,而是“测无数次定终身”——每一次测试都在加固前一次的结果。
但重点学校制度的厉害之处在于,它把分层包装成了择优。择优听起来很公平——最好的学生上最好的学校,这不是理所当然吗?问题在于,谁定义“最好”?用什么标准定义?标准是考试分数。考试分数是怎么来的?一部分来自天赋,一部分来自努力,但很大一部分来自家庭背景和资源投入。
当家庭背景和资源投入的差异被考试分数的名义抹去,结果看起来就完全是个体能力的差异了。这就是“量化分类”的中国版本。
它不像西方那样把人分成“天才”“正常”“低能”等离散类别,而是把人排列在一个连续的分数轴上,然后用录取分数线切出一道道门槛。一本线、二本线、三本线——这些分数线就是社会阶层的分界线。你越过哪条线,你就进入哪个阶层。
这个系统比西方的智商分类更精细,更动态,也更有欺骗性。它让你觉得,你离上一阶层只差几分,只要再努力一点就能跳过去。但实际上,那几分背后是巨大的资源差距,靠个人努力很难跨越。
现在我们要回到PISA。2009年上海PISA第一之后,这个结果被反复引用,用来证明中国教育体制的优越性。2012年上海再次参加,又是第一。
西方媒体从震惊转向反思,从反思转向学习。英国教育大臣跑到上海取经,美国一些学区开始引进上海数学教材。但很少有人注意到一个关键事实:参加PISA的上海学生,不是上海全体十五岁学生的随机样本。上海是一个拥有大量外来人口的移民城市。
根据当时的政策,大量农民工子女无法在上海参加中考,他们中的很多人到了初中阶段就被送回原籍就读。这意味着,PISA测试的样本实际上排除了上海教育体系中最弱势的群体。上海PISA的高分,部分来自统计样本的选择效应。
这不是说上海的教育质量不高。上海的教育质量确实很高。但“高”和“世界第一”之间是有距离的,这段距离的一部分是由统计方法填平的。
更重要的是,PISA测的是应用能力,不是机械记忆。上海学生在这方面的表现确实不错。但他们的高分是用什么换来的?
上海十五岁学生平均每天学习时间超过十三个小时,包括在校时间和课外补习时间。他们的近视率超过百分之八十。他们的抑郁和焦虑比例在青少年中持续上升。他们的创造力、好奇心和内在学习动机,在长期的应试训练中被系统性地磨损。
PISA分数高,但代价是童年的消失。这不是中国独有的问题。韩国、日本、新加坡都有类似的应试高压。但中国把它做到了极致。因为中国的人口基数大,竞争更激烈;
因为中国的社会安全网薄,教育是少数可靠的上升通道;因为中国的家长经历过匮乏,他们把所有的焦虑都投射到孩子的分数上。那个上海女孩的母亲说:“我不需要知道她的智商。分数就是她的价值。”
这句话的可怕之处在于,她说的是实话。在这个系统里,分数确实就是价值。你的兴趣不重要,你的性格不重要,你的创造力不重要,你的善良不重要——至少在决定你能否上好大学、找好工作时,这些东西都不如一个三位数重要。
这就是“命运技术”的中国版本。我在前面几章讲过,智商测试是一种命运技术——它把人的复杂潜能转化为单一数字标签,然后根据这个标签分配生命机会。中国的考试排名系统做的是一模一样的事情,只是它用的标签不是智商分数,而是考试分数。
而且中国的版本在某些方面更高效。首先,它的合法性更强。智商测试的合法性建立在科学权威上,科学权威是可以被质疑的——比奈被质疑过,伯特被质疑过,《钟形曲线》被质疑过。但高考的合法性建立在“公平”上,公平是一种道德价值,质疑公平等于质疑正义,这在道德上是不正确的。
其次,它的渗透更深。智商测试在美国主要影响特殊教育和一些高端就业,大多数美国人一生都不会做一次正式的智商测试。
但在中国,从小学到大学,每一个学生都要经历无数次排名。这些排名不是外部专家施加的,而是学校日常管理的一部分。它们像空气一样无处不在,以至于人们已经感觉不到它们的存在。
第三,它的反馈更密。智商测试是一次性的,或者几年一次。中国的考试排名是持续的,周考、月考、期中、期末,每一次都产生新的数字,每一次都在更新你的自我认知。你永远逃不开这些数字。它们贴在你的冰箱上,发在家长群里,记录在你的档案里。
但最关键的还不是这些。最关键的在于,中国的系统成功地让被筛选者接受了筛选标准。那个上海女孩不恨考试。她怕考试,但她不恨。她认为考试是必要的,排名是公平的,分数低是因为自己不够努力。当她考砸了,她惩罚自己——减少睡眠,取消娱乐,加倍做题。她不是在反抗系统,她是在适应系统。她以为自己在为未来奋斗,实际上她是在为系统的合法性续命。
这和智商测试的接受者一模一样。那些被贴上“低能”标签的人,大多数也接受了这个标签。
他们相信自己的失败是因为自己不够聪明,而不是因为测试不公平。这就是命运技术最成功的地方——它让受害者成为信仰者。现在我们要回到那个反直觉的判断:中国没有大规模使用智商测试,但它的教育筛选机制比任何智商测试都更彻底地把人分层。这个判断的证据已经摆出来了。
但还有一个更深的问题需要回答:为什么中国没有大规模使用智商测试?答案分几个层次。
第一个层次是历史的。中国在二十世纪初期接触过西方的智力测验。1910年代到1930年代,一批留美归来的中国心理学家试图将比奈量表和陆军甲种测验引入中国。他们在一些城市做了测试,发表了论文,甚至推动了短暂的教育测验运动。但这条路没有走下去。原因很多:战争打断了学术积累,新中国成立后心理学一度被批判为“资产阶级伪科学”,智商测试作为心理测量工具自然也靠边站。等到改革开放后心理学恢复,高考已经牢牢占据了教育筛选的核心位置,智商测试没有插入的空间。第二个层次是文化的。中国文化传统中对“聪明”的理解和西方不同。
西方智商测试传统强调抽象推理、逻辑能力,中国传统文化更看重记忆、勤奋和道德修养。“聪明”这个词在中文里,既指智力也指智慧,还指机灵和懂事。一个只会做题但不懂人情世故的人,中国人不会说他聪明。更重要的是,中国文化中对“学而知之”的信仰远强于“生而知之”。孔子说自己“非生而知之者,好古,敏以求之者也”。这个传统强调后天学习可以改变一切。智商测试那种“智力固定不变”的假设,在中国文化土壤里很难扎根。
第三个层次是制度的。高考已经完成了智商测试在美国想完成的所有功能——筛选、分层、分配机会。而且高考比智商测试更好用:它的内容可以根据国家需要调整,它的难度可以根据录取率调整,它的公平性可以靠统一命题、统一阅卷来保障。一个制度如果已经够用了,就没有动力引入另一个功能相同但风险更大的制度。
所以中国没有选择智商测试,不是因为它不相信数字可以定义人,而是因为它已经有了更好的数字工具。这个“更好”是带引号的。现在我想请你做一个思想实验。
假设你是2009年的一个美国教育政策制定者。你刚刚看到上海PISA第一的消息。你的选民在问:为什么中国孩子比我们的孩子考得好?你的选择是什么?选项A:增加教育投入,改善贫困学区,缩小资源差距。选项B:引进中国式的考试排名系统,用分数逼着学生努力。选项C:什么都不做,告诉选民PISA分数不代表一切。
现实中的选择是什么?大多数西方国家选择了某种形式的A加B。他们增加了一些教育投入,同时加强了标准化考试。美国通过了“不让一个孩子掉队”法案和后来的“共同核心标准”,英国引入了更严格的学校评估体系。PISA冲击波推动了一轮全球性的教育“改革”,改革的方向几乎都是向中国模式靠拢——更多考试,更多排名,更多问责。
这就是我要说的最后一个关键点:当西方观察者为中国PISA高分感到恐慌时,他们忽略了一个事实——他们正在把自己变成自己恐惧的对象。
智商测试在西方经历了百年的批判,从比奈的警告到李普曼的揭露,从古尔德的拆穿到《钟形曲线》的争议,至少有一部分人已经认识到,用一个数字定义一个人的价值是危险的。但考试排名是另一种数字定义——它看起来更公平,更动态,更不涉及种族和基因,所以它的危险性更容易被忽视。中国模式正在反向输出一种新的数字命运技术。
这种技术不叫智商测试,但它的核心逻辑和智商测试完全一致:产生一个数字,赋予它神圣性,用它来分配命运。当亚马逊在2018年悄悄废弃一套用人工智能筛选求职者简历的系统时,这个逻辑已经进入了算法时代。算法不问你智商多少,它也不问你高考分数多少,它直接从你的简历和行为数据中提取特征,生成一个录用建议分数。这个分数比智商测试更黑箱,比高考排名更不透明,但它同样在决定你的命运。
那个上海女孩现在应该已经大学毕业了。她可能找到了一份工作,可能正在准备考研,可能已经结婚生子。她冰箱上的成绩单早就撕掉了,但那些数字并没有消失。
它们变成了她的简历上的学校名称,变成了她的第一份工作的起薪,变成了她在相亲市场上的“条件”。她从分数的囚笼里走出来,走进了另一个数字的囚笼。她的母亲说:“我不需要知道她的智商。”
她说得对。在这个世界上,有太多东西可以替代智商。任何被社会赋予神圣性的数字,都可以扮演命运判决书的角色。关键是信仰,不是工具。
2010年12月,OECD公布了2009年PISA测试的完整报告。上海在阅读素养、数学素养和科学素养三个领域全部排名第一。这个消息在中国的反应和西方完全不同。中国媒体当然报道了,但语气是平静的,甚至有点理所当然。上海教育部门开了新闻发布会,说这是上海基础教育改革成果的体现。没有人上街庆祝,没有人放烟花。对中国人来说,考试第一是正常的,考第二才是新闻。
但在平静的表面下,一些东西正在凝固。教育部门开始研究上海经验,准备向全国推广。培训机构把PISA第一做成广告,证明他们的教学法有效。家长们更加确信,高压训练是成功的唯一道路。那个冰箱上的成绩单,变成了国家荣誉的象征。一个数字,从冰箱门走到了世界舞台,最后又回到冰箱门。它经过了国际比较、政策辩论和媒体放大,但它最终落下的地方,还是那个十三岁女孩的日常生活。
她每天放学回家,第一眼看见的还是那张表格。表格上的数字可能变了,也可能没变。但不变的是,这些数字在告诉她:你的价值,可以用一个数字来定义。她相信了。她的母亲相信了。整个社会都相信了。这就是上海PISA第一的真正遗产。不是教育方法的胜利,而是数字信仰的全球化扩散。
中国没有复制西方的智商测试,但它用自己的方式完成了同样的事情——把人的复杂潜能压缩成简单数字,然后让每个人都相信,这个数字就是他们的命运。当这个信念从一个社会的共识变成全球共识时,智商神话就完成了它的终极变形。它不再需要比奈量表,不再需要斯坦福-比奈智力量表,不再需要韦氏智力测验。它只需要一个数字,任何一个数字,只要这个数字被足够多的人信仰。冰箱门上的成绩单,就是二十一世纪的智商测试。
而在大洋彼岸,另一种数字正在被制造出来。它不叫考试分数,不叫智商,它叫算法评分。它藏在亚马逊的人力资源系统里,藏在谷歌的招聘筛选器里,藏在越来越多的自动决策程序里。
它比考试排名更隐蔽,比智商测试更不透明。当中国的家长们还在冰箱上贴成绩单时,硅谷的工程师们已经把命运判决书写进了代码。这两种数字看起来毫无关系。但它们共享同一个祖先——那个一百多年前在巴黎比奈实验室里诞生的想法:人的价值可以被测量,被计算,被排序。这个想法从巴黎走到埃利斯岛,从埃利斯岛走到美国军营,从军营走到白宫,从白宫走到上海浦东的某间厨房,现在它正在走进每一部智能手机的处理器。数字没有国界。信仰也没有。