第 28 章
科举的远亲
北京东城区一所民办小学门外,家长队伍一直排到马路牙子边。那年是2013年初夏。校门只开了一条缝,每次放进去一个孩子。外面的人不走,手机举着,屏幕亮成一小片一小片。论坛里一套图形推理题被翻来覆去地讨论:给出一串递增的圆点,问下一个该是什么。有人在底下教口诀,有人贴出更难的变体,有人抱怨今年题型变了。几百楼刷过去,没有一个人说这件事本身有什么不对。
隔着一整个太平洋,1920年代的纽约书店里也有类似的队伍。中产家庭的父母在抢购一本薄薄的测验指南。当时美国学校刚开始用智商测试分班,家长们闻风而动,书店门口挤满了打听消息的人。买到的人回家连夜翻,没买到的人托人抄。他们也不怀疑测验本身。他们只想让孩子在量尺上往前蹿一蹿。
两个画面相距九十多年,看起来像同一出戏换了舞台布景。但中国版本里多了一层东西。纽约的父母相信一种新科学。北京的父母没听过比奈,也不管常模怎么算,他们只看见一道门,门里是一所好学校。
他们讨论图形推理,不是因为心理学,而是因为他们的祖父辈也这样讨论过八股文的破题。考试改变命运,这件事不需要翻译。问题于是摆到眼前。为什么标准化量尺在中国显得如此自然?为什么上一章里那些屏幕背后的算法标签,进中国校园时几乎没有遇到抵抗?要回答,不能只盯着最近十年的智慧教育。得往回看一套比西方心理测量学古老得多的东西。
科举。别急着想象成教科书里的制度沿革。我要谈的不是科举怎么考、考什么、哪些人中了。我要谈的是科举留下的一种结构。这个结构到今天还在用,只是题目从四书五经换成了图形推理。
科举和智商测试的关系,不是比方,是结构性的亲缘。两者都做同一件事:用一套标准化量尺把人分等,再按等级分配稀缺的社会资源。八股文和图形推理,测得东西不同,功能却完全一样。关键不在题目内容,在于尺子本身。尺子一旦立起来,所有人就不再问它量得准不准,只问自己在尺子上站多高。这里要区分两个词:公平和准确。公平问的是,同样条件下是不是人人被同样对待。
准确问的是,这东西量的究竟是不是它声称要量的东西。科举时代,人们把公平放在准确前面。八股文到底能不能衡量治国才能,一直有人怀疑,朝廷里也不乏改革呼声。但科举不靠准确立身。它靠的是规则统一:同一场考试,同一套题,同一个标准。考生可以怨恨自己没考好,却很难说制度偏心。于是落榜的痛苦由个人消化,制度的合法性反而在一次次淘汰中被加固。
智商测试在中国社会里接过的正是这套逻辑。家长要的首先是公平,其次才是准确。一个六岁孩子在图形推理题上的表现,到底能不能预测他将来是否能读好书,其实没人真正关心。人们关心的是,既然学校用这套题筛人,我的孩子有没有练过。这套题是否科学,成了最不重要的事情。
也许有人反驳说,智商测试终究不是八股文。它背后有心理学理论,有统计基础,测的是真实且稳定的认知能力,对学业和职业表现有预测效度。被广泛采用,是理性选择。这个反驳不无道理。智商测试的分数的确和某些表现存在相关。但我们不妨把同样的逻辑套回科举。
科举也有它的“预测效度”。它能预测一个人是否熟悉经义、是否掌握文章程式、是否能在压力和时间限制下写出符合规范的答卷。这些能力在当时也真实存在。问题在于,当一种测量工具成为分配社会资源的主闸门,测量效度就不再有资格单独为制度辩护。它测出了某些东西,却漏掉更多东西。而社会一旦接受了这套尺子,逐渐会把“在尺子上得分高”当成“这个人更有资格”的全部理由。预测效度还在,但分配后果已经溢出了科学能解释的范围。
这就是命运技术的特征。命运技术不是某一份试卷。它是把复杂的人转化为单一数字标签,再据此分配生命机会的一整套装置。科举是最早的版本之一。它把一个人的漫长教育、家庭出身、个人努力和偶然际遇,压缩成一个功名等级。
中与不中,把这个等级钉进一个人的一生。智商测试是近代版本。它把认知能力压缩成一个商数,再让这个商数去决定分班、升学、就业。工具不同,动作相同。科举的量化分类,也是智商测试量化分类的历史先例。
童生、秀才、举人、进士,这些名目不是荣誉称号,是资源分配的钥匙。进了哪一等,就能打开哪一扇门。天才、正常、低能,这些名目也不是心理学结论,是教育机会的闸门。把人放进哪一栏,哪一栏就会反过来决定他接下来能看见什么。分类的动作在先,分类的理由后来才补上。这正是科举和智商测试都擅长的事。
1905年科举废除。很多人以为考试改变命运的信仰会跟着一起退场。事实恰恰相反。废除科举后,中国社会对公平量尺的渴望没有消失,而是迅速转移到新式考试上。旧尺子断了,新尺子必须立起来,否则没人知道该怎么分配学堂名额、留学机会和官职。这个渴望不是科学带来的,是结构带来的。一个资源稀缺、人口众多的社会,总得有一种看起来公平的分配方式。
考试,至少比门第和人情显得可靠。20世纪80年代恢复高考,整个社会几乎没有学习成本就接住了这套规则。大家都听懂了:分数面前人人平等。一个农村孩子可以凭成绩进大学,这在当时是极大的解放。高校重新成为公平上升的通道。
但这一套叙事的背面,是把结构性差异藏进个人努力。城乡学校之间天差地别的师资和资源,并没有出现在考卷上。考卷只问你会不会做那道题。会做,你就是努力的,聪明的,值得的。不会做,你只能怪自己。统一的尺子把所有的差异抹成了个人的分数差异。
然后是90年代奥数热。原本属于极少数人的数学竞赛,被改造成升学敲门砖。重点中学不能公开考试招生,奥数成绩就成了替代尺子。家长送孩子学奥数,不是因为热爱数学,是因为别人都在学。这股热的真正驱动,不是数学教育,而是第二次筛选。学校需要区分度,家长需要确定性,培训机构需要市场。三者一拍即合。官方一再降温,但家长跑得更快。
因为只要那根量尺在,谁先停下来谁吃亏。2000年代公务员考试热,是科举记忆最直接的复活。数百万考生涌向同一个入口,争夺数量有限的岗位。行政能力测试里满是数字推理、图形推演和言语理解。这些题目不考察专业知识,只考察所谓通用能力。它和智商测试的亲缘,几乎一眼就能看出来。
年轻人并不追问这套题与真实工作能力有多大关系。他们只知道这是一道门,门里是稳定体面的生活。考不上,是自己刷题不够。再到2010年代,幼升小面试中出现了图形推理题。量尺终于伸到了六岁孩子头上。国际学校用类似智商测试的题目筛选生源,民办小学跟进,家长论坛变成题库黑市。三岁孩子上思维训练班,四岁学分类,五岁练数列。培训机构卖的不是数学,是模拟面试。教育竞争的前置,把幼儿园变成了备考现场。表面上,这是焦虑的家长在抢跑。往深处看,这是科举结构在现代市场的复燃。
为什么这套结构在中国如此畅通?光用文化传统解释不够。文化只提供了“考试改变命运”的老脚本,真正的推动力量来自产业结构、制度安排和关键主体的选择。
先说产业结构。标准化量尺最大的优势,是便宜。一个经济发展中、人口规模巨大的社会,需要在极短时间内把大量人口分到不同学校和岗位。统一考试是最低成本的方案。它不需要逐一面试,不需要长期观察,只需要一张卷子和一个分数。
企业面对成堆简历,第一眼看学历,第二眼看证书。教育系统面对数千万学生,靠分数线分配名额。劳动力市场需要信号,家庭需要确认投资,政府需要公平秩序。三方都要一个简单、透明、可量化的工具。这正是标准化考试长盛不衰的经济基础。
古巴在2011年提交古共六大审议的《经济社会政策方针》草案里算过一笔账:1998年至2008年,16次飓风造成206.64亿美元损失,严重旱灾损失13.5亿美元,加上美国持续近半个世纪的经济、金融和贸易封锁导致的上千亿美元损失,不改革原有体制,国家经济有崩溃危险。这份文件给出的方向,是在基本生产资料社会主义全民所有制基础上,调整经济结构,提高资源配置效率。为什么要提古巴?因为它把问题说穿了:资源极度紧张时,社会只能选择最节省、最标准化的分配方式。统一量尺未必最好,但最不坏。中国的考试逻辑也一样。资源少,人多,时间紧。与其花大成本甄别每一个人的潜能,不如让所有人面对同一张卷子。
公平和效率,在这种条件下被压成了同一个词。次说制度安排。恢复高考之后,教育与就业之间形成了一条稳定的线:分数到手,文凭到手,工作就有盼头。此后几十年,高考、考研、公考、考编,一轮接一轮。考试不仅是学校的事,也成了政府管理社会流动的基础设施。它把上升通道显性化,让每个阶层都看到一条路。路上挤了多少人另说,至少路在那里。这个制度惯性一旦形成,任何试图削弱考试的改革都举步维艰。因此,当智慧教育系统带着人脸识别、课堂行为分析和自适应测评进入校园时,制度没有理由排斥它。它只是把纸笔考试的尺子换成了更细的数码尺子。
再说关键主体。政府需要一套公平排序来维持社会流动的可预期性。学校需要一套标准来证明录取没有暗箱。企业需要一纸文凭和一份测评分数来降低招聘成本。培训机构需要考试焦虑来卖课。家长需要一个明确目标来安放教育投资。五方各取所需。哪怕有人意识到这套尺子太机械,也会发现利益网络已经盘根错节。批评尺子,等于批评所有人正在玩的游戏。
于是批评声变得很小,最后淹没在抢题和报班的热闹里。这里就出现了一个反讽。西方社会从20世纪下半叶开始反复检讨智商测试的文化偏见和阶层偏向,一些地方限制在招生中使用单一测验分数。
而中国在同一时期加速拥抱各种认知测评,从国际学校入学筛选到企业校招的在线笔试,再到婚恋市场里的智商匹配服务。国际学校收生时,拿一张类似智商测试的评估表;毕业生求职时,先要过一套认知能力测评;年轻人相亲,简介里甚至写上测评等级。
中国不是不知道西方的批评,而是根本不需要那些批评。因为在中国,这些工具从来不是以科学的面目出现。它们以“新科举”的面目出现。新科举这个说法,不是要抹黑高考。高考在当代中国的确提供了大规模社会流动的通道,这是的。但正因为这条通道太重要,所有想复制它功能的东西,都会获得某种自动的正当性。智商测试及其数字变体,在中国不需要证明自己测量了什么。它只需要让人相信,这次考试也很公平,也能改变命运。于是量尺越来越密,越来越早。
当量尺从考场搬进手机,它就不是一年一次的纸笔测验了。孩子在屏幕前每答一道题,系统记下点击速度、犹豫时长、修改次数。下课回家,打开软件,题目难度自动调整。家长只看见孩子在练习。后台已经生成一条认知能力曲线。这条曲线会在教师端显示为等级,在升学系统里显示为标签。孩子自己说不清哪一次迟疑被记了下来。他只知道要做到系统说“不错”。可系统很少让他真的不错。因为不错的定义会随着曲线自动抬高。
这其实就是命运技术的升级版。它不再需要心理学家坐在对面,不再需要一张量表和一间专门的测验室。它把分类嵌进日常学习。你不觉得在被测,但每一刻都在被测。那个分数一直更新,从未定型,却比定型更麻烦。传统智商测试好歹还给你一个数字。数字出来,你可以问一问它是什么意思。现在你根本看不到完整数字。系统只把结果拆成下次题目难度、班级排名和推荐标签。你无法拿着一个具体分数去申诉。
为什么这套东西在中国推进得这么快?因为标准化的老习惯,早在科举时代就已经把中国人训练好了。
2011年4月,哈瓦那的会议室里,吊扇慢慢转,风只把纸角掀起来一点。桌上摆着准备提交古共六大的《经济社会政策方针》草案。翻到“自然灾害与外部冲击”那一页,几个数字并排躺在一起:1998年至2008年,16次飓风造成206.64亿美元损失,严重旱灾再添13.5亿美元。有人用铅笔在数字旁边点了一下,没说话。
封锁带来的账更不好算,写成长长一行,后面是望不到头的零。屋里的人清楚,这不是开会追究责任的时候。他们要决定的是,在水泥不够、燃油不够、外汇更不够的情况下,先修哪段路,先保哪所学校,先把有限的培训名额给哪个省的青年。这个决定不能靠人情,人情会当场吵起来;也不能靠一个个慢慢谈,时间等不起。
最不容易翻脸的方法,是把条件列死,谁够格谁上。古巴草案后来反复提到的“提高资源配置效率”,听上去很干,其实是这种紧日子逼出来的。把视线拉回中国,问题变得清楚一些。
中国没有那一串飓风账本,却另有自己的紧:好学校少,好岗位少,能让一个家庭看见上升的位置更少。想往上走的人多到数不过来。社会没有时间把每个人单独认一遍,只能铺开一张大网。网眼要统一,落下要快,还要让被筛掉的人说不出太多话。考试就是这张网。它未必能把人放进最合适的格子里,但它保证每个落下去的人,都只能把原因归到自己头上。
这张网不是今天才有的。答案要追溯到一套比西方心理测量学古老得多的传统——科举制度。这里不讲科举怎么出题、怎么阅卷。只看一个动作:发榜。榜贴出来,名字按等级排好。县衙门口的人先找自己的名字,再看名字在第几列。第几列决定他下一步进哪个门。
这个动作重复了几百年,把中国人的神经训练成一种条件反射:不是先信了考试再去看榜,而是先学会了看榜,才把考试当成天经地义。八股文考什么内容已经不重要。重要的是,同一张榜能把不同州县、不同口音、不同家底的人,放进同一套谁都能看见的等级里。落榜的人会蹲在墙根抽旱烟,会连夜收拾行李回村,却不会去撕那张榜。榜没有错。错的是自己没把破题写对。
1905年废掉科举。旧榜忽然不贴了。可等候榜单的人还在。新式学堂的招生告示补上这个空位。学堂门口照样排着人。懂新学问的先生也不多,有些地方考试只考国文、算学,有些加问地理,题目不统一,但“进门前先考一场”这个动作没有断。因为学堂少,想进去的人多,不考反而没法交代。后来官费留学名额更少,只能先考一轮。考出来的人未必最适合出洋,但至少没考上的不好再争。废科举废掉的是四书五经和功名名目,废不掉刻在社会神经里的那个公式:一次公开考试,换一个公开资格,再换一条可预期的路。
这个公式到了20世纪80年代被重新点亮。县一中教室的煤油灯下,一个农村考生在抄题。他不一定知道什么常模、标准差,但他知道总分高一分,可能就从农村户口变成城镇户口。县招办门口贴着分数线,像多年前县学门外那张榜。人们围上去看,也没有人问这些题能不能考出真才实学。题目当然不能完全考出来。
可没有这张卷子,他怎么和县城干部的儿子站在同一道线前比较?所以他感激这张卷子。感激到不会追着问:为什么自己的村里没有像样的英语老师,城里孩子却能天天听广播讲座。卷子不回答这些问题。卷子只认分数。分数给他机会,也给他一个现成解释:如果没考好,是自己不够用功。这个解释很顺手。顺手到能把学校差距、家庭差距、地区差距,一个个从公共讨论里悄悄抹掉。
但抹掉不等于消失。它转到暗处,变成了尺子上的刻度。90年代奥数热起来时,重点中学不能公开考试,奥数成绩成了替代量尺。
孩子们背着比书包还重的习题集,在少年宫门口排队。家长等在外面,互相交换模拟题。数学老师被请来开小班。有人说奥数能开发思维,有人说不能。
但真正推动这件事的,是学校需要区分度,家长需要确定性,培训机构需要流水。三者都不想承认自己在制造一个更细的筛子。他们都说,是为了孩子。
2000年代,公务员考试把这个筛子搬到成人世界。行政能力测试里的图形推理和数字推演,并不考察具体业务知识。它考的是一种在限定时间内快速识别规律的能力。年轻考生不追问这份能力与将来写材料、下基层有多大关系。他们知道这是一道门。门里有编制,有稳定,有父母点头。考不上,只能自己继续刷题。
量尺在2010年代伸向更小的孩子。北京东城区那所民办小学的等候区里,六岁的孩子坐在塑料椅上,脚还够不着地。老师叫名字,他跳下来,跟着走进教室。教室里的题目印在彩色纸上,有一串圆点,有缺一角的方块。孩子不知道这其实是某种认知测评的变体。他只当是个游戏,还抬头对老师笑了笑。老师没有笑,只把平板电脑拿出来,开始记录作答时间。这个记录不会只停在这一张卷子上。它会跟着孩子进入下一轮面试,进入分班名单,进入学校数据系统。家长在门外等,手机里存着从论坛下载的“图形推理三十练”。他们不关心这些题目背后的心理学假设。他们只关心今年的题型有没有变,有没有新的口诀。
不同的人,在不同的楼层里,维护着同一把尺子。北京中关村一栋写字楼里,培训机构的课程顾问正给家长回消息。她面前的话术表上用红色标着“逻辑思维弱”,黄颜色标着“空间想象需强化”。她没有见过那个孩子,也不懂常模怎么换算。她只知道测评系统吐出一份报告,报告显示孩子某项低于同龄人百分之二十七。她的工作不是解释这个百分比,而是让家长觉得这件事很急。她打字:“现在不补,三年级更吃力。”家长回了三个惊叹号。隔天报了一期八千块的班。
深圳一家企业的人力资源部,系统先把在线测评分数排成五档。HR只点开前两档,后面的简历没有机会被下载。她不觉得自己在歧视。她只会说,人太多,总得有个标准。这个标准不是她定的,是总部统一采购的测评系统。系统商说,这是认知能力,能预测绩效。她没有时间验证。她今天要筛完一百二十份。
上海一所国际学校的招生官也知道这套题的西方批评史:文化偏见、语言依赖、阶层倾向,论文能列出半米高。但他们仍然用。家长要看结果,申请材料又多,一页标准化评估表能挡住大部分争吵。招生官承认,这不是完美的尺子,只是最像尺子的东西。夜里,一家婚恋平台的产品经理在后台看数据。他们新上线了“认知默契测评”,用户做完三十道题,系统给出智力风格标签,匹配时自动加权。他不觉得荒唐。用户需要筛选,平台需要活跃,投资人需要故事。三十道题能不能代表一个人,那不在路演PPT里。
这些人彼此不认识,也没有串通。他们只是各自选了最顺手的工具。把他们连在一起的,不是对心理测量学的信仰,而是对“公平可量化”的依赖。有人想批评,却找不到一个具体的对象。家长怪学校,学校怪系统,系统怪市场,市场怪家长焦虑。每一方都觉得自己只是被推着走。正因为如此,智商测试在中国的批评很难生根。它不像在西方,先被当成一套科学主张,再被用于分配。它在中国首先是一道门。门不需要科学,只需要开和关。门是木头的还是算法的,没人在乎。
更麻烦的是,数码尺子比纸尺子更难反抗。纸上的分数可以撕掉,可以藏起来,可以找老师核对。算法里的标签不给看。它只在后台流动,却会在下一次分班、下一个推荐、下一场面试时突然起作用。它不写“你不够聪明”,只让你发觉自己能选的选项在变少。
这时,北京东城区那所民办小学外面的队伍已经短了下来。铁门重新拉开半扇,斜阳照进等候区,把彩色塑胶地面晒得发白。保安把警戒线往回收。门口安静了一小会儿。后面的教室里还有孩子在作答,铅笔划过纸面的声音很轻,几乎被窗外车流盖住。一个家长把手机塞回口袋,伸着脖子往门里看。没有人说话。只有风把台阶上的宣传单吹得翻了个面。
大家不觉得“用一道题决定未来”有什么奇怪。在很长时间里,这甚至被当作善意的进步。确实,相对于任人唯亲,统一考试是进步。相对于毫无规则,看分数是进步。但这个进步自带一个代价:它把人变成分数,又把分数变成命运。当西方国家开始置疑这把尺子的时候,中国还在给尺子加码。这不是谁更聪明的问题,是历史起点不同。
现在,有必要说回那个北京孩子。他从考场里出来了。教室外面阳光很亮。书包带从一边肩上滑下来,他没有去扶。他走得慢,不是因为心情沉重,是因为累了。
母亲迎上去,问题目难不难。他说还行。他其实不知道题目为什么那样出,也不知道那条递增的圆点到底要选哪一个。他只知道做完了。母亲也没有再问。
她看见孩子脸色平静,心里稍稍松了一点。可她不知道,在另一个屏幕上,孩子的作答轨迹已经被拆成几项指标,分数正在生成。那个分数会跟着他,进下一轮面试,进分班系统,进某个数据库。它会决定他将来能不能进某个系统。他还不理解这些。他回头看了一眼教学楼。
门还开着,里面还有别的孩子在等。母亲说,走吧。他点点头,拉住母亲的手,走出校门。外面的车流声很大。没有人注意到一个刚做完图形推理题的六岁孩子。但他的档案里,已经多了一行数字。这一行数字比他今天说过的任何话都更响亮。他还没有学会阅读它,更不用说反驳它。可这行数字已经开始替他回答一个问题:你是谁。他迟早会感到,那个答案太窄了,窄得装不下他真正的生活。到那时候,他会抬头问一问,除了这个数字,我还能是谁。