第 27 章

屏幕上的量尺

2015年秋天,美国一个大型学区把一套自适应数学平台装进了几十所中学的教室。同一周,学区教育委员会还在官网上发布了一条新闻,标题带着“个性化学习”四个字。配图里,学生们戴着耳机,面对屏幕,表情专注。没有一张图拍下背后的仪表盘。

仪表盘上有什么?每个学生名字后面,都跟着一个数字。这个数字叫“能力估值”。它每小时刷新,甚至每分钟刷新。学生点下一道题,它动一下;答错了,它再动一下;犹豫了十九秒才点选项,它又动一下。学期初,系统用二十道题给每个人定了个起点。起点在年级水平线以下的学生,接下来的题目就自动下调难度。

一个学期之后,教师调出班级分布图,发现被系统判定为“低能力”的那一组,接触的数学内容,已经比“高能力”一组落后了两个年级。这里没有一张诊断书,没有一间测验室,没有一个心理学家拿着秒表坐在对面。可是分类已经完成了。

这听起来像科幻,又像老故事。说它像科幻,是因为屏幕、算法、实时刷新这些词很新。

说它像老故事,是因为“用二十道题给人定个起点,然后按这个起点分配学习机会”这件事,我们前面已经见过太多次了。今天这一讲,我们就把这层屏幕掀开,看看里面那台看不见的量尺,究竟是怎么运转的。

先解决一个很容易被忽略的问题:自适应学习平台、教育数据挖掘、AI辅导系统,这些东西是什么时候大规模进入学校的?答案不是某一年,而是一个很短的窗口期。2010年代以后,美国、欧洲、中国的教育科技市场同时膨胀。一批做自适应学习的公司拿到风险投资,把产品卖进公立学校。卖点很一致:精准诊断每个学生的学习能力,推送个性化内容,实现因材施教。

“因材施教”这四个字很动人。谁不希望自己的孩子被当作一个独特的个体来教?谁不希望老师不用再一个人面对四十个水平参差不齐的学生?这个承诺,让许多学区愿意把预算拨给屏幕和软件。

但我们要追问的,不是“因材施教”这个愿望好不好,而是“材”是怎么被判断出来的。打开这些平台的底层逻辑,你会看到一个熟悉的影子。

系统通过学生在屏幕上的点击速度、答题正确率和停留时间,实时计算出一个类似智商分数的“能力估值”,然后据此决定推送什么难度的题目。点击速度,就是鼠标从这道题跳到下一道题有多快。答题正确率,不用解释。停留时间,是学生在一道题上犹豫了多久。这些行为痕迹合在一起,变成了一个数字。

这个数字不是一次纸笔测验的结果。它不要求学生坐在考场里,不要求统一的测验时间,甚至不要求学生知道自己正在被测量。它持续更新,不断细化。学生在数学课上每点一次鼠标,这个估值就悄悄挪动一点。

所以问题来了:这个数字,和智商分数有什么不同?表面上看,很不同。智商测试是一年一次、甚至一辈子只做几次的事。算法估值是实时的。智商测试有明确的测验场景,学生知道自己在被考。算法估值是隐蔽的,学生以为自己在做练习。智商测试的结果是一张报告,算法估值的结果是一条永远在变动的曲线。

但仔细看,它们有同一个内核:把人简化为一个单一数字,然后根据这个数字分配学习机会。这就叫量化标签。

什么是量化标签?说白了,就是把人简化成一个分数或排名,用来定义他的价值和未来。它常常让被贴标签的人,慢慢把这种判断当成自己本来的样子。

上一章我们讲脑成像的时候,提到过一个词:命运技术。它指的是这样一种社会技术装置:将人丰富多样的潜能压缩成单一的数字标签,再依据这个标签来配置生命机会。现在屏幕上的这个能力估值,就是命运技术的最新形态。它不再用纸笔,不再用脑图,它用你的每一次点击。

我们需要认真对待一个最强有力的反驳。这个反驳不是来自某个反科技的人,而是来自智力量表的捍卫者。他们会说:智商测试虽然历史上被滥用过,但它的核心测量的是真实且稳定的认知能力,也就是所谓的g因子。这个g因子对个体和群体差异有预测效度,所以智商测试被广泛采用,不是歧视,而是理性选择。这个说法很硬。它承认历史上有滥用,但坚持核心测量是真实的。

如果这个说法成立,那么算法估值只要能近似g因子,它在屏幕上做能力分层,有什么错?我不能用一句“这都是偏见”来打发它。我们得看证据。

第一条证据:这些自适应平台的初始估值,是怎么来的?答案往往是一组标准化题目。这些题目的大规模常模数据,有一部分就是从传统智商测试和标准化考试的题库那里继承来的。平台公司不会明说“我们在测智商”,但它们的技术文档里会写“项目反应理论”“认知诊断模型”。这些名词背后的统计思路,和当年把比奈量表变成智商数字的思路,高度一致。

第二条证据:系统更新的依据,是行为痕迹。点击速度、停留时间、答题正确率,这三样东西,哪一样不是被家庭环境、数字设备熟练度、母语背景、焦虑水平影响?一个家里没有电脑、第一次在学校摸到平板的学生,和一个从小玩游戏的学生,点击速度天然不同。一个英语学习者的停留时间,可能不是“能力低”,而是在脑子里做语言转换。系统不知道这些。系统只看到秒数和正确率。

第三条证据,也是最关键的:系统把测量和教学绑在了一起。传统智商测试有个特点:测完了,分数摆在桌上,你可以争辩,可以重测。算法估值不给你这个机会。

它每时每刻都在更新,题目难度跟着估值走。学生越做越简单,系统越确认他能力低。学生越做越难,系统越确认他能力高。这是一个自我强化的循环。

这条循环是怎么转起来的?假设一个三年级学生,在开学第一周,因为对电脑操作不熟,初始测试的正确率很低。系统把他的能力估值定在一年级水平。接下来,系统推给他的题目,就是一年级难度。这个学生做得轻松了,点击也快了,系统记录到“正确率高、速度正常”,于是把估值稳定在一年级水平附近。半年后,教师在课堂上发现,这个学生的数学理解力并不差。但屏幕上,他每天接收的练习,都是低于年级水平的内容。系统没有说他笨,系统只是每天给他更简单的题。这个差别,比直接说他笨更麻烦。因为它是沉默的,是自动的,是不需要任何人签字的。

这就是数字平台带给量化分类的新特点:分类无处不在。前面几章里,量化分类是要有场景的。移民检查站、学校测验、军队筛选,都是一个有具体地点、具体时间的事件。分类完成之后,人会离开那个场景。

数字平台把这个场景消解了。学生进入教室,分类就开始了;学生回家做作业,分类还在继续;学生周末补课,分类也在继续。屏幕在哪里,分类就到哪里。

我们再把镜头从美国这个学区,拉远一点,看另一个地方。2010年代,中国开始大力推动“智慧教育”。这个词很大,里面包含很多东西。其中一块,是让技术进入课堂,辅助教学管理。一些学校引入了人脸识别系统,用来记录学生出勤;一些课堂安装了行为分析系统,用摄像头捕捉学生的抬头率、表情和动作;还有一些学习平台,记录学生的答题时间、正确率、错题类型。

这些技术各有不同,但背后的逻辑,和美国的自适应学习平台殊途同归:把教育过程变成可计算的能力数据。一个人在课堂上的注意力、情绪和反应速度,被摄像头和算法转译成数据。数据被汇总、排序、比较。有些系统会给学生打出“专注度分数”,有些会给课堂表现排序。

这些分数和排序,可能不会直接叫“智商”,但它们承载的功能,和智商分数是同一个:定义这个学生是什么样的学习者,然后影响他接下来得到什么。这里要小心,不要写成技术恐怖故事。中国智慧教育的推动者,有一大批是真心想把教育做好的人。中国家长对“精准了解孩子”的需求,也很强烈。问题不在某个人坏,而在技术逻辑本身。

当摄像头和算法成为判断学生的工具时,它天然会偏好那些容易被量化的表现:坐得直不直、抬头率高不高、答题快不快。那些不容易被量化的东西——好奇心、想象力、对一道题长时间沉思的能力——就很容易被系统判为低效甚至低能。

这又把我们带回到“g因子”那个反驳。如果g因子是真实且稳定的认知能力,那么算法用行为痕迹逼近它,是不是也可以?如果这个逼近是有效的,那么量化分类就是客观的,我们只能接受。但我们前面看到的是,算法估值的输入端,混杂了大量非认知因素。它的更新机制,又会把初期误差放大成长期轨道。它不是g因子的中立测量器。

它是把行为痕迹转译成能力数字,再把这个数字塞回学生每天的学习路径里,让路径反过来证明数字正确。用个现代比喻:这就像导航软件根据你第一次上路的车速,给你定了“慢司机”的标签。之后每次规划路线,都给你走慢车道。你在慢车道上开得稳,系统就说:看,他果然是慢司机。它不会告诉你,你第一次上路那天,车胎是漏气的。

这就是屏幕上的量尺最隐蔽的地方。传统智商测试,好歹还有个测试者和被测试者的关系。被测试者知道,自己在做一个评估。他可以紧张,可以质疑,可以要求重测。数字平台的算法估值,取消了这种关系。学生面对的是屏幕,屏幕后面的算法没有面孔。学生甚至不知道,自己每点一下鼠标,都在为自己未来的课程内容投票。

现在来谈那个最让人不安的词:永久记录。在纸笔时代,一个三年级学生的测验成绩,会存放在档案袋里。老师会写评语,家长会签字。几年之后,档案可能被归档,新的老师未必会翻旧账。更重要的是,人有重测的机会。一次考试成绩不好,下次可以再考。

智商测试虽然也被说成稳定,但实践中,学生可以重新评估,分数可以变化。数字平台不一样。算法标签因为实时更新,反而显得客观。它不像一次考试那样有具体日期,它是持续的、累积的、自动记录的。一个学生在三年级时被算法判定为数学能力低下,这个标签可能跟随他直到高中,影响每一年的课程推荐和教师期望。

这里不是猜测。这是数字教育平台的技术架构决定的。这些系统必须保存历史记录,才能计算“成长曲线”。一个学生的全部点击轨迹、作答记录、停留时长,都被保存在服务器上。系统根据这些历史数据,预测他下一次应该看什么题。这个预测,会变成课程推荐。课程推荐,会变成教师看到的仪表盘。仪表盘上的数字,会变成教师对这个学生的预期。

教师也是人。如果一个教师每天打开系统,看到一个学生的能力估值一直低于年级水平,他很难不受影响。哪怕他嘴上不说,他布置的题目、课堂上的提问、家长会上的建议,都会微妙地偏向那个数字。这不是教师的错。这是系统设计的必然结果。

让我们停下来,问一个全书贯穿的问题:智商为什么会有这么大的力量?前面很多章给了不同的答案。这一章给了新的答案:因为智商逻辑学会了隐身。

当它藏在纸笔测验里时,人们还能看见它,甚至反抗它。当它藏在脑成像图里时,人们会被“科学图像”震住,但至少知道它是一个测量结果。当它藏在数字平台里时,人们几乎感觉不到它的存在。它变成了练习、游戏、学习路径。它变成了“个性化”本身。这正是数字教育技术没有抛弃智商逻辑,而是把它从显性的测验分数变成隐性的算法标签的关键一步。

我们再回到美国的那个学区。学期结束时,教师发现那些被系统判定为“低能力”的学生,接触的数学内容比“高能力”学生落后了两个年级。这件事被一位教育研究者写进了报告。报告里没有出现“智商”这个词。但任何一个读过比奈量表历史的人,都能看出那个熟悉的影子:用一个门槛分数把人分开,然后让分开的人走上不同的路。有两个年级,就有一个天花板。那些被系统压低了路径的学生,不会在学期末突然跳回年级水平。

那个数字怎么影响学习路径?具体来看。被标为“低于年级水平”的学生,系统推送的题目在分数概念上停很久。别人开始做分数加减了,他们还在反复练习“把一个圆分成几份”的图示题。别人在解一元一次方程,他们在做两位数乘除。到了学期中段,那些初始估值高的学生,屏幕上的文字题已经带抽象符号了;低估值那组,题目永远配着水果、卡通人物和具体物品的插图。系统把这种设计叫“支架式支持”。意思是,给弱的孩子多一点帮助。但教师看到的是另一幅画面:这些孩子不是不会做更难的题,而是从来没有被给过更难的题。他们在支架里待得太久,久到支架变成了围墙。

这个学区的案例后来被更多研究者注意到。一些外部评估团队调取了系统的后台数据。他们发现,算法估值在头两周就基本锁定了一个学生的长期轨道。

头两周。也就是十四个上课日。那之后,估值变动的幅度越来越小,小到小数点后两位的微调。系统逻辑很简单:如果学生连续做对当前难度的题目,就维持估值不变;如果做错,就把估值往下调;只有当学生连续做对更难的题——注意,是更难的题——才能把估值往上拉。

问题就在这里。系统不会主动推更难的题给低估值学生,除非教师在后台手动干预。而教师面对全班几十个学生,能做到手动干预的,是少数。于是,低估值学生在头两周后,就被困在了一个闭环里:想做更难的题来证明自己,但系统不给;越不给,越无法证明;越无法证明,估值就越稳在那个低位。

这个闭环还有一个很技术的名字,平台公司叫它“自适应精度”。他们说,系统越用越准。但这个“准”字应该打个问号。对谁准?对那些估值本来就高的学生,系统确实越用越顺:他们一路刷难题,估值稳步上升,系统记录漂亮的学习曲线。对那些估值低的学生,系统也越用越顺:他们做简单题,正确率高,系统记录稳定,看起来万事大吉。只有教师偶尔觉得不对。一个七年级的数学老师,在评估访谈里说:“我的几个学生,开学时系统说他们只有五年级水平。一月份我让他们试着做了一套七年级的题——纸笔的——他们做得不错。但系统里的题目,到现在还是五年级的。”这个老师的话,印在了评估报告的附录里,字体很小。

这还不是最隐蔽的。更隐蔽的是,系统对错误的解释。传统考卷上,一道题做错,原因可以是多种:粗心、某个知识点没掌握、读题读错了、时间不够。这些原因,老师可以和学生谈,可以观察再判断。

自适应系统不一样。它内置了一个因果模型,叫“知识掌握状态”。做错一道题,系统不是记录“这道题错了”,而是推算“这个知识点未被掌握”。停留时间太长,系统不是记录“犹豫”,而是推算“信心不足”。就这样,行为痕迹被自动转译成了认知诊断。这种转译,一步到位,中间没有教师观察的空间,没有学生解释的机会。

一个学生的整张学习画像,是由系统内部的诊断模型决定的。而这个模型的训练数据,来自其他几十万学生的行为痕迹。那些学生是谁?他们在什么家庭长大?他们用什么设备登录?他们做练习时是几点、旁边有没人帮忙?系统不知道。系统只知道,这些行为痕迹,已经被标定为“高能力”或“低能力”的样本特征。

这就产生了一个很难打破的循环:系统根据历史数据训练模型,模型判断新学生的能力,新学生的行为记录再变成历史数据,继续训练下一版模型。如果最初的样本里,低收入家庭的学生因为数字设备不熟、母语干扰等原因,行为痕迹偏向“慢”和“错”,那模型就会把这些痕迹和能力挂上钩。之后,一代一代学生进来,模型一代一代刷新自己。偏差没有被过滤掉,反而被埋进了结构。这就像在流沙上盖房子。每一层都压在上一层上,底下却不稳。

现在我们把目光转到中国。2015年前后,中国教育部门发布了一系列政策文件,推动“互联网+教育”和“智慧校园”建设。到2018年,部分省市的学校已经开始试点智能课堂系统。系统进入教室的方式,通常很安静。摄像头装在教室前方,不显眼。有些学校会在家长会上告知,有些不会。系统在后台运行,统计学生的抬头次数、举手次数、面部表情分类。

表情被分成几类:专注、疑惑、走神、困倦。每一类都对应一个分数。一堂课下来,系统自动生成每个学生的“课堂参与度”报告。这个报告,班主任能看到、年级主任能看到、家长端有时也能看到。它对教学管理有没有帮助?当然不能说没有。老师可以通过数据看到哪个学生长时间低头、哪个学生频繁走神,这些都是肉眼难以全时段覆盖的信息。

但问题出在,这些数据开始代替人的判断。一个学生课后被班主任叫去谈话,理由是“系统显示你这个星期的专注度下降了百分之三十”。学生愣在原地。他自己都不知道什么叫“专注度下降百分之三十”。他想解释,可能是最近家里有事,可能是视力下降看不清黑板,可能是那节课的内容他实在听不懂所以走神。但这些解释在数字面前,听起来都像狡辩。数据说他不专注,他就是不专注。

更关键的,是这些数据在家长端扩散的速度。一些学校把课堂表现数据接入家长的手机应用。家长可以在上班时,看见自己孩子这节课抬头了几分钟、举手了几次。这个功能,被很多家长视为“放心利器”。但这同时也意味着,孩子在学校的一举一动,都被实时翻译成“表现指数”,传到了家庭。

家长不需要等期中考试,就知道孩子“表现好不好”。表现好,意味着举手多、抬头多、没有困倦表情。表现不好,意味着低头、发呆、表情不对。至于孩子低头的时候是不是在认真思考一道难题,系统不分辨。系统只分辨头抬没抬。

在这种环境下,学生很快就学会了一件事:管理自己的数据表现。抬头,是给摄像头看的。举手,哪怕不知道答案,也先举了再说。表情管理,也变成了课堂纪律的一部分。这不是某个学校的特殊情况。这是数字化评价系统进入教室后的普遍现象。当学生意识到自己的每一个动作都可能被记录、打分、发送给家长时,他的注意力就不再只在学习上,还分出一块来,放在摄像头和自己之间。这种状态下,你很难沉浸到一道需要沉静思考的题目里。因为沉浸思考的表情,在某些系统里,会被识别为“犹豫”甚至“疑惑”。

这就和中国智慧教育的另一环扣上了:学习平台的错题追踪。中国不少中小学使用的在线作业平台,可以记录学生每一道题的用时、修改次数、中断情况。系统自动生成错题本,自动推送同类题目。这在学术研究里叫“精准补救”。表面上是帮学生补弱。但补弱的逻辑是:你在哪个题型上错得多,就反复练哪个题型。久而久之,学生花时间最多的,永远是自己最弱的那块。强项,反而没有时间发展。因为你没有做错,系统认为你“已掌握”,就跳过不给。一个学生如果从一开始就因为某些原因在某一类题型上表现不佳,他接下来会在这类题型上耗费巨大精力,而其他领域的潜力,被系统悄悄地忽略了。

这里面的逻辑线和美国自适应平台是同一条:用过去的错误,定义未来的路径。过去错了,就让你一直在那个地方打转。直到打得快、打得对,系统才放你走。这个过程,学生可能学到了一些东西,也可能只是对这套题型形成了条件反射式的正确率。更深的问题是,这套系统的设计,假设所有人学习同一套知识体系、按同一套阶梯爬升。它没有留白,不给偏离轨道者空间。一个学生在数学平台里,突然对一道题背后的数学史产生兴趣,想多查一点,系统不会给他这个选项。系统只知道“该做下一题了”。

再来看跨国技术脉络。这批进入中美教室的自适应系统和智能课堂工具,有不少出自同一批教育科技公司的研发线。它们背后的算法框架,很多源自同一批大学实验室、同一批学术论文。那些论文的假设、训练数据的来源、模型评估的标准,是在特定的社会环境里形成的——主要是美国和欧洲的英语区。

当这些模型被移植到中国教室时,语言换了,界面换了,但底层的能力定义没有换。什么是“好学生”的课堂行为?模型的参数里早就写好了:抬头率高、回答快、错误少。这些参数放到中国课堂,和“尊师重道、积极发言”的期待高度吻合。家长不会觉得有异物感,反而觉得“本该如此”。这种文化自洽,让技术落地几乎毫无阻力。但这也意味着,中国教育传统里那些和这套行为模型不一致的部分——比如沉思、内向、审慎——会被系统判为“不达标”,然后被教师、家长、管理者一路提醒纠正。

现在我们可以理解,为什么量化标签这个概念,在这一章非出现不可了。量化标签不是“差生”这样的口头评价。也不是一次期末考试的第几名。它是一个由系统生成、存储、调用的数字身份。这个数字身份,不写在学生档案封面,而写在服务器深处。但它比封面的任何一行字都更有行动力。它能决定你明天看到的题目难不难,能决定教师在家长会上怎么描述你,能决定你被分进哪个补习班,能决定你申请高中时推荐信里的措辞。它不是一次性贴上的,而是每分每秒都在复写。

他们需要在更难的题目上证明自己,但系统给他们的题目,永远不够难。他们想往上走,得先撞开算法的玻璃门。而算法玻璃门的设计逻辑是:你撞不开,是因为你能力不够。这就是命运技术的新形态。

它不要心理学家,不要试题册,不要考场。它只要一块屏幕,一条网线,一个学生每天点下去的那只鼠标。

最后,我们把目光转向一个即将到来的问题。中国社会在2010年代大力推动智慧教育,人脸识别和AI课堂分析系统进入学校,学生的注意力、情绪和反应速度都被量化。为什么这套技术逻辑在中国几乎没有遇到像样的抵抗?为什么标准化量尺在中国社会显得如此自然,甚至被当作善意的进步?

这个问题,比一块屏幕要深得多。它逼着我们往回看。看科举的远亲,看那个比算法更早、更深的量尺,是怎么长在中国社会里的。但在这一章收尾之前,我想让你记住一个具体的数字:三年级被算法标定“低能力”的学生,日后每一年,都在低于年级水平的题目里打转。

这个标签可能跟到高中,不是因为它写在纸上,而是因为它写在了系统每天推给他的题目里。标签跟着他,不是靠记忆,而是靠算法。这样的命运技术,比一百年前的智商测试更安静,也更难推翻。