第 18 章
算法不能替你回答的问题
人们普遍认为,当获取知识变得几乎免费时,养育一个孩子反而更难了。这种观点之所以反直觉,是因为我们习惯将教育成本等同于信息成本。过去,买不起书、请不起老师、找不到资料,这些确实构成了学习的主要障碍。如果算法能将这些成本降至接近于零,按理说教育应该变得更容易。
但养育的核心成本从来不是信息成本。它是一系列判断成本:什么值得学,什么可以暂时放掉,什么错误需要停下来讨论,什么沉默应该被允许继续。当知识传递被外包给机器,这些判断并不会消失,反而会因为外部权威的退场而变得更加裸露。家长不能再靠“老师这么说的”“课本这么写的”来替代自己的答案。
这个变化有一个技术上的起点。2017年提出的变换器(Transformer)架构用自注意力机制取代了循环神经网络结构,从而实现了高效的并行化、更长的上下文处理能力以及在前所未有的数据量上进行可扩展的训练。
为了找出上下文窗口范围内哪些词元彼此相关,注意力机制会使用多个注意力头为每个词元计算一种被称为软权重的数值,每个注意力头都有自己的相关性标准来计算自己的软权重。例如,一个小型模型有1.17亿个参数、12个注意力头和一个只有1000个词元的上下文窗口。而更大的模型可以把它扩展到一百万甚至更多的词元。
这件事听起来只是技术参数,但它标识了一种根本的变化。模型并不真正理解一句话,它只是用数十亿个参数去拟合一个概率分布。它的训练目标不是理解,而是预测。它看到上文的词,就预测下一个最可能的词;看到学生的错题,就预测他可能的知识缺口;看到一条学习路径,就预测哪一步提分最快。
正是这种不理解,让它在处理信息的速度和广度上远远超过了人。它可以在几秒内读完一个人穷尽一生也读不完的文本,然后生成一个语义连贯的回答。它不知道自己在说什么,但这不妨碍它说得像模像样。在语言处理的历史上,这条路不是突然出现的。
早在2009年左右,在许多语言处理任务中,统计语言模型已经优于符号语言模型,因为它们可以有效地消化大型数据集。变换器把这条逻辑推到了极致:不需要规则,只需要数据、参数和注意力权重。以此为基础,大型语言模型进入教育场景。
智能辅导系统、自适应学习平台、增强现实教育应用,它们的工作逻辑高度一致:响应学生的输入,一道题、一个问题、甚至一个凝视点,然后用算法模型快速匹配知识图谱中的相关信息,生成反馈。答案、解析、扩展阅读。响应、反馈、响应。核心承诺是效率,把获取知识的成本降得近乎零。
设想一个孩子戴着集成这类人工智能的眼镜走进博物馆。他站在一只展柜前,凝视里面的青铜鼎。眼镜在极短时间里识别出器物,推送出朝代、铸造工艺、礼制功能、同类器物比较,甚至三维动态复原。从信息传递的角度看,这几乎是教育的终极形态。
但那个孩子仍然可能对眼前的一切毫无兴趣。他可能只是从青铜鼎前走过,目光停在别处,或者短暂停留后就转向下一个展厅。信息到了,注意没有到;
知识到了,意义没有到。这才是真正的问题。算法可以生成答案,但无法提出真正触动人心的问题。算法看到了词元之间的统计相关性,却看不到一个孩子为什么会因为某件器物而停步。它知道青铜鼎的铭文怎么读,却不知道那件器物为什么在几千年后仍然值得被放置在一束光下,这个问题对一个具体的孩子意味着什么。这个意义不是可以从知识图谱里检索出来的属性,它需要在观看者与被观看之物之间被慢慢建构出来。
当知识传递被算法接管,养育中最根本的问题反而被前所未有地凸显出来。这些问题不再是怎么让孩子学得更快更准,而是我们希望孩子成为什么样的人,什么知识值得学习,什么事情值得在乎。
这些问题没有算法最优解。它们要求家长做出价值判断。而价值判断的能力,恰恰是认知脚手架要培养的核心能力。
这个论断并不浪漫,它恰好建立在一个冷静的观察之上:算法优化的是响应与反馈,而价值判断必须发生在响应之前。有人会反驳:这个时代更需要强化传统记忆与服从训练,因为知识基础不牢,高阶思维无从谈起。
所谓自主建构,不过是放任自流的另一种说法,最终只会加剧教育不平等。这个反驳有它的道理。一个没有基本知识储备的孩子,面对开放性的问题同样寸步难行。事实知识点仍然重要,基本技能仍然需要训练。算法在这部分可以做得很好,甚至比人更稳定、更不情绪化。
但记忆和服从能够提供知识的基础,却不能自动长出知识之上的判断。一个背得出所有朝代名称的孩子,可能仍然不知道眼前这只鼎为什么值得看。一个能快速完成大量练习册的学生,可能仍然在遇到陌生问题时只会等待提示。知识基础是必要的,但不充分。
算法可以在必要的部分帮上忙,甚至做得比人好。它不能替代那个不充分的部分,因为那一部分不是传递,而是建构。传递可以自上而下,建构必须由内而外。
这个区别在教育现场里会变得很具体。智能辅导系统的工作方式,是把知识组织成一个图谱。知识点作为节点,依赖关系作为边。系统根据学生的答题历史计算每个节点的掌握概率,然后推荐一条预期提分最快的路径。
一个七年级学生如果错了一道涉及比例的应用题,系统会沿着知识图谱往回追溯,找到他更早暴露出的薄弱节点,可能是分数,也可能是单位换算。然后它推送针对性的练习。这个过程干净、精准,没有一句废话。它传递事实的方式已经无可挑剔。
但知识图谱有一条看不见的边界:它只能表示已经被结构化出来的关系。那些尚未命名、尚未被写进课程标准的联系,它无法表征。而一个人真正的学习,往往恰恰发生在那些地图之外的地方。
陈默的数学单元测验在星期四。陈志远在早上问他,是希望自己帮助他再过一遍函数错题,还是想自己来。这不是一个科学结论,不是一个基于大样本实验的最优策略。只是一个父亲在信息不完全的时候做的一个判断。陈默选择了自己来。那天傍晚他回家,没有主动提分数。陈志远也没有问。
直到晚饭后,陈默才说起有一道函数题,他试了两种方法都不对。陈志远问他卡在哪里。陈默想了想,说自己把未知数代入之后结果不对,但不知道是代入的过程错了,还是之前画出的图像就错了。
这是很准确的自我描述。他能区分自己不确定的层级。他不知道自己不会的边界,但他知道自己卡住的层数。他没有把失败概括成一个笼统的我不会,而是把错误定位到两个可能的节点之间。这个动作很小,但它是元认知的一部分:能够监测自己理解到什么程度,能够说出自己在哪里断了线。
知识图谱能识别一道题的错误类型,并回溯到相应节点。它不能识别一个孩子是否维持着对自己理解程度的诚实监控。它不能识别那个瞬间:陈默在草稿纸上尝试定位不确定性的时候,他正在做的事不是寻求答案,而是在自己的解题过程中标记出不确定的位置。这个动作本身就是一种认知习惯,是一种需要被练习才能稳定的能力。它不保证考试分数,但它保证另一件事:他下次面对一个没把握的问题时,不会立即把慌张外化成一句笼统的放弃。
知识图谱的关联,与个人经验中形成的独特联结,是两套完全不同的网络。算法推荐的路径沿着知识图谱走。孩子偶然发现的兴趣岔路,往往违反知识图谱的结构。
一个孩子在学习比例时,偶然发现厨房里糖和面粉的配比。知识图谱会继续推送比例的应用题,但孩子自己却拐进了一个岔路:为什么面包会膨胀?这把他带向酵母、发酵、化学反应。这些知识点在知识图谱上分属完全不同的分支,它们的连接只在孩子的个人经验中存在。这种关联没有普适性。一个孩子可以借面包膨胀理解比例和化学反应之间的关系,另一个孩子可能需要一条完全不同的岔路。算法无法为每个人预判这条岔路,因为它只能基于已有数据计算最可能的路径,而兴趣岔路的本质,就是它不在既有数据里。它尚未发生,因此无法被提前训练。
还有另一种互动,同样无法被编码。一个孩子站在博物馆里,看到一只青铜鼎。他没有问年代,没有问用途。他问的是,它被埋在地下那么久,会不会觉得冷。知识图谱会把这个查询识别为需要澄清的输入,或者给出一个关于墓葬温度、青铜导热系数的解释。算法不会知道,这个问题里藏着一种很初级的想象:把器物也当作有温度的东西。
一个在场的大人可以停一下,然后顺着这个问题的方向走。他他自己也不确定,但这个东西曾经被人使用过,被很多双手触碰过,也许它保留过那些手的热。这不是科学回答,甚至可能不准确。但它在孩子的问题和个人经验之间建起了一座桥。它让孩子的问题停留在那个层面,而不是急着转化为一个知识查询。它让孩子感到,这个问题是值得停留的。这种互动无法被编码。
算法可以模拟微笑,可以生成鼓励语,可以给出一个温度变化的解释。但它不能做出那个微小的停顿。它不能顺着一个孩子的问题,走向一个自己也不确定答案的方向。它不能在我不确定里停留,因为它被训练成要给出答案。而教育中一些最重要的时刻,恰恰发生在传授者愿意承认自己不确定的时候。承认不确定,并不是知识上的失败,而是一种认知上的诚实。这种诚实本身,就是脚手架搭建者最重要的示范。
认知科学对这部分知道多少?我们确切知道的,是意义建构不是一种玄妙的能力。它由一系列可以被识别、可以被练习的子技能组成。
这些子技能不是哲学概念,它们有具体的表现形式,在六到十八岁的孩子身上都能被观察到。
提出问题的能力。一个孩子看到蚂蚁搬家,问的是它们怎么知道要下雨,而不是问蚂蚁属于什么科。这两个问题都指向真实的知识,但前者通向探索,后者通向查询。前一个问题要求孩子动用已有经验去推断,又为自己打开下一步的观察。它不来自对分类学的了解,而来自对因果联系的原始好奇。算法能回答后一个问题,甚至能对前一个问题给出一个结构完整的科学解释。但它不能在孩子的脑中主动生成那个探索性的问题。问题只能从内部长出来。它需要一种对世界保持陌生的能力,一种对已知事物仍然愿意追问的倾向。
在不同信息之间建立关联的能力。一个孩子在历史课上听到丝绸之路,想起上个月在游戏里见过的沙漠绿洲和驼队。这不是标准的课程关联,但它让丝绸之路从一个抽象的地理概念变成了一条有地形、有疲惫、有停留地的路线。算法能沿着知识图谱推送从长安到罗马的城市列表,它不能复原那种从游戏经验里带出来的感受。
孩子会记得一个具体的地方,因为他在那个地方迷过一次路。这种关联的独特之处,在于它属于一个人自己的经验史。教育能做的最多只是让它被说出来,被看见,被认真对待。
知识图谱提供的是公共的节点,个人经验提供的却是私有的边缘。边缘上的连接并不总是正确,但它是理解得以扎根的地方。
评估自己理解程度的能力。一个孩子读完一段说明文后,说自己每个字都认识,但整段连起来不知道在讲什么。这看似简单,实际上是一项很难的元认知技能。很多人,包括成年人,会误以为自己理解了,因为每个字都认识。能说出整段连起来不知道在讲什么的孩子,是在对自己的理解过程做实时监测。这是一种需要被示范和回应的能力。大人可以告诉孩子,他自己也经常在读完一段内容后意识到自己其实没懂。
这件事无法由算法完成,因为算法没有懂了的那种经验。它只有输入和输出的匹配。它可以输出一个高概率的答案,但不会在完成任务前停下来怀疑自己是否真的理解了这个答案。在困惑中保持探索的能力。
面对一个暂时解不出的问题,不立即寻求答案,而是继续尝试。这种能力不表现为成功,而表现为一种对未完成状态的耐受。它有一个很常见的日常指标:孩子卡住之后,没有把练习册合上,也没有立即求助,而是继续在草稿纸上画了一个图,或者换了一个角度再试一次。这个动作很小,但它是科学史上大多数重要发现的微缩版:在不确定性里待一会儿,看看会发生什么。算法很难学习这个动作,因为它被优化的目标是尽快结束不确定性。算法的整个机制都在做一件事:把困惑变成答案。但有些时候,困惑本身就是认知活动的一部分,过早消除它反而会截断真正的问题。
这四个子技能合在一起,构成了意义建构的一部分。它们都不神秘。它们都可以被观察。但它们没有一个能从算法推送中自动生长出来。需要一个成年人日复一日地示范、回应、陪伴。这个成年人不必是完美的,他只需要让孩子看到,他自己也会被问题卡住,也会在信息不足时做一个判断,也会在事后承认这个判断可能是错的。这里必须诚实。
我们不知道这个培养过程具体需要多少剂量。我们不知道哪些回应对哪些孩子最有效。我们甚至不太确定敏感期有多敏感,错过某些阶段是否真的无法弥补。
认知科学在养育这件事上,有相当一部分核心问题目前还没有确切答案。这是事实,我们不用假装知道。这个我们包括所有的研究者、教育实践者,也包括每一个正在读这段文字的人。承认这一点,本身就是认知上的诚实。陈默后来没有再主动提那道函数题。那个周末,陈志远和他一起重新打开那道题。
陈默没有做对,但草稿纸上留着完整的两种错误路径。陈志远没有去纠正那两个错误,至少一开始没有。他先指着其中一个错误问陈默,当时是怎么想到这一步的。陈默说,他记得老师说过遇到这种题可以先代入试试。陈志远接着问,那这个想法不算错,只是它不适用于这个题型,下次怎么知道它什么时候可以用。陈默想了想,说自己得先判断是不是有两个未知数。这是一种总结。它不来自知识图谱的推送,它来自两个人一起查看一个错误时发生的对话。
这个对话可以被写成一段算法脚本,但那个当时怎么想到的问题,首先需要一个成年人真的好奇。知识图谱会直接定位错误节点,然后推送练习;而这个成年人的问题没有立即指向纠正,它先指向理解一个错误如何发生。这种指向并不总是更有效,它有时候会显得慢,会浪费一个本可以用来多做几道题的时间。
但它在练习另一种东西:一个错误不仅是一个需要被消除的偏差,它也是一个可以被理解的事件。教育的终极产品从来不是知识本身,而是生产知识、评估知识、赋予知识以意义的心智习惯。这些习惯的培养,无法被自动化。它依赖于一个成年人持续的、充满判断的回应。
算法可以替我们做很多事:提供信息、推荐路径、生成反馈。它不能替我们决定,孩子的一个错误里有什么值得停留的东西。它不能替我们决定,那个下午应该用来订正,还是用来讨论一道错题里藏着的另一种可能。这些决定,无论好坏,都必须由一个成年人来做出。这个成年人可以推给老师,可以推给系统,可以推给一个在线课程。
但推掉决定本身就是一个决定,而且是一个会被孩子学会的决定。那个反直觉的判断现在落到了更具体的地方。知识获取变得便宜,不等于教育变得便宜。便宜掉的只是信息成本,判断成本反而上升了。
算法把那些原本由教材、教师、考试统一给出的标准答案从教育现场抽走了一部分,留下的是一个更古老的空白:一个孩子应该成为什么样的人,一个家庭愿意为哪些事情投入有限的时间。这些问题从来没有被技术解决过,只是以前被标准化的教学大纲暂时遮蔽了。现在遮蔽被掀开,每个家庭都必须自己站在这些问题的前面。
于是,压力回到了家长身上。如果养育如此依赖家长的价值判断,那么家长依据什么来确保自己的判断是可靠的?他们翻开手机,看到的科学养育知识铺天盖地。它们互相矛盾,很多打着科学的旗号却缺乏坚实的证据。一个家长如果要把这些判断建立在科学之上,首先需要知道,科学本身在哪些地方是坚实的,在哪些地方是脆弱的。这正是留下来的压力点。
它要求我们回过头去,检验那些被家长当作依据的知识究竟经不经得起推敲,检验它们在什么条件下可以被信任,在什么条件下只是一种包装成科学的意见。这个检验并不轻松,但它也许是对一个成年人判断力的最直接考验。