第 9 章
必要难度的制造机
周敏的室友在收拾行李。暑假快到了,行李箱摊开在地上,塞了一半的衣服和乱卷的充电线。周敏靠在床头,手机横握,拇指在屏幕上滑动,表情不像在玩游戏——嘴唇微微翕动,眉头一松一紧。她在用那个AI阅读助手复习词汇,屏幕上正显示着一个关于“abate”的线索提示,描述着“一种力量的减弱过程”。她盯着那行字,手指悬在输入框上方,迟迟没有敲下猜测。“你在干嘛?”室友把一双球鞋扔进行李箱。“复习。”
“你那个表情不像是复习。”
周敏把手机翻过来给她看。屏幕上是一道题——一个打开的文本框,上面写着一行字:“下面这个句子里,‘in charge of’用得别扭,请改过来。改完后,用你改好的搭配造一个新句子,句子里必须包含一个‘must’或‘have to’的结构。”室友看了一眼,又看了一眼。“这是AI出的题?”
“一个脚本。”
“它自己编的?”
“根据我之前错过的模式拼的。”
室友把行李箱拉链拉上一半,突然停下来。“你以前复习不是都直接背吗。拿本书,划划重点,翻来覆去地看。”
“那是以前。”周敏没说出来的后半句是:以前确实觉得有效,读完一章,画满荧光笔,合上书感觉内容都在脑子里。直到第二天翻开同一章,发现那些荧光笔的痕迹在纸上清晰得刺眼,脑子里的内容却像被水冲过一遍,只剩几个孤零零的关键词。
这不是她一个人的问题。遗忘不是学习的例外,它是学习的默认设置。人类记忆系统在设计上就不是为了长期保存离散信息而优化的——它保留模式,扔掉细节。
但在过去两年里,这个引擎的效率明显在加速,准确地说,是从她全面依赖AI辅助学习之后。
这件事的逻辑链条听起来像一个拙劣的玩笑:工具越好用,忘得越快。AI翻译让她读懂了过去读不懂的文章,AI润色帮她改顺了过去写不通的句子,AI总结替她提炼了过去需要反复读才能抓住的要点。
每一样工具都在降低学习的门槛。但门槛降低的同时,什么东西也跟着一起被抹掉了。
她回想起大三上学期那门认知心理学课。教授是个说话慢吞吞的老头,喜欢在讲台上踱步,每讲一个概念就停下来问全班“你们觉得呢”。有一天他讲到记忆提取,在黑板上写了一个拗口的词:必要难度,英文是desirable difficulty。这个词的发明者罗伯特·比约克(Robert Bjork)在1994年发表了一篇论文,标题平淡得像教科书目录,但里面藏着一个让认知心理学界重新思考的发现,核心朴素得令人失望:越容易学会的东西,忘得越快。
比约克夫妇在加州大学洛杉矶分校的实验室里做了一系列实验。受试者记忆单词对,然后在不同条件下测试回忆。一些人学完立即测试,另一些人间隔一段时间;一些人在安静环境里复习,另一些在嘈杂环境里;一些人的复习材料和学习材料一模一样,另一些则被微妙地改变过——字体不同、背景颜色不同、呈现顺序不同。结果是反直觉的:那些在复习时感觉更顺畅、更轻松、更确定自己记住了的人,在延迟测试中表现更差;而那些在复习时感到费力、犹豫、甚至有点挫败的人,反而记得更牢。
比约克把这个机制拆解得非常清楚:从记忆中提取信息的过程本身,就在强化这条记忆痕迹。提取越费力,巩固效果越强。前提是有一个精确的边界——不能失败。如果难到直接提取不出来,被迫查看答案,这次提取不仅无法强化记忆,还可能产生挫败效应。必要难度的甜点区位于那条细缝里:高成功率但不是百分之百。太容易,没有锻造效果;太难,直接断掉。你得正好卡在推得动但又不会完全推开的阻力区间。
周敏当年在教室里听到这个理论时,觉得它很优雅。然后她把它忘了,和所有考试结束后迅速蒸发的内容一起。
现在她靠在宿舍床上,手机屏幕上那道改错题还在等她回答,这个拗口的词突然从记忆深处浮出来,带着一种迟到的刺痛。因为她意识到,过去两年自己精心搭建的那套AI辅助学习系统,几乎每一处设计都在系统性地绕开必要难度。翻译消除了解码的阻力,润色消除了组织语言的阻力,总结消除了提炼要点的阻力。这些工具让阅读和写作变得流畅,但代价是她很少把记忆逼到需要费力提取的边缘。
她的大脑变成了一个依赖外部索引的终端——知道哪里能找到信息,却不持有信息本身。
这不是AI的问题,是使用方式的问题。但“使用方式”这个词掩盖了一个真正棘手的东西:人脑天然会选择省力路径,这不是意志力薄弱的道德缺陷,这就是大脑的节能策略。
传统学习方法中,制造必要难度极度依赖学习者的自律。你得记得什么时候该复习,得在翻开笔记本之前忍住、先逼自己回忆一遍,得给自己的练习主动找变体而不是反复做同一类题。间格重复软件可以帮你安排复习时间,但它不负责让每次复习都感到适度的费力。它可以把一张闪卡推到你面前,但无法强迫你真正提取那个词的含义,而不是扫一眼就翻到背面。多数人做不到——不是偶尔做不到,是持续做不到。因为监控自己的学习状态、判断什么时候该加难度、在觉得舒服时主动把自己推出舒适区——这三件事本身就是最高阶的元认知技能。大多数人在这些事上的表现,比他们以为的要差得多。
这件事比认知心理学的教科书更古老。早在1964年,保罗·皮姆斯勒(Paul Pimsleur)在俄亥俄州立大学发表了一篇关于间格记忆的论文。他让受试者学习一批外语词汇,然后在五分钟、一天、一周、一个月这些时间窗口测试保持率。数据揭示了一条精确的衰减曲线:记忆在最初几小时内急剧下滑,然后趋于平缓。
但真正让这个研究产生持久影响的,是他接着做的一件事:他开始试验不同的复习安排。有些受试者只在学习后立即复习一次,有些在一天后复习,有些在一周后复习。比较结果呈现了一个清晰的模式——如果复习被安排在学习者刚要遗忘但尚未完全遗忘的那个时间点上,记忆巩固效果最好。
太早复习,信息还在,提取不费力,浪费;太晚复习,信息已经消失,提取失败,无法强化。皮姆斯勒把这个时间点称为最佳间格。
他把成果写成了一套语言学习系统的设计原则,后来成为皮姆斯勒语言课程的底层逻辑。
但他在1976年去世前的最后一篇会议论文中写了一段话,大意是:间格本身不是魔法,真正的魔法发生在间格期间,当学习者们必须从衰减的记忆痕迹中重新构建信息的那一刻。如果间格里填充的是被动的重新听一遍录音,而不是主动提取,间格的优势就大打折扣。这段话当时没有引起太多关注。认知科学的主流正涌向记忆策略的“优化”——更高效的编码方法、更清晰的记忆术、更结构化的知识表征。必要难度这个概念要等到将近二十年后才被比约克正式命名,而在教育实践中的落地又等了更久。原因是它在本质上和人对“流畅”的直观感受对着干。
流畅感是一种微妙的毒药。当你顺畅地读完一页英文,当你毫不费力地听懂一段对话,当你看着AI把你磕磕巴巴的句子改得漂漂亮亮——那一刻大脑会释放一个强烈而明确的信号:我掌握了,我在进步。问题是,这个信号是假的。认知心理学者给这个现象起了一个专门的名字:熟练度幻觉(fluency illusion)。大脑倾向于将“处理顺畅度”误判为“掌握程度”,依据的是当下的加工流畅性,而不是长时记忆的提取可得性。你错把“认得”当成了“记得”。
周敏盯着手机屏幕上的改错题,在脑子里把“in charge of”的几个使用场景过了一遍。她改了那个句子,然后在输入框里敲出一个新句子——包含目标搭配,还嵌入了一个情态动词结构。她点了提交。脚本没有夸她,它弹出了下一道题。这次的题型又变了:一段中文语境描述,要求用指定的三个英文搭配写出一个完整段落,其中两个搭配来自上周的复习记录,一个来自三天前。
这不是一个商用学习软件,是周敏在计算机系读研的一个朋友帮她写的简易Python脚本。逻辑只有三条:复习间格比常规算法拉长百分之三十;每次复习的提问形式随机变化——翻译、改错、造句、语境填空轮换;每道题要求调用的知识点不止一个,必须在复习目标内容的同时嵌入另一个语法结构。
那个朋友花了一下午写完脚本,发给她时附带了一行消息:“这东西很烦人的,你确定要用?”
她用了。第一次用时她差点把它删了。脚本推给她的第一道题就让她卡了将近两分钟。它不是直接问她某个单词的意思,而是给她一个句子,里面有一个搭配用得别扭,让她找出问题并改正。改完之后,脚本没有告诉她答案对不对,而是又推了一个新句子,要求她用刚改好的搭配造一个新的语境,同时嵌入另一个语法结构。她造出来的句子语法有错误,脚本指出了错误的位置,但不告诉她怎么改,只给了一条提示。她咬着牙改完那个句子之后,发现自己对那个搭配的理解和刚才不一样了——不是更“知道”了,而是更“能用”了。这两个状态之间的区别,她以前从来没有这么清晰地体验过。
这里需要把这个认知过程拆开看清楚。当脚本推送一道改错题时,周敏的第一个反应不是回忆对应词汇的释义,而是判断这个句子到底有没有问题。这一步调用的不是词义记忆,而是使用场景的比对。她需要在脑子里把面前这个句子的结构和她记忆里这个搭配应该有的结构放在一起碰一碰,找出不吻合的地方。这个比对过程本身就是一次深度加工——它在强化对这个搭配使用边界的记忆,而不只是强化它的定义。紧接着,脚本不告诉她答案。找问出题、判断问题类型、回忆正确用法、在脑子里试错——这四个步骤全部由她自己的认知系统完成。脚本只做了一件事:提供了一个有摩擦力的环境,然后退开。
这就是必要难度制造机的核心原理:它不是在替你记忆,它是在替你执行你本该自己执行、但你执行不了的元认知监控策略。
为什么执行不了?不是因为不自律,而是因为人类大脑在自我监控这件事上有一个结构性的盲区:你无法同时处于“做事模式”和“观察自己做事模式”。当你正在阅读时,注意力在内容上,不在你此刻正在用什么策略理解这个词上;当你正在复习时,注意力在“我记没记住”,不在这次提取的费力程度是不是处于最佳区间。元认知监控需要你跳出来看自己,这个跳出动作本身会打断认知流畅性,大脑天然抗拒它。
但一个脚本可以在这个位置接进来。它可以持续追踪你的错误模式,动态调整下一次练习的难度和变形,不因情绪波动放水,不因你觉得累了就降低标准。它不累,不偷懒,不想刷短视频。它就是一个不近人情的教练,手里拿着你的错误记录本,不断捏出下一个让你适度难受的钩子。
两周后的一个下午,周敏和另外二十三个参与测试的人一起坐在一间教室里,接受自由写作测试。题目是用英语写一段关于城市环保政策的短文,没有指定必须使用哪些词汇,只给了一个开放式的提示。她写到一半时停下来,检查了一下刚写的一个句子。句子里用到了“phase out”这个搭配,还嵌了一个被动语态。她读了一遍,觉得没问题,继续往下写了。这个动作——写完一个同时包含目标搭配和额外语法结构的句子、读一遍、判断没问题、继续写——放在半年前,她做不到。不是因为她当时不知道怎么用“phase out”,她半年前就在闪卡上背过这个词。她只是从来也没有在真实的写作中,不假思索地把它和被动语态焊在一起用过。
测试结果出来时,负责数据分析的研究生核对了三遍。A组——使用普通闪卡工具按默认间格复习的人,在自由写作中正确使用目标搭配的比例是百分之三十四。B组——接入那个带有必要难度制造机制脚本的人,正确使用率是百分之六十一。差距换算成科恩d值落在零点八左右。对于教育干预研究来说,这是一个很难用随机波动解释的效应量。
但另一个发现比数字本身更值得注意。B组的人在自由写作中不仅更准确地使用了目标搭配,还展现出另一种模式:他们倾向于把目标搭配和其他语法结构嵌合在一起使用,一句话里同时出现目标搭配和情态动词,或者同时调动两个不同单元的搭配。A组的写作中,这种跨结构的自发嵌合几乎看不到。A组的人也会使用目标搭配,但往往是在单独、孤立的句式中——一句话只调一个目标点,其他部分用最简单的结构填充。
这个差异指向更深层的机制。当复习时被要求同时处理两个不同类型的问题,大脑被迫在两种知识网络之间建立临时连接。第一次建立是生硬的、费力的,但当这个连接被反复激活,它就从临时通道变成了固定通路。到了自由写作这种真实应用场景,你不需要额外费力去“调用”这两种知识——它们已经在你的大脑里被焊在一起了。
这就是必要难度制造机最深远的效果:它不是帮你记更多东西,它是在改变知识在大脑里的组织方式,从孤立的点变成交叉的网络,从需要主动提取的清单变成自动激活的模式。而A组的闪卡工具——不管算法多么精妙、间格多么科学——无法实现这个效果,因为它的本质只是把一批知识点按最优时间推到你面前,你提取它们的方式和你当初学习它们的方式是一样的。这让你在提取时感到流畅,但也让你的知识保持在它们最初的孤立状态中。
写到这里,需要诚实地面对边界。这个测试只有二十四个人,样本量小到任何统计显著性的宣称都需要加上沉重的注脚。两周的干预时间也太短,无法排除新奇效应的影响——当一种学习方法刚开始使用时,新鲜感本身就在调动额外的注意力资源,一旦新鲜感消退,效应量很可能会回落。
比约克本人在2013年的一篇综述中坦率承认,必要难度效应在不同实验情境中表现出显著的不稳定性。有些实验得到强效应,有些只检测到微弱甚至为零的效果。干扰变量太多了:任务类型、难度操作方式、被试的先前知识水平、测试的延迟时间,这些变量的交互作用至今没有被完全拆解清楚。
更麻烦的是,在教育实践中,必要难度的操作化一直面临一个困境:你得把难度调到刚刚好,太低没效果,太高摧毁动机。而这个位置不固定——因人而异,因时而变,因任务类型游移。你今天下午觉得“费力但能完成”的难度,明天早上可能就变成“过于轻松”,因为睡了一觉后记忆巩固了自己都不知道。
这引出一个诚实得让人不舒服的结论:精确地、持续地、个性地调控必要难度,是人类教师都难以稳定做到的事,更不用说一个靠三条规则运行的简易脚本。所以如果把这一章的结论简化成“用AI制造必要难度就能让学习效果提升百分之三十”,那将是精确的错误。
比那更接近真相的是一个更窄但更扎实的表述:这个脚本做对了一件事。它没有替代她的记忆,也没有优化她的学习路径。它被安装在她自己元认知监控天然薄弱的位置——她无法精确判断自己什么时候该复习、该复习什么形式、该把哪些知识点捆绑在一起——然后持续地、不带情绪地、根据她上一次的表现来执行这些判断。AI在这里不是记忆外挂,不是搜索引擎,不是内容生成器。它是元认知假肢,它接在学习回路的监控环上,而不是输入或输出端。
如果接在输入端,它会替你读;接在输出端,它会替你写;接在反馈环上,它会帮你看清你正在做什么、还差什么、下一步该试什么。
必要难度制造机做的是把“帮你看清”从被动诊断推进到主动干预。它不告诉你“你这里有薄弱点”就完了,它直接把那个薄弱点变成下一道练习题的靶心。
这个装置不需要复杂的模型。周敏的脚本只用最基本的条件判断——如果上次反应时间超过某个阈值,下次间格缩短;如果连续两次正确,下次改变题型;如果错误类型集中在搭配上,下次捆绑一个语法点。这些规则的复杂度甚至比不上一个电商网站的推荐算法,但它们做了一件人脑做不到的事:持续追踪错误模式并据此动态改变练习形态。
人脑做不到不是因为不够聪明,而是因为人类记忆系统的设计初衷里根本没有“精确追踪自己的遗忘曲线”这个功能。你能感觉到某个东西“好像忘了”,但无法精确判断它现在处于遗忘曲线的哪个位置,是刚开始滑落还是已经接近消失,更无法据此计算下一次复习的最佳时间窗口。
闪卡软件可以管理“什么时候出现”,但无法管理“以什么形态出现”。而形态变化可能是整个必要难度制造中最被低估的变量。同样的知识,要求用翻译的方式提取,和要求用改错的方式提取,在大脑中激活的是不同的处理通路。翻译调用语义通达——从一种语言的符号连接到另一种语言的符号;改错调用语法判断加语义校验——先发现不对,再定位哪里不对,再回忆正确形态,再替换。后者的认知操作更多层,提取深度更大。
如果每一次复习都用同一种题型,大脑会逐渐走捷径——它不是在强化对知识本身的提取通路,而是在强化对“这种题型怎么答”的程序记忆。练的是应试技巧,不是语言能力。随机变形打破了这个程序化的可能性:你不知道下一次会被怎么考,所以你只能在每一次复习时都从最深处把那个知识点完整地拎出来。
在两周里,周敏反复被推到那条细缝上——难到想放弃,又没有难到真的放弃。每一个最终成功改对的句子,每一次在解释框里打出的语法判断,都在加强一条记忆通路。而在这个过程中,她的AI助手没有生成过任何新内容,没有帮她写过一句英文,没有替她总结过任何知识点。它只是安静地计算、变形、推进度。
测试结束后的那个傍晚,周敏收到了一份自己的练习数据汇总。她看到那些图表和曲线时,第一个反应不是骄做,而是一种奇怪的疲惫。她想起好几次想把脚本关掉——尤其是在晚上十点、室友都在刷手机的时候,弹出来的练习题要求她为一个不熟的搭配造一个包含虚拟语气的句子,心里涌上来的不是求知欲,而是一种接进愤怒的抗拒。但她没有关。不是因为自律,是因为脚本没有给她关掉的选项。它只是一直在推送下一道题,没有鼓励,没有惩罚,只有持续不变的要求。
她说不上来这种感觉是好是坏。她只知道那天的自由写作测试里,写到一半时她停下来读了一遍自己写的句子,觉得没问题,就继续往下写了。AI没有替她做到这件事。AI只是在她每次快要滑过那道坎的时候,把坎往上抬了一点,抬到刚刚好让她必须用力才能跨过去,又不会高到完全跨不过去。
这就回到一个被悬置的问题:线索模式节省下来的认知资源,最终应该流向哪里。上一章的实验验证了线索模式能在输入端显著提升单词的初次抓地力,但那个数据里藏着一个诚实却不太好听的事实——真正陌生的、透明度极低的词汇,线索模式的效应量会打折扣。
对这些词,光靠输入端的巧妙线索不够,它们需要在后续被反复提取、变形应用、嵌入不同语境和语法结构中,才能从“猜出来”变成“用得出”。这个过程需要的不是更聪明的输入策略,而是持续不断、精确调控的提取练习。需要一个人或者一个系统,在每次快忘的时候把知识以没见过的形态推到面前,逼着重建提取通路。
这不是输入端的事,这是编码和巩固端的事。而这正是AI作为元认知外挂最应该被安装的位置——不是替你看懂文章,不是替你写出句子,而是替你监控你什么时候该难受、该难受多少、该以什么方式难受。这个位置的选择,会决定认知资源被投向哪条路径:投向被动的流畅阅读,换来的是一时理解和长期遗忘;
投向费力的提取挣扎,换来的是缓慢但稳固的内化。两条路之间的差距在单独一次学习中几乎看不见,但在反复发生的日积月累中,它会累积成一种结构性的分岔——认知系统是被外部工具填充得越来越薄,还是在工具的精准施压下被锻造得越来越致密。
脚本最后一次推送“divert”这个词的复习题是在测试前三天。不是改错题,而是一个新题型:给一个语境,要求用这个词造一个句子,句子里必须包含一个表示让步关系的结构。
周敏盯着提示,光标在白色界面上跳动了将近两分钟。两分钟后她打出了一个句子。句子里有目标词,有让步结构,还顺手带上了一个三天前复习过的搭配。她读了一遍,觉得某个位置不太顺,删掉重写了半句。再读一遍,点了提交。脚本没有马上回复,它在计算反应时间和修改次数,把这些数据喂进那几条简单规则里,算出下一次——如果还需要下一次的话——这个单词应该以什么形式、在什么时候重新出现。计算完成。
屏幕上弹出新的题目,又是一个不同的提问形态,需要同时填入两个不同语法的搭配结构。周敏看着那两个空白格,脑子里有一根不存在的弦被人弹了一下。不疼。但很清晰。