第 7 章

习惯的自动化工厂

实验台上的大鼠已经跑了上千次。它熟悉这个T形迷宫的每一个转角。提示音响起——短促的高频音,从迷宫起始位置的扬声器传出。大鼠几乎没有迟疑,向左转。左臂尽头的凹槽里有一小碟巧克力奶。声音意味着方向,方向意味着奖励。声音—左转—巧克力奶,这条链条被重复了足够多次,大鼠的动作已经带上一种不经思索的特质。

1990年代末,麻省理工学院安·格雷比尔实验室里,这个场景反复上演。但这一天,巧克力奶的味道变了。实验人员在牛奶里加入了苦味剂——无毒但令大鼠厌恶的化合物,足以让任何正常大鼠在尝到第一口之后立刻停止饮用。格雷比尔和她的同事们想知道:当奖励变质之后,这些经过了大量训练的大鼠会怎么做?

答案出现在几分钟后。提示音响起。大鼠向左转。跑到凹槽前,低下头,舔了一口。苦的。它停顿了一下。然后又舔了一口。接着转过身,沿着迷宫通道跑回起始位置——动作依然流畅,速度依然很快。它没有表现出正常大鼠面对苦味时的厌恶反应。

它只是完成了这个动作序列,就像它已经做过的上千次一样。在接下来的测试中,这些被过度训练的大鼠持续表现出同样的模式。提示音触发左转,左转导向凹槽,凹槽里有它们已经不再喜欢的巧克力奶。它们喝得少了一些,但还是去。一次又一次。即使苦味剂浓度高到让未经过度训练的大鼠坚决拒绝,这些已经形成习惯的大鼠仍然沿着老路跑下去。

格雷比尔在1990年代揭示的,是一个关于行为控制权的根本性转变。当大鼠刚开始学习T迷宫任务时,它们的行为是目标导向的:听到声音,想到巧克力奶,决定左转。大脑在评估结果的价值——巧克力奶好不好喝?值得跑这一趟吗?这个评估过程依赖前额叶皮层和腹侧纹状体的互动,是大脑的决策系统在主持工作。但当同样的行为被重复了数百到上千次之后,控制权开始移交。

大脑不再评估结果。它把整个行为序列打包成一个单元,交给了另一个系统去执行。这个系统位于大脑深处,叫背侧纹状体。它不评估、不思考、不预测。它只做一件事:接收情境线索,触发与之绑定的行为程序。

提示音—左转—跑—舔,这个序列被压缩成一个不可分割的块。一旦第一个环节被激活,后面的步骤自动展开。调用它的唯一条件就是那个提示音的出现。

格雷比尔实验室的发现坐落在一条更长的研究脉络上。1980年代和1990年代,神经科学家开始系统区分习惯行为与目标导向行为的大脑基础。一组关键证据来自啮齿类动物的操作性条件反射实验。研究者训练大鼠按压杠杆获取食物奖励,训练完成后用“结果贬值”程序来测试:在正式测试前让大鼠单独获取食物吃到饱足,或者让食物与引起不适的化合物配对。如果行为是目标导向的,大鼠在测试中会显著减少按压杠杆。它们的大脑在说:这个结果现在不值得了。

但如果行为已经被习惯化——经过大量训练之后——大鼠会继续按压杠杆,即使它们已经不再想要食物。按压频率几乎不受结果贬值的影响。

同一时期,神经科学家使用脑区损毁和药物干预来定位这两个系统。损害背侧纹状体会破坏习惯行为,让大鼠回到目标导向模式——即使经过大量训练,它们仍然对结果贬值敏感。

相反,损害前额叶或腹侧纹状体会让大鼠提前进入习惯模式,甚至在训练量还很小时就表现出对结果贬值的漠不关心。这不是说大脑有两个完全分离的系统。正常行为由两个系统共同参与,根据情境和训练量动态切换。但切换方向是明确的:重复越多,控制权越向后移。从需要思考到不需要思考,从评估结果到自动执行。

对于人类而言,这个切换每天都在发生。你开车回家。从公司停车场出来,右转上主干道,经过三个红绿灯,在超市路口左转,直行穿过两个街区,进小区大门。这条路你开了几百次。

某一天你计划顺便去超市买东西。上车,发动引擎,开出停车场。二十分钟后你发现自己已经停在了家门口。超市呢?你完全忘了。

你的身体执行了那个被重复了足够多次的程序——右转、直行、左转、直行、进小区——而你的意识在别处。这就是习惯自动化之后的日常版本。开车回家这个行为序列被背侧纹状体打包存储,由情境线索触发——下班、上车、熟悉的街景——然后一路执行到底,不需要前额叶介入。

脑成像研究为这个过程提供了直接证据。功能性磁共振成像显示,当人们执行高度熟练的行为序列时,前额叶皮层活动显著降低,背侧纹状体活动相对增加。

这种转移不是瞬间完成的。学习早期,前额叶和腹侧纹状体高度活跃,大脑在积极评估每个动作的结果价值。随着练习增加,这些区域的活动逐渐减弱,背侧纹状体参与逐渐增强。到了高度熟练阶段,整个行为序列可以在几乎没有前额叶参与的情况下完成。

这个切换的适应价值显而易见。如果每次开车回家都需要大脑从头评估转向的价值、计算红绿灯的意义、决定是否值得继续直行,我们一天下来会被最琐碎的决策耗尽认知资源。习惯自动化把高频行为从决策系统中卸载出去,释放前额叶去处理新的、复杂的事情。这是一个精妙的节能机制。

但节能机制的代价是:一旦行为被移交给习惯回路,结果评估就不再是行为的主要驱动力。情境线索取代了结果预期,成为行为的直接触发器。这正是格雷比尔实验中那些大鼠的处境。它们不是不知道巧克力奶变苦了——舔第一口时显然尝到了苦味。

但尝到苦味这个信息来得太晚了。行为序列已经被提示音激活,整个程序进入执行状态。从提示音到左转再到跑到凹槽,这个链条的各个环节被绑定得太紧,第一个环节的激活几乎必然导致后续环节的完成。大脑在提示音响起的瞬间就已经做出了反应——更准确地说,不是在“决定”,而是在“执行”。

这个区别至关重要。在目标导向模式下,行为由对结果的期待驱动。大鼠听到提示音,脑在预测巧克力奶的出现,多巴胺系统在评估这个预测的价值,前额叶在权衡是否值得跑这一趟。如果巧克力奶变苦了,评估链条会在某个环节被打断——预测不再有价值,行为停止。

但在习惯模式下,提示音直接触发行为程序。结果评估被绕过了。多巴胺预测误差信号仍然存在,但它不再对行为产生同样的控制力。大鼠的多巴胺系统在尝到苦味时可能发出了负向预测误差信号:比预期差。但这个信号没有阻止它下一次听到提示音时继续左转。

这就是行为自动化最令人不安的后果:行为与结果之间的反馈回路被切断了。

回路还在,但它的输出不再能有效干预行为的启动。结果变成了事后信息,而不是事前考量。

把这个发现从大鼠的T迷宫搬到人类的上瘾行为上,中间的距离比看起来要短。老虎机玩家在输光之后仍然机械地拍打按钮。手在屏幕上反复敲击,眼睛盯着滚动的符号——所有这些都发生在应该站起来离开的时刻。

他们不是不知道自己在输。在认知层面,他们完全清楚已经输掉了今晚的预算。但这个认知没有转化为停止行为的指令。

为什么?因为拍打按钮这个行为已经被习惯化了。在几十次、几百次、几千次的重复之后,老虎机的灯光、声音、触感——这些情境线索——已经和拍打按钮的动作序列绑定在一起,打包存储在背侧纹状体里。当玩家坐在机器前,屏幕亮起,按钮在手边,这些线索自动触发了行为程序。前额叶的“停”信号来得太晚,或者太弱,无法打断已经启动的执行流程。

短视频用户的情况类似。拇指向上滑动这个动作被重复了太多次。每一次滑动都发生在特定情境中:手机在手里,屏幕在眼前,内容在流动。

这些线索——手机的触感、屏幕的亮度、视频切换的过渡动画——构成了一个触发复合体。当这个复合体出现,拇指开始移动。用户可能在理智上知道自己已经刷了四十分钟,知道应该睡觉了。但拇指仍然在动。“看到屏幕—滑动拇指”这个行为序列已经被背侧纹状体接管,不再需要前额叶的批准。

这解释了上一章结尾留下的困惑。第六章描述了耐受升级:当奖励系统的阈值上移之后,同样的行为不再带来同样的快感,但行为非但没有减少,反而加剧了。当时的问题是:当奖励本身失效,是什么在继续驱动行为?

习惯自动化提供了答案的关键部分。在耐受发生之前,上瘾行为由奖励驱动。多巴胺预测误差信号在预期奖励时上升,在获得奖励时根据误差调整,驱动下一轮行为。这是一个目标导向的循环:行为是为了获得结果。

但当行为被重复足够多次之后,控制权开始从目标导向系统向习惯系统转移。到了某个临界点,行为不再需要奖励的参与也能自行运转。情境线索取代了奖励预期,成为行为的主要驱动力。

此时,上瘾完成了从“追求快感”到“自动执行”的蜕变。这不是说奖励系统完全退出了。多巴胺仍然在运作,线索仍然触发预期,获得奖励时仍然有反应。但这些信号对行为的控制力被削弱了。习惯回路一旦建立,它对行为的支配就不再完全依赖多巴胺的实时评估。即使多巴胺系统因为耐受而反应减弱——快感贬值,预期降温——行为仍然继续。因为驱动行为的已经不是对快感的追求,而是对线索的自动响应。

这就解释了上瘾行为中一个令人困惑的特征:主观渴求与客观行为之间的分离。许多上瘾者报告说,他们在某个阶段之后不再那么“想要”了——不再有强烈的渴望,不再期待巨大的快感,甚至对行为本身感到厌倦。但他们仍然在做。老虎机玩家说“我也不知道为什么还在玩”,短视频用户说“我其实不想看了”,游戏玩家说“这个游戏已经不好玩了”。

这些报告不是借口,也不是自我欺骗。它们是对习惯自动化状态的准确描述:行为在继续,但驱动它的已经不是“想要”。这个发现对“上瘾是选择”的观念构成了根本性挑战。

如果上瘾行为始终由目标导向系统控制——如果每一次赌博、每一次滑动都是前额叶评估利弊之后做出的决定——那么上瘾者确实可以被称为做出了糟糕的选择。他们需要的是更好的信息、更强的动机、更坚定的意志力。干预的方向是改变他们的想法。

但如果行为已经被习惯回路接管,如果情境线索可以绕过决策系统直接触发行为程序,那么“选择”这个概念在上瘾的后期阶段就变得模糊了。不是上瘾者选择继续,而是他们的脑在自动执行一个被重复了太多次的程序。他们在认知上可能完全认同应该停止,但这个认同无法穿透背侧纹状体对行为的控制。

这不是说上瘾者完全没有责任或完全无法控制。习惯不是不可打破的。格雷比尔后来的研究表明习惯回路可以被修改,只是需要特定的条件和方法。

但“可以改变”不等于“任何时候都可以通过意志力改变”。习惯自动化的核心含义恰恰是:在行为被触发的那个瞬间,意志力的介入窗口非常狭窄。这引向了本章必须面对的一个反方论点。

在关于上瘾的公共讨论中,一个长期占据主导地位的叙事是:上瘾本质上是个人自控力缺陷和道德弱点。产品设计被描述为中性工具——老虎机只是提供娱乐,短视频只是提供内容,游戏只是提供消遣。如果某些人无法控制自己的使用,那是他们自己的问题。这个叙事隐含的假设是:每个人在使用这些产品时都在做出自由选择,成瘾者和非成瘾者的区别只在于前者做出了更糟糕的选择。

习惯自动化的研究证据对这个叙事提出了质疑,但质疑的方式需要精确。它不是在说“上瘾者完全没有自由意志”——这是哲学命题,超出了科学证据的范围。

它说的是:当一个行为被重复足够多次之后,大脑处理这个行为的方式发生了物理层面的变化。控制权从前额叶移到了背侧纹状体。这个变化不是隐喻,不是类比,而是可以用脑成像、损毁实验和药物干预验证的神经事实。

在这个事实面前,“上瘾是选择”的简单叙事需要被修正。至少需要区分两个阶段:早期阶段,行为确实是目标导向的,选择的概念适用;

后期阶段,行为在很大程度上被习惯回路接管,选择的性质已经改变。在后期阶段,要求上瘾者“用意志力停止”就像要求一个已经开车到家门口的人“用意志力记得去超市”——问题不在于意志力够不够强,而在于行为控制系统已经切换了模式。

但这里有一个重要的限定。习惯自动化不是不可逆的脑损伤。背侧纹状体不是一块把行为永远锁死的硬件。格雷比尔实验室在后续研究中显示,习惯回路可以被修改,甚至可以被重新带回目标导向控制之下。关键在于,这种修改需要的不是单纯的“下定决心”,而是特定的环境干预和行为训练策略。

同样重要的是,习惯自动化并不发生在所有重复行为中。不是每一个经常赌博的人都会发展到习惯自动化阶段。习惯化的程度取决于训练量、奖励的不可预测性、情境线索的稳定性以及个体差异。格雷比尔实验中的大鼠需要数百到上千次训练才能完全习惯化;人类行为由于复杂程度更高,习惯化的阈值更难确定,但原理是一致的:重复越多,控制权转移越多。这带来了一个令人警醒的推论。

现代数字产品的设计——可变奖励、线索触发、耐受升级——恰好是最大化重复次数的设计。老虎机每分钟可以完成十到十五次下注,短视频每十五秒完成一次滑动,游戏中的重复操作以分钟甚至秒为单位计数。这些产品不是在等待习惯自然形成;它们在加速习惯的形成。

每一次下注、每一次滑动、每一次点击,都在把控制权从前额叶向背侧纹状体推进一小步。当一位老虎机玩家在一年内完成了十万次下注,当一位短视频用户在半年内完成了数万次滑动,他们的大脑已经把行为序列打包、压缩、存储,并移交给了那个不需要思考就能执行的系统。此时,坐在老虎机前或拿起手机这个动作本身,就已经是行为程序的启动键。

格雷比尔的T迷宫实验还有另一个细节值得注意。在那些已经形成习惯的大鼠中,有一部分在反复尝到苦味之后最终停止了跑迷宫。但这个停止不是发生在提示音响起之前——不是在听到声音后做出“不去”的决定——而是发生在它们跑到凹槽、尝到苦味、逐渐减少跑动次数的过程中。

改变不是通过阻止习惯程序的启动来实现的,而是通过反复暴露于负面结果,让结果反馈逐渐重新获得对行为的控制力。这个细节暗示了习惯修改的可能路径,同时也揭示了习惯的顽固性:即使在负面结果已经明确的情况下,行为程序的启动仍然无法被轻易阻止。提示音还是会触发左转,左转还是会导向凹槽。改变发生在执行之后,而不是执行之前。对于人类上瘾者来说,这个时间差是致命的。

老虎机玩家在输光之后决定“下次不玩了”,但下一次坐在机器前,灯光亮起,按钮在手下,手指已经按了下去。决定在那一刻被绕过了。不是决定不够坚定,而是决定根本没有被咨询。这就是习惯自动化工厂的最终产品:一个不再需要奖励驱动、不再经过决策审批、由情境线索直接触发、对负面结果相对免疫的行为程序。它不是意志力的破产,而是行为控制权的移交。

上瘾者没有失去“想要停止”的能力——他们仍然想要停止。他们失去的,是在触发情境出现时让“想要停止”介入行为启动的能力。这个区分直接关系到我们对上瘾的理解和应对。

如果上瘾是意志力破产,干预的方向是强化意志力——教育、劝说、惩罚。但如果上瘾是行为控制权移交,干预的方向是重新设计触发情境——改变线索的分布,打断行为序列的自动执行,创造条件让目标导向系统重新获得控制权。这便引出了一个更深层的问题:如果情境线索能自动触发习惯,那么谁控制了线索的分布,谁就在很大程度上控制了习惯。

当产品设计者可以系统性地布置触发线索——推送通知、界面设计、默认设置、时间节点——他们实际上是在设计用户的习惯回路。用户的背侧纹状体在不知情的情况下被编程,而编程的语言是线索与行为的重复配对。这不是阴谋论。这是行为自动化原理的直接推论。

如果线索能触发习惯,而产品设计者能控制线索的分布,那么产品设计者就在参与塑造用户的习惯回路。他们不需要侵入用户的大脑,不需要植入电极。他们只需要确保用户看到特定的线索,在特定的时间,以特定的频率。用户的大脑会完成剩下的工作。格雷比尔实验室的大鼠没有选择巧克力奶变苦之后是否继续跑迷宫。

它们的脑替它们选择了——不是基于对结果的评估,而是基于对线索的响应。当人类用户面对一个被精心设计的数字环境时,他们的大脑也在做着类似的事情。提示音已经响起。左转已经开始。而他们可能还在想,自己是在做一个自由的选择。