第 10 章

骰子在手中转动

我们通常以为,上瘾的驱动力来自得到奖励的那一刻——赢钱的狂喜、点赞的通知、下一条视频恰好击中笑点。这个直觉如此自然,以至于很少有人停下来追问它是否成立。但如果奖励本身才是驱动力,那么固定发放的奖励应该和随机出现的奖励具有同等的推动效果。每天早晨准点响起的闹钟、每月固定到账的工资,这些可预测的奖励会让人上瘾吗?不会。人们不会在周末设闹钟让自己享受被叫醒的快乐,也不会在工资到账短信响起时产生无法抑制的兴奋。可预测的奖励让人习惯,而非上瘾。真正让人停不下来的,是不知道下一次奖励何时出现。

这个反直觉的判断,在六十多年前的一间地下实验室里,被一群鸽子啄出了形状。1950年代中期,哈佛大学心理学家斯金纳已经因为“斯金纳箱”而闻名——一个隔音箱,里面只有一盏灯、一个可以啄击的按钮和一个食物投放口。鸽子被放进去,偶然啄到按钮,一粒谷物落下。很快鸽子学会了啄按钮获取食物。这是操作性条件反射的基本原理:行为被其结果强化。

但在接下来的实验中,斯金纳做了一件改变赌场业历史的事。他不再让每一次啄击都获得食物,而是引入了规则。有些鸽子被分配到固定比率程序:每啄十次,食物出现一次。

有些鸽子被分配到可变比率程序:食物出现的啄击次数在每次奖励后随机重置——这次啄五次就有,下次要啄二十次,再下次只要啄三次,平均下来也是十次换一次食物,但具体哪一次会出食物,鸽子无从预测。结果让斯金纳自己都感到震惊。固定比率组的鸽子啄击频率稳定,但保持在一个适中的水平。它们啄十下,吃一口,停一停,再啄十下。行为经济、有效率,像按时打卡的工人。

可变比率组的鸽子则完全不同——它们疯狂地啄,几乎不停。啄击频率是固定组的两倍以上。而且当斯金纳彻底停止投放食物后,固定组的鸽子很快放弃,啄击次数迅速下降;可变组的鸽子却持续啄了很久,仿佛无法相信奖励已经永远不会再来了。

这不是因为可变组得到的食物更多。两组平均获得的食物量完全相同。区别只有一个:不可预测性。

斯金纳在1957年与合作者费斯特出版的《强化的程序》一书中系统报告了这些发现。书中附有累积记录仪的曲线图——一种在纸上以恒定速度移动的笔,每次啄击笔就向上走一格,形成一条斜率代表啄击频率的线。固定比率程序的曲线呈阶梯状:一段陡峭的上升,然后一个短暂的平台——鸽子在吃食——再一段陡峭上升。可变比率程序的曲线则是一条几乎不间断的陡峭斜线,像心跳骤停前的室颤波形。那些鸽子在啄,一直在啄,忘记了停下来。

这本书出版后,学术界注意到了这个现象,但真正将其转化为大规模人类行为实验的,不是心理学家,而是赌场工程师。现代老虎机的核心是一个随机数生成器。这个组件在玩家拉下杠杆或按下按钮的瞬间,从一组预设的数字序列中抓取一个值,将其映射到转轮的停止位置上。早期的机械老虎机受限于物理转轮的齿数和弹簧张力,中奖概率由机械结构决定。

1970年代末微处理器进入赌场设备后,一切都变了。工程师可以在芯片中写入任意概率分布,精确到小数点后四位。

一台现代电子老虎机的中奖概率通常设定在85%到98%之间——不是指玩家能赢回85%的钱,而是指机器在足够长的时间内会将投注总额的85%到98%返还给玩家。赌场赚的是那2%到15%的差额。

但真正关键的不是返还率,而是返还的方式。如果一台老虎机每次都返还投注额的95%,玩家投入一块钱,机器立刻吐出九毛五,没有人会玩这个游戏。赌场工程师的技艺在于:将95%的返还率拆解成无数个大小不等的奖励,按照严格设计的随机时间表发放。绝大多数时候,玩家投入一块钱,机器显示“谢谢”——这是零回报。偶尔,机器返还五毛钱。更偶尔,返还两块钱。极其偶尔,返还五十块钱。而在数千次乃至数万次拉杆中,会出现一次大奖,返还数千元。

这个奖励分布被设计成一条长尾曲线:高频的小额零回报夹杂着低频的小奖,极低频的大奖拖在尾部。玩家在绝大多数时刻处于轻微的亏损状态,但这个亏损刚好被偶尔的小奖打断,而大奖的可能性始终悬在视野边缘。

这种安排精确地复现了斯金纳箱中的可变比率强化程序——只是鸽子换成了人,按钮换成了杠杆,谷物换成了硬币。赌场业内部对这个原理有着清醒的认识。国际博彩技术公司的工程师在设计文件中将可变比率称为“行为维持的核心机制”。拉斯维加斯的赌场经理们有一个行话:“让玩家留在设备上。”

一台老虎机每小时可以完成一千二百次以上的拉杆-结果循环。每次循环持续二点五到三秒,包括玩家按下按钮、转轮旋转、结果呈现和奖励发放的全部过程。在这个节奏下,玩家的大脑没有时间对每一次结果进行理性评估,只能被卷入下一个循环。而不可预测的奖励时间表确保了这个循环不会因为可预测性而失去张力。

赌场不是唯一发现这个原理的行业。2010年代,智能手机的普及将可变比率强化程序装进了每个人的口袋。社交媒体和短视频平台的通知系统是斯金纳箱的数字翻版。当你发布一条动态后,点赞和评论不会在固定的时间到来。它们按照一个由算法决定的、不可预测的时间表出现。

有时你发完几分钟内就收到回复,有时几小时毫无动静,然后突然涌来一波互动。这种时间表不是偶然的——平台工程师深知,如果每次发帖都立即获得相同数量的反馈,用户会很快适应并失去兴趣。只有不可预测的社交反馈才能维持用户反复查看的冲动。

短视频平台的“下一条”机制则更为直接。用户滑动屏幕,下一个视频的内容完全不可预测。可能是平淡无奇的日常记录,可能是恰好击中笑点的段子,可能是令人震惊的新闻画面,也可能是无聊的广告。绝大多数视频不会带来强烈的情绪反应,但偶尔——完全不可预测地——会出现一个让用户停下滑动、反复观看甚至分享的视频。这种偶尔出现的“大奖”维持着滑动行为。

用户的手指在屏幕上向上划的动作,与鸽子啄击按钮的动作,在行为形态上几乎没有区别。

游戏产业的“掉落”机制遵循同样的逻辑。在角色扮演游戏和射击游戏中,击败敌人后有概率掉落装备或道具。

这个概率被精心设计:普通敌人掉落有用物品的概率可能只有百分之几,稀有敌人掉落极品装备的概率可能低至千分之几。玩家反复刷同一个副本、击杀同一种怪物,不是因为每次都有收获,而是因为不知道哪一次会有收获。游戏设计师将这种机制称为“战利品箱”或“抽卡”,而其心理学基础正是可变比率强化程序——行为被不可预测的奖励维持在极高频率。

这些产品设计的共同特征在于:它们都将奖励从“可预期的回报”转化为“不可预测的可能性”。而这种转化之所以有效,根源在于大脑奖励系统的一个基本特性。

1990年代,剑桥大学的神经科学家沃尔弗拉姆·舒尔茨开始了一系列后来成为神经经济学奠基之作的实验。他在猴子的大脑中植入微电极,记录多巴胺神经元在奖励任务中的放电活动。实验的基本设置是:一个灯光提示出现,两秒后一滴果汁送到猴子嘴边。在训练初期,多巴胺神经元在猴子尝到果汁时猛烈放电——这是对奖励本身的反应。

但随着训练进行,一个奇怪的变化发生了:多巴胺神经元不再对果汁本身做出强烈反应,而是转而对灯光提示做出强烈反应。灯光一亮,多巴胺神经元就猛烈放电;果汁真正到来时,放电反而减弱甚至低于基线。

舒尔茨意识到,多巴胺不是“快乐分子”,而是“预测误差信号”。它不对奖励本身做出反应,而是对“奖励比预期好多少”或“比预期差多少”做出反应。当奖励完全可预测时——灯光后必定有果汁——多巴胺系统将反应重心从奖励转移到预测奖励的线索上。

而当奖励不可预测时,这个系统的反应模式变得更加极端。在舒尔茨实验室的一项关键实验中,研究人员将果汁出现的概率从100%降低到50%。灯光亮起后,只有一半的次数会有果汁。结果发现,多巴胺神经元对灯光线索的反应显著增强——比100%概率条件下强得多。而对果汁本身的反应则进一步减弱。换句话说,不确定性将多巴胺系统的焦点从“得到”彻底转移到了“期待”。

猴子的大脑不再关心果汁是否真的到来,而是被那个“可能有、可能没有”的悬念牢牢抓住。这个发现解释了为什么可变奖励比固定奖励具有更强的行为驱动力。不是因为在可变条件下获得的奖励更多或更大——实验中的果汁总量完全相同。而是因为不确定性本身增强了多巴胺系统对奖励线索的反应强度。每一次拉杆、每一次滑动、每一次啄击,都变成了一个充满悬念的时刻。大脑不是因为“得到了什么”而兴奋,而是因为“可能会得到什么”而持续处于被激活的状态。

舒尔茨的研究团队在1990年代末到2000年代初发表的一系列论文中进一步细化这个模型。他们发现多巴胺神经元的放电模式精确地遵循一个公式:实际奖励减去预期奖励。如果实际奖励等于预期,放电不变。如果实际奖励大于预期,放电增强——这是正向预测误差。如果实际奖励小于预期,放电减弱甚至暂停——这是负向预测误差。这个简单的计算机制构成了大脑评估一切奖励的基础算法。当奖励变得不可预测时,这个算法进入了一种特殊状态。

由于无法准确预测下一次奖励何时出现、多大强度,大脑被迫持续生成中等强度的正向预测误差——每一次行为都有可能带来超出预期的回报。即使大多数时候实际奖励为零——低于预期,产生负向误差——偶尔出现的奖励仍然足以触发强烈的正向误差,而这个正向误差的强度因为其不可预测性而被放大。系统整体上被锁定在一种高唤醒状态:多巴胺水平持续偏高,行为频率持续偏高,停止的能力持续偏低。

这就是斯金纳的鸽子疯狂啄击按钮的神经化学解释。这也是赌场玩家无法离开老虎机的神经化学解释。这同样是手机用户无法停止滑动的神经化学解释。

现在我们可以将第九章讨论的即时性与本章讨论的不可预测性放在一起观察。这两者不是简单的相加关系,而是乘法关系。即时性确保每一次行为都有机会立刻获得回报。如果拉杆后要等十分钟才知道结果,可变比率的魔力会大打折扣——延迟给了大脑冷却的时间,让理性评估得以介入。但如果拉杆后两秒半就知道结果,大脑没有冷却的时间。

行为与结果的反馈循环被压缩到如此之短,以至于每一次行为都几乎立刻触发一次多巴胺系统的预测误差计算。而不可预测性确保这个计算几乎每次都产生悬念。两者的结合制造出一种“随时可能中奖”的持续紧张状态。这种状态不是愉悦的——事实上,大多数老虎机玩家在游戏过程中报告的并非快乐,而是一种焦灼的期待混合着轻微的沮丧。他们不是在享受,而是在等待。等待那个不知道何时会来、但随时可能来的大奖。这种等待本身成为了行为的驱动力。

赌场工程师对这个机制的理解已经达到了精确量化的程度。现代老虎机的“命中率”——即任何金额奖励出现的概率——通常设定在20%到30%之间。这意味着每拉十次杆,大约有两到三次会得到某种形式的奖励,其余七到八次是零回报。这个比例不是随意设定的。如果命中率太高,玩家会觉得奖励来得太容易,缺乏悬念;如果命中率太低,玩家会在持续的零回报中丧失信心。

20%到30%的区间恰好维持着“差一点就能赢”的错觉,让每一次零回报都被解读为“下次可能就中了”。更精细的设计体现在奖励金额的分布上。绝大多数命中的奖励金额很小——投注额的一半或等额返还,刚好让玩家觉得“没亏太多”。中等金额的奖励出现频率低得多,但金额足够让玩家记住。而大奖的出现频率极低,但金额巨大,成为玩家口中流传的故事和继续玩下去的理由。这种分布确保了玩家在绝大多数时刻处于轻微亏损状态,但这个亏损被偶尔的小奖打断,而大奖的可能性始终悬在视野边缘。

工程上实现这个设计的是伪随机数生成器。这些算法从一个初始种子值开始,通过确定性数学运算生成一串看起来完全随机的数字序列。对于赌场监管机构而言,这个序列必须通过统计随机性检验,确保长期返还率符合申报值。但对于玩家的大脑而言,这个序列只需要做到一件事:让下一次奖励的出现时间无法预测。

现代老虎机使用的梅森旋转算法可以生成周期长达2的19937次方减1的伪随机序列——这个数字大到即使从宇宙诞生开始运行机器,也不会出现重复模式。在实际使用中,机器每毫秒从序列中抓取一个新值,玩家按下按钮的精确时刻决定了会抓到哪个数字。没有任何人类能够预测下一个数字是什么。

这种不可预测性在物理体验上被放大到了极致。老虎机的转轮设计经历了从机械到电子的演变,但其核心体验始终是:一个短暂的、充满悬念的旋转期。玩家拉下杠杆或按下按钮后,转轮开始转动。

在二点五秒到三秒的时间内,结果尚未揭晓,一切皆有可能。这个旋转期正是“预期落差引擎”达到峰值的时刻——大脑的多巴胺系统被悬念激活,预期与可能的结果之间形成了最大张力。骰子在手中转动的那几秒,比结果揭晓的瞬间更让人沉迷。

短视频产品的设计者显然理解了这个原理。在用户滑动屏幕后的二百毫秒内,下一个视频开始播放。这个延迟短于人眼感知运动连续性的阈值,意味着用户几乎没有时间意识到自己在等待。

但在这二百毫秒内,大脑的多巴胺系统已经被“下一个视频会是什么”的不确定性激活。滑动动作本身成为了一个微型的骰子投掷——绝大多数时候结果是平淡的,但偶尔会出现一个让人停下来的视频。而那个“偶尔”的不可预测性,维持着手指的持续运动。

游戏产业的“开箱”机制则将旋转期的体验发挥到了极致。许多游戏在玩家打开战利品箱时,会播放一段精心设计的动画:箱子摇晃、发光、裂开,物品图标逐个翻转显现。这段动画持续数秒,期间玩家的期待被拉伸到极限。游戏设计师知道,如果箱子瞬间打开、物品直接显示,玩家的兴奋感会大打折扣。

旋转期——悬念期——才是体验的核心。这正是老虎机转轮旋转的数字版本。这些设计的共同效果是将大脑锁定在“期待”阶段。多巴胺系统被不可预测的奖励线索持续激活,行为被维持在极高频率,而实际获得的奖励总量并没有增加——在许多情况下甚至减少了。老虎机的长期返还率低于100%,意味着玩家平均每投入一百元只能拿回不到一百元。

短视频平台上的绝大多数内容并不会给用户带来实质性的信息增益或情感满足,用户在滑动中消耗的时间远超他们从中获得的真正价值。游戏中的战利品箱开出有用物品的概率低到让玩家在论坛上抱怨连连,但他们仍然继续开箱。这不是因为人们在追求快乐。而是因为人们在追逐可能性。

舒尔茨实验室的后续研究为这个机制提供了更精细的神经解剖学定位。多巴胺神经元主要分布在中脑的两个区域:黑质致密部和腹侧被盖区。这些神经元的轴突投射到纹状体和前额叶皮层,形成所谓的“奖励通路”。

当奖励变得不可预测时,腹侧被盖区的多巴胺神经元对奖励线索的反应强度显著增加,而纹状体中的多巴胺释放模式也从阶段性释放转向持续性释放——不是短暂的脉冲,而是持续的偏高浓度。这种持续性释放维持着行为动力,使个体即使在奖励密度很低的情况下也继续行动。这解释了一个反直觉的现象:为什么人们在老虎机上输钱后往往玩得更久,而不是更短。如果上瘾的驱动力是获得奖励的快感,那么持续的零回报应该让人放弃。

但驱动力实际上来自对奖励的期待,而持续的零回报——只要偶尔被小奖打断——不仅不会削弱期待,反而会强化它。因为每一次零回报都在制造负向预测误差,而负向预测误差会驱动个体用下一次行为去填补落差。

现在我们可以回应那个最常见的反对意见了:上瘾本质上是个人自控力缺陷与道德弱点,产品设计只是中性的工具,成瘾者应承担主要责任。这个观点假设人类大脑在面对精心设计的可变比率强化程序时,拥有足够的认知资源来识别机制并做出理性决策。

但神经科学和实验心理学的证据指向相反的方向:可变比率强化程序劫持的是大脑中一个古老、自动、难以被意识覆盖的计算系统。多巴胺神经元对不可预测奖励线索的强烈反应不是通过意志力可以关闭的——就像你不能通过意志力让自己在看到美食时不分泌唾液。这不是道德问题,而是神经回路被精确工程化利用的结果。但这不是说个体完全没有能动性。理解机制本身就是一种能动性的恢复。

当你知道了可变比率强化程序的运作方式,当你意识到那个“再玩一次就可能中奖”的冲动不是来自真实的概率评估而是来自多巴胺系统对不可预测性的自动反应,你就在机制和行动之间插入了一个认知缓冲层。这个缓冲层不一定能立刻阻止行为,但它让“停止”成为一个可以被思考的选项。

斯金纳本人在晚年对自己的发现被大规模商业化应用保持了沉默。他在1971年出版的《超越自由与尊严》中讨论了行为技术的社会影响,但主要关注的是如何用强化程序改善教育和社会治理,而非如何抵御强化程序的操纵。他可能没有预见到,他在地下实验室里用谷物训练的鸽子,会在半个世纪后变成一个全球性产业的心理学模板。

鸽子啄击按钮的频率在可变比率程序下可以达到每秒数次,持续数小时不衰减。人类手指滑动屏幕的频率在短视频平台上可以达到每小时数百次,持续数小时不衰减。老虎机玩家的拉杆频率可以达到每小时一千二百次以上,持续数小时不衰减。

这三个数字背后的机制是同一个:不可预测的奖励时间表将大脑锁定在期待状态,行为被压缩成几乎没有间隙的连续流。在这个连续流中,停止的念头缺乏浮现所需的时间间隙。第九章讨论的即时性剥夺了反思的时间,本章讨论的不可预测性则剥夺了停止的理由——因为下一次可能就中了,现在停下可能恰好错过。这两个机制的协同效应制造出一种近乎完美的行为锁定:没有时间思考为什么应该停止,也没有理由相信现在停止比继续更好。

骰子在手中转动的那几秒,是整个机制最完美的封装。转轮在转,数字在跳,结果尚未可知。在这几秒里,所有可能性同时存在——大奖、小奖、零回报,每一种都在想象的视野内闪烁。大脑的多巴胺系统被这个悬置状态激活到最高点。而当结果揭晓——无论是哪种结果——悬念解除,多巴胺水平下降。但没关系。因为下一次拉杆就在两秒半之后。新的骰子已经在手中转动。