第 2 章
鸽子与按钮
如果我说,你在老虎机前重复拉杆的动作,与一只鸽子在实验箱里反复啄按钮的动作,在行为学意义上没有本质区别——你会觉得被冒犯吗?大多数人会。我们习惯把上瘾理解为一种人性的失败:意志力薄弱、道德松懈、自控力破产。这种解释框架有一个隐含的前提——上瘾是人类独有的困境,它源于我们复杂的精神世界出了故障。
但二十世纪中叶的一系列实验给出了一个更冷峻的可能性:也许根本不是人出了故障。也许是被放进了一个精确设计过的强化程序里。
要理解这套程序如何运作,我们需要暂时离开赌场和手机屏幕,进入一个其貌不扬的装置——斯金纳箱。斯金纳箱的英文名是Skinner box,更准确的术语叫操作性条件反射室。它由伯尔赫斯·弗雷德里克·斯金纳设计制作,当时他还是哈佛大学的研究生。
这个装置的外壳是一个足够大的盒子,能容纳受试动物——常用的模式动物包括实验室大鼠、鸽子和灵长类动物。
内部结构出奇简单:一面墙壁上装有一个可以啄击或按压的操纵装置——对鸽子来说是发光的塑料按钮,对大鼠是金属杠杆;下方有一个食槽,用于投递食物颗粒;此外还有灯、扬声器,以及一个自动记录行为的装置。
斯金纳本人并不喜欢斯金纳箱这个名字。他相信是克拉克·L·赫尔和他的耶鲁学生创造了这个表达,甚至曾要求霍华德·亨特在发表的文件中使用杠杆箱替代。但名字一旦被学界约定俗成,就很难收回。我们今天提到斯金纳箱,指的不仅是那个物理装置,也是一整套分析行为的逻辑框架。
这个框架的核心前提很简单:行为不是由内心状态驱动的,而是由它的后果塑造的。如果某个行为之后出现了奖励——行为学家称之为强化物——那么这个行为在未来重复的概率就会上升。鸽子啄按钮,食槽掉下食物,鸽子就会更多地啄按钮。大鼠按压杠杆,食槽掉下食物,大鼠就会更多地按压杠杆。不需要假设鸽子想要食物,不需要探究大鼠的动机。只需要观察一个变量:行为频率。这听起来过于简单,甚至有些机械。
但正是在这个看似简单的框架下,斯金纳和他的合作者发现了一个足以改写我们对上瘾理解的现象。实验的起点是固定比率强化。规则很清楚:鸽子每啄按钮一定次数,食槽就投递一次食物。比如每啄5次,得到一粒谷物。每啄10次,得到一粒谷物。在这种条件下,鸽子确实学会了啄按钮。它们的行为模式呈现出一种稳定的节奏:啄几下,吃一口,啄几下,吃一口。行为曲线平滑、可预测。如果实验者停止投递食物——也就是进入消退阶段——鸽子的啄击频率会逐渐下降,最终回归到很低的基线水平。这符合常识。奖励稳定发放,行为就稳定维持。奖励消失,行为就消退。没什么出人意料的地方。
但接下来发生的事情就不那么符合常识了。斯金纳改变了规则。他不再要求鸽子啄固定次数才给食物,而是引入了一个随机数——有时候啄5次给,有时候啄15次给,有时候啄30次给。平均下来还是每啄一定次数有一次奖励,但具体哪一次啄击会触发食物,变得不可预测。这种安排被称为可变比率强化。鸽子的反应令人震惊。
啄击频率急剧上升。鸽子不再有节奏地啄几下停一下,而是开始持续地、快速地、几乎不间断地啄按钮。每一次啄击都带着同等的紧迫感,仿佛这一次就会触发食物——尽管实际上触发概率并没有改变。更关键的是,当实验者彻底停止投递食物后,鸽子仍然在啄。啄击持续的时间远远长于固定比率条件下的鸽子。有些鸽子在奖励完全消失后仍然啄了数百次、数千次,甚至数万次。行为曲线发生了质变:不是平滑的消退斜坡,而是一条顽固的高原——即使后果已经为零,行为还在继续。
这就是可变奖励的原始形态。奖励的发放不再依赖固定次数,而是变得不可预测时,行为频率急剧上升,且消退极慢。重点不是鸽子想要奖励——这个心理学术语在这里没有解释力。重点是行为本身被奖励的时间结构塑造了。
每一次啄击都携带一个对下一次可能性的预测,而不可预测性恰恰让这种预测永远无法被彻底证伪。上一次啄了30次才得到食物,下一次可能啄3次就得到。每一次失败都可能是成功的前夜。
每一次啄击都携带一个微小的、无法被彻底熄灭的希望。现在让我们从鸽子箱转向你口袋里的手机。老虎机的旋转结果是如何决定的?现代老虎机内部有一个随机数生成器,它在每一毫秒都在生成数字——每秒数千个随机数。当你拉下杠杆或按下按钮的那一刻,机器抓取当前时刻的随机数,通过算法映射到转轮的停止位置。结果是完全随机的。上一次拉杆的结果与下一次拉杆的结果在数学上相互独立。没有快要中了这回事,没有这台机器欠我一次大奖这回事。每一次拉杆都是一个独立事件,中奖概率恒定不变。
但这个概率是多少?不同司法管辖区的赌场会公布老虎机的返还率——即长期来看机器吞入多少钱、吐出多少钱。一台返还率为百分之九十二的老虎机意味着,每投入一百元,长期预期损失是八元。
但长期是一个巨大的统计学陷阱。返还率是在数百万次拉杆之后才能逼近的理论值。在任何一个具体的夜晚,在任何一个人的具体体验中,结果分布可以极端偏离这个平均值。你可能连续拉五十次什么也不中,然后在第五十一次中一个小奖。
也可能连续中几个小奖,然后陷入漫长的干旱期。这种体验的节奏——不可预测、间歇强化、偶尔惊喜——恰好就是可变比率强化程序。
短视频的下一条内容遵循同样的逻辑。当你向上滑动屏幕,算法从内容池中调取一条新视频推送到你面前。这条视频可能让你觉得有趣、无聊、愤怒或毫无感觉。你无法预测下一条是什么。有些视频让你停留三十秒,有些让你三秒就划走。偶尔——不可预测地偶尔——会出现一条让你大笑、让你触动、让你忍不住分享的内容。
这个偶尔就是可变奖励。平台不需要保证每一条都好。只需要保证好的那一条出现的时间不可预测。你的拇指持续滑动的行为模式,与鸽子持续啄按钮的行为模式,共享同一套底层逻辑。
游戏的掉落物品系统可能是最赤裸裸的可变比率强化应用。在许多网络游戏中,击败怪物或完成任务后有一定概率掉落稀有装备。这个概率通常以公示表的形式存在——比如某件史诗装备的掉落率为百分之零点五。但百分之零点五意味着你可能在第一次就拿到,也可能在第五百次还没拿到。
概率分布是独立的:每一次击杀都是一次新的抽奖,上一次的失败不会增加下一次的成功率。游戏设计师精确地设置了这个概率值:太低会让玩家放弃,太高会让玩家快速满足后离开。千分之五到百分之二之间是一个被反复验证的甜蜜区间——足够低到制造稀缺感和期待感,又足够高到让玩家相信下一次可能就是我。
在这些场景中,行为频率极高但行为质量极低——这正是我们在第一章中观察到的上瘾行为的诊断性特征。每一次拉杆、每一次滑动、每一次击杀都携带的信息量趋近于零。它只是在维持运转,而不是在产生意义。
这里需要正面回应一个最常被提出的反驳:这些难道不是个人自控力的问题吗?老虎机、短视频和游戏本身是中性的工具,成瘾者难道不应该为自己的选择负责吗?
斯金纳箱中的鸽子给出了一个让这个反驳变得困难的答案。鸽子没有道德观,没有意志力强弱之分,没有童年创伤或人格缺陷。它们只是被放进了可变比率强化程序里。行为发生了。高频率的、难以消退的行为发生了。这不是鸽子的选择,也不是鸽子的缺陷。
这是程序作用于神经系统的必然结果。当然,人不是鸽子。人有前额叶皮层,有抽象思维,有能力反思自己的行为并做出长远规划。但问题恰恰在于:当我们面对可变比率强化程序时,这套高级认知系统并不总是在线。行为被奖励的时间结构塑造的过程,发生在大脑更古老、更基础的层面——那个层面与鸽子的神经系统共享着深远的进化同源性。
这就引出了一个不得不面对的问题:如果可变奖励比固定奖励更有效地驱动行为,那么更有效到底意味着什么?它作用于大脑的什么部位?什么神经回路让不可预测性本身成为一种如此强大的行为引擎?
斯金纳箱给出了行为的证据,但它没有给出大脑的证据。鸽子啄按钮的频率曲线可以被精确记录,但鸽子的颅内发生了什么,在那个时代的实验技术条件下是不可见的。斯金纳本人对大脑内部的问题持谨慎甚至排斥的态度——他认为行为科学应该专注于可观察的变量:刺激、反应、强化程序。推测大脑内部机制属于另一种分析层级,可能引入不必要的推测和混乱。但问题不会因为被搁置就消失。
当我们把可变奖励的概念从鸽子箱延伸到人类产品设计时,我们实际上已经跨过了一条隐形的边界:从外部行为观察进入了内部神经机制推测。我们说老虎机劫持了大脑的奖励系统,说短视频利用了多巴胺回路——但这些说法如果没有来自神经科学的直接证据,就只是隐喻。
隐喻是有风险的。把大脑说成被劫持,暗示了一个罪犯和一个受害者——产品设计者是罪犯,用户是受害者。
但鸽子实验告诉我们,可变比率强化不需要任何恶意意图就能发挥作用。斯金纳设置程序不是为了伤害鸽子,他只是在观察行为的规律。同样,产品设计师优化留存率和参与度指标时,他们是在追求商业目标,而不是蓄意制造上瘾者。问题不在于意图,而在于结构:某种反馈结构一旦被建立起来,就会按照它自己的逻辑运行,无论建立者的主观意愿如何。
这就把问题从道德谴责的框架中彻底移出了。与其问谁该为此负责,不如问这个结构是如何运作的。前者导向审判,后者导向理解。而理解——对机制的清晰理解——本身就是一种防御的开始。
不过这里需要保持证据的诚实。可变比率强化驱动行为频率上升这一现象,在实验室条件下已经被反复验证。效应量很大,复现性很高。
但实验室中的消退实验——停止奖励后行为仍持续很久——其持续时间的具体数值在不同实验中差异很大。有些鸽子在几千次啄击后停止,有些持续了数万次。变量包括鸽子的品种、实验前的剥夺状态、之前接受的强化历史、实验箱的具体环境等。把实验室数据直接外推到人类行为上时,需要保持谨慎。
同样需要谨慎的是可变奖励这个概念本身的外延。在斯金纳箱中,可变比率强化有严格的操作定义:奖励的概率分布是已知的、由实验者控制的、独立于动物行为的。但在老虎机、短视频和游戏掉落中,奖励的概率分布不仅复杂得多,而且往往不是真正随机的——算法会动态调整推荐策略,游戏公司可能根据玩家行为数据微调掉落率,尽管公示表上写的是一个固定数字。这些系统比斯金纳箱复杂得多,但底层的强化逻辑是一致的:不可预测性维持行为。
在鸽子箱与老虎机之间,有一个技术细节值得停下来仔细看——因为它是整个可变奖励逻辑从实验室走向赌场地板的关键桥梁。
现代老虎机的核心是一个随机数生成器,通常缩写为RNG。这个装置的工作原理并不复杂,但它的行为学后果却极其深远。RNG本质上是一个算法,它在每一毫秒都在生成数字——不是每秒几千次,而是每秒数十万次甚至数百万次。这些数字是完全随机的,或者说在统计学意义上足够接近完全随机。当你拉下杠杆或按下旋转按钮的那一刻,机器抓取当前纳秒级的RNG输出值,通过一个映射函数将其转换为转轮的停止位置。
关键在于:RNG在你拉杆之前、之中、之后都在持续运行。它不等待你的动作,不记忆你的历史,不计算你投入了多少钱。你选择拉杆的精确时刻——精确到毫秒——决定了结果。早一毫秒或晚一毫秒,转轮会停在完全不同的位置。
这意味着两件事。第一,结果是真正独立的。上一次拉杆和下一次拉杆之间没有任何数学关联。机器没有记忆,没有欠你的大奖,没有快要中了的中间状态。每一次拉杆都是从一个固定的概率分布中重新抽样。第二,你永远无法通过观察过去的结果来预测未来的结果——不是因为预测太难,而是因为在独立事件的数学定义下,过去根本不携带未来的信息。
但人脑不是这样工作的。人脑是天生的模式识别机器,它在随机序列中寻找规律,在噪音中寻找信号。当你连续拉了四十次什么也没中时,大脑会自动生成一个直觉:下一次中的概率应该更高了。这个直觉在自然世界中通常是有效的——如果一片果林连续四十棵树都没有果实,下一棵树有果实的概率确实更高,因为果实的分布通常不是独立的。但在老虎机面前,这个直觉是系统性的错误。机器用独立事件替换了自然世界中的依赖事件,但你脑内那套古老的模式识别系统并不知道这个替换已经发生。
游戏掉落系统将这种逻辑推向了更精细的设计层面。在网络游戏中,稀有装备的掉落率通常以公示表的形式存在——这是监管要求的一部分,也是玩家社区激烈讨论的焦点。一张典型的掉落公示表会列出不同物品的掉落概率:普通物品百分之三十,稀有物品百分之五,史诗物品百分之零点五,传说物品百分之零点零五。这些数字看起来精确而透明。
但公示表没有告诉你的是概率分布的独立性和抽样的时间结构。百分之零点五的掉落率意味着每一次击杀都是一次独立的随机试验。你第一次击杀有百分之零点五的概率获得史诗装备,第一百次击杀仍然是百分之零点五,第一千次仍然是百分之零点五。上一次的失败不会累积任何意义上的进度条——除非游戏设计师额外添加了一个独立的保底机制,而这恰恰是因为纯粹的独立概率分布对玩家来说太残酷了。
这里有一个统计学上的反直觉事实:在独立概率分布下,即使你击杀怪物两百次,你获得至少一次史诗装备的概率也不是百分之百,甚至不是百分之六十三——具体数字可以通过二项分布精确计算,但关键不是具体数值,而是它永远达不到确定性。每一次击杀都是一次新的开始,同时也是一次新的可能失败。
这种不确定性恰恰是维持行为频率的核心引擎。游戏设计师在设置这些概率值时经过了大量的迭代和测试。千分之五到百分之二之间被反复验证为一个有效的区间——低于千分之一会让玩家因为长期得不到奖励而放弃,高于百分之五会让玩家快速获得满足后离开。
但这个区间不是凭空产生的。它来自对玩家行为数据的持续监测:多少玩家在多少次击杀后流失?哪个概率值能最大化玩家的总游戏时长?这些数据被反馈到掉落率的调整中,形成一个不断优化的闭环。
斯金纳当年在实验室里手动调整可变比率的参数时,依靠的是鸽子的累积记录——纸带上画出的啄击频率曲线。他可以看到哪个比率设置导致行为消退,哪个比率设置维持行为最久。
这就回到了本章开篇的那个反直觉判断:你在老虎机前重复拉杆的动作,与鸽子在实验箱里反复啄按钮的动作,在行为学意义上没有本质区别。这个判断让人不舒服,因为它剥夺了我们赋予自身行为的特殊意义。我们愿意相信自己的行为是由复杂的内心世界驱动的——欲望、希望、恐惧、梦想。而行为学的冷峻框架似乎在说:不,你只是在响应一个强化程序。
但也许这个框架并不像表面看起来那么冷峻。恰恰相反:如果行为是由程序塑造的,那么当一个人陷入停不下来的循环时,问题就不在这个人怎么了,而在这个人被放进了什么程序里。这不是为个人选择开脱责任,而是重新定位责任的归属:设计这些程序的人和组织,是否应该承担他们应负的那部分责任?我们是否应该要求产品设计的透明度——不只是掉落率的公示,还包括强化程序本身的公示?
这些问题已经超出了实验室的范围。它们涉及政策、伦理和商业利益。但在进入那些争论之前,我们需要先回答一个更基础的问题:可变奖励为什么更有效?
不可预测性究竟触发了大脑内部的什么机制?这个问题悬在行为学证据和产品设计现实之间。鸽子啄按钮的频率曲线被精确记录了六十年,但曲线下面的神经回路仍然是一个黑箱。斯金纳的实验证明了奖励的时间结构可以塑造行为的频率和持久性,但无法解释为什么不可预测的奖励比固定奖励更有力量。
是哪种神经信号在鸽子啄下按钮的瞬间被点燃?是什么让不确定性本身成为一种如此有效的强化物?这些问题的答案不在行为学的工具箱里。要打开这个黑箱,我们需要进入另一个实验——一个在斯金纳箱出现之前就已经开始、但直到二十世纪五十年代才真正揭示其意义的实验。那个实验涉及的不是鸽子和按钮,而是大鼠和电击,以及一个意外发现的大脑快乐中枢。正是这个发现,为理解不确定性如何转化为快感提供了关键的神经线索。