第 12 章
是全书的第二个理论收束点
谁该为这次崩溃负责?答案并不简单,但一个戏剧性的案例给了我们观察的棱镜。没有一家正常的公司,会在周五下午突然解雇自己的CEO。
2023年11月17日,OpenAI的六人董事会在没有任何事先警示的情况下发布了一则简短声明:萨姆·阿尔特曼即刻卸任首席执行官,首席技术官米拉·穆拉蒂出任临时CEO。声明给出的解释在公司治理史上都算奇特——董事会经审慎审查后认定,阿尔特曼在与董事会的沟通中未能保持一贯坦诚,妨碍了董事会履行职责。一家估值逼近900亿美元的公司掌门人,去职理由不是财务违规,不是战略失败,不是道德丑闻,而是“不够坦诚”。它听起来更像一次破裂的婚姻咨询,而不是一份上市公司公告。
但OpenAI从来就不是一家正常的上市公司。它的股权结构我们之前分析过:一个非营利母公司,控制着一个设有利润上限的营利子公司。2019年设计这个结构时,多数人觉得它聪明——既能吸引资本,又不必背叛使命。但很少有人认真想过:当这个非营利董事会真的决定行使它的法定权力时,会发生什么。
接下来的72小时,恰好构成了这本书需要的天然实验。前面十一章,我们逐层拆解了芯片、云服务、开源模型和应用层的运作逻辑——每一层都是独立的生态系统,有自己的竞争节奏、利润模型和技术信仰。但这些章节留下了一个尚未被正面回答的问题:当这四层真的耦合在一起运转时,它们之间的互动是缓冲还是放大?是彼此制衡,还是共振崩溃?OpenAI的董事会政变,给了我们一个观察窗口。
用电力系统的语言来理解会更容易进入状态。现代电网是一个精心设计的耦合系统:发电站、输电网、配电网和终端用户,每一层都有自己的运行逻辑和保护机制。当一座主力电站突然跳闸——不管是因为设备故障、操作失误还是人为关停——电网的其他部分不会被动等待。继电保护装置会在零点一秒内动作,自动切断故障区域;调度中心立即启动备转容量;大工业用户可能被强制限电以保障居民用电;而在市场另一端,电价瞬间飙升,给所有参与者发送稀缺信号。这些反应各自都是理性的、设计好的、经过反复演练的。
但没有任何一个电力工程师会告诉你,这些反应的总和一定导向最优结果。2003年美加大停电的起因,不过是一根输电线在俄亥俄州碰到了一棵没有修剪的树枝。继电保护装置按设计动作切断了这条线路,这本是正确操作,但这使得相邻线路过载,触发下一级保护动作,最终在几分钟内连锁崩溃,五千万人失去供电。每一层都做了自己该做的事,系统却塌了。OpenAI的危机就是AI产业链的那根树枝。我们要看的,就是四层结构各自的“继电保护装置”如何动作,以及这些动作加在一起,究竟是稳住了系统,还是累积了更大的风险。
芯片层的反应最先到来,也最容易被误解。
11月17日下午声明发布后,英伟达股价应声下跌。这个联动让很多追踪科技股的财经媒体措手不及——OpenAI不是英伟达的子公司,也不是它的最大客户,为什么一家公司CEO的去留会影响另一家芯片公司的市值?市场从来不需要等待分析师给出完整框架才做出反应。机构交易员们或许没有读过我们对四层结构的拆解,但他们凭直觉理解了一件事:OpenAI是高端GPU最大的采购方之一,如果这家公司陷入治理混乱,它的下一代模型训练会不会推迟?它向云服务商转售算力的承诺是否还能兑现?它在2024年预订的那批H100订单会不会被削减?
这些问题的答案在当时是未知的,但不确定性本身就足以让持有英伟达股票的人重新计算风险溢价。我们在前面章节分析过,英伟达的商业模式建立在一个基本假设之上:对AI算力的需求将呈指数级增长,且这种增长是可预测的。黄仁勋在每一个财报电话会上都在强化这个叙事——云服务商在扩建数据中心,各国政府在建设公共算力平台,企业在训练自己的垂直模型,所有这些都需要GPU。但当最大的需求方之一突然陷入不确定性,这个叙事就出现了一道裂缝。
裂缝很小——英伟达在那个季度的财报依然亮眼,H100的交付周期仍然排到几个月之后——但它暴露了一个结构性的脆弱:芯片层的客户集中度正在成为一个系统级风险。这不是说英伟达做错了什么。恰恰相反,英伟达一直在刻意分散风险,它的GPU同时卖给云服务商、企业客户、研究机构和政府,没有任何单一客户占其收入超过百分之十。但分散的直接客户端不等于分散的终端需求。当OpenAI的API突然变得不可靠时,数千家基于GPT构建的应用层公司同时遇到麻烦,而这些公司中很多算力需求是通过云服务商的GPU实例来满足的。需求端震荡的传导路径不是树状的,而是网状的——这正是电网工程师们最头疼的拓扑结构。
现在让我们进入云服务层。
如果说芯片层的反应更多是金融市场的预期调整,那么云服务层的介入则是实质性的权力介入。微软CEO萨提亚·纳德拉在那个周末几乎没有合眼。这不是修辞。根据后来的多方报道,纳德拉亲自参与谈判,在OpenAI董事会、阿尔特曼和被卷入漩涡的投资者之间斡旋。他的紧迫感不需要解释:微软已经向OpenAI投入了超过130亿美元,Azure的AI服务几乎完全绑定在OpenAI的技术路线上。
这里有一个容易被忽略的时间线。2020年9月,微软取得GPT-3的独家授权——这是一个在AI商业史上具有分水岭意义的协议,一家云服务巨头把其最前沿的AI产品线押注在另一家公司的模型上。在这之后,微软将OpenAI的模型深度整合进Azure服务,推出Azure OpenAI服务,将其与自家的Copilot产品家族打通,甚至把必应的搜索体验重构在GPT架构之上。到2023年11月,Azure的AI服务已经成为微软云计算增长最快的业务板块。而这一切,都依赖于一家其CEO可以被六人董事会在周五下午解雇的公司。
微软在那个周末的反应,完美呈现了我们之前讨论过的云服务层避险逻辑。一方面,纳德拉公开表示尊重OpenAI的治理结构,强调微软与OpenAI的长期合作关系不会改变。另一方面,他迅速启动备用方案,开始接触阿尔特曼,探讨他加入微软直接领导一个独立AI研究团队的可能性。这个操作如果放在多云战略的语境里,就是典型的“不要把鸡蛋放在一个篮子里”:当主力供应商出现不确定,立即启动供应商切换预案。
但这里有一个更深层的紧张。微软不是普通的云客户。它不仅是OpenAI最大的投资人、最重要的算力提供方,还是最关键的战略合作伙伴。这三重身份在正常情况下是互补的:作为投资人,微软分享OpenAI的商业回报;作为算力提供方,Azure通过OpenAI的工作负载获得收入;作为合作伙伴,微软把OpenAI的模型打包进自己的产品体系。但在危机来临时,这三重身份开始互相拉扯。作为投资人,微软需要OpenAI尽快恢复稳定;作为算力提供方,微软需要确保GPU实例的利用率不会因为混乱而下滑;作为合作伙伴,微软需要向自己的企业客户证明Azure AI服务的连续性不会受到影响。
这三重目标并不总是指向同一个方向。如果你只是投资人,最简单的做法是支持阿尔特曼回归,因为市场相信他能稳定公司。如果你只是算力提供方,最理性的做法是同时拥抱替代方案——开源模型、其他闭源模型——这样无论OpenAI发生什么,你的GPU总能被租出去。如果你只是合作伙伴,最关键的是向客户展示你有备用计划,这样他们不会因为OpenAI的危机而逃离Azure。微软在那个周末同时扮演了这三个角色,这让它的反应既迅速又充满矛盾。纳德拉公开支持阿尔特曼回归,私下谈判备用方案,同时在企业客户沟通中强调Azure的多模型支持能力。
这个三线并行的策略最终奏效了——微软的股价在那个周末几乎没有受到影响,Azure AI服务的客户也没有出现大规模流失——但它的成功恰好说明了一个尴尬的事实:在AI产业链上,云服务层的抗风险能力不来自于系统设计,而来自于单一参与者的博弈智慧。如果微软当时没有纳德拉这样能够同时驾驭三重角色的领导者,或者如果微软对OpenAI的绑定更深一层——比如已经把OpenAI的模型写进了不可替代的核心企业合同——那么云服务层的连锁反应可能会严重得多。
这就把我们带到了开源模型层。
如果说云服务层的反应是精英博弈,那么开源模型层的反应就是草根市场的即时投票。在11月17日之后四十八小时内,Hugging Face平台上OpenAI竞品模型的下载量出现了陡峭的上扬。Meta的Llama 2、阿布扎比技术创新研究院的Falcon、法国Mistral AI的模型——这些在第十一章中被我们详细分析过的开源或开放权重模型——下载量在极短时间内增长了超过百分之三百。
这个数字本身需要被审慎解读。下载量不等于使用量,使用量不等于持续部署。很多在恐慌中下载开放模型的开发者,可能在下载后发现自己没有足够的GPU来运行650亿参数的LLaMA 2,或者没有技术团队来做微调和部署。我们在第十一章花了不少篇幅分析开源社区里的隐形等级结构——核心维护者、贡献者和沉默下载者之间的权力差异——这个结构在危机中不是被削弱了,而是被凸显了。下载按钮被疯狂点击,但真正有能力基于开源模型构建可用替代方案的人,仍然是极少数。
但开源模型层的反应本身,已经传递了一个对整个产业链至关重要的信号:闭源模型的护城河比市场想象的要浅。就在几个月前,OpenAI的GPT-4被认为与开源模型之间存在代际差距。但到2023年11月,这个差距已经被各种开放模型迅速蚕食。Hugging Face上的开放大语言模型排行榜成了一个每周更新的大型真人实验:开源社区在基准测试上追赶闭源模型的速度,超出了大多数分析师的预期。
这个信号改变了危机中的权力平衡。如果开源替代方案不存在或不成熟,那么OpenAI的治理危机就会演变成一场真正的算力恐慌——开发者和企业除了等待OpenAI内部问题解决之外别无选择,整个应用层将陷入被动停滞。但开源模型的存在提供了一个出口。即使大多数人没有能力在这个出口真正安家,出口本身的存在就改变了谈判格局。它给了微软在谈判中更大的回旋余地——可以认真考虑“如果OpenAI真的瘫痪怎么办”——给了应用层开发者一定的心理缓冲,知道在最坏情况下可以尝试切换,也给了OpenAI内部博弈各方一个明确的警示:这个世界不会等你。
现在来看应用层,这也是最后一层,以及整个压力测试中最赤裸的部分。
到那个周末结束时,数千家基于GPT API构建的公司突然意识到,自己的商业模式建立在一家可以被六个人在周五下午颠覆的公司之上。这些公司形态各异——有的是法律文档审查工具,用GPT来总结和标注合同条款;有的是营销文案生成器,根据产品描述自动生成电商文案;有的是语言学习应用,用大模型模拟对话伙伴;有的是代码辅助工具,帮助程序员自动补全函数。它们的共同点是全部依赖OpenAI的API。对其中很多公司来说,模型切换不是一个简单的“换个API端点”的操作。它们的提示工程、输出解析、安全护栏、性能调优,全部围绕GPT的行为特征构建。切换模型意味着重新做一遍这些工作——如果团队有足够的技术能力的话。
这个场景恰好解释了我们之前引入的那个概念:算力税。前面各章在分析算力税时,主要聚焦在资金成本上——为GPU支付的费用,为API调用支付的token计费,为云服务支付的实例租金。但OpenAI的危机让另一种算力税暴露出来:锁定成本。当你把整个技术栈建立在一个供应商的模型上时,你支付的不仅仅是每千个token四美分的调用费,你还支付了一项隐性税款——你丧失了切换供应商的自由,而这种丧失,在危机来临之前看起来像是“技术选型”,在危机来临之后才显现为“战略脆弱性”。
应用层在那七十二小时里的处境,就像是电网末端的居民用户。当主力电站跳闸时,他们没有收到任何事先通知,没有参与任何决策过程,没有备用电源可以自动切换。他们能做的只有等待——等待OpenAI董事会和阿尔特曼之间博弈出结果,等待微软的斡旋起效,等待事态恢复“正常”。但“正常”这个概念本身在那个周末被重新定义了。在此之前,“正常”意味着你的API供应商治理稳定、服务持续、路线图清晰。在此之后,“正常”意味着你得做好API供应商随时可能出事的准备。
这里需要回应一个有力的反方解释。
有一种观点认为,AI产业链本质上是芯片厂商主导的垂直整合,其他三层只是其利润捕获的延伸。按照这个逻辑,OpenAI的治理危机不过是表面波澜——无论阿尔特曼是否留任,无论应用层公司是否切换模型,最终都需要向英伟达购买GPU。开源模型下载量的暴涨,如果转化为实际部署,只会增加对GPU的需求。所以芯片层不仅不会被震荡动摇,反而会在震荡中巩固其垄断地位。
这个解释有相当强的实证支持。英伟达在那七十二小时里股价虽然短暂下跌,但很快就收复失地并继续上行。2023年第四季度英伟达的财报再次超出预期,H100的订单排期没有任何松动迹象。从终端算力需求来看,无论GPT-4还是LLaMA 2在跑,都需要GPU;无论模型是闭源还是开源,训练和推理都要消耗算力。芯片层确实像一个收取绝对地租的地主——土地不管种什么作物都要交租,GPU不管运行什么模型都要付费。
但这个反方解释忽略了一样东西:算力垄断的形式在变化。英伟达对GPU市场的控制毋庸置疑,但这种控制越来越像基础设施垄断——电力公司控制输电网络,但电力公司不决定你用电来制造什么产品;电信公司控制基站和光纤,但电信公司不决定你在网络上传什么内容。英伟达控制芯片设计和供应,但英伟达选择不——或者说基于商业理性不——决定你用GPU来运行谁的模型、构建什么应用。
这个区分为什么重要?因为它意味着,尽管芯片层收取“算力税”,但这个税是相对中性的——它对所有下游参与者一视同仁。你买H100来跑GPT-4也可以,来跑LLaMA 2也可以,来训练自研模型也可以。英伟达从每一笔订单中都获得收入,但它不关心、也无法有效控制这些GPU最终被用于构建一个闭源的AI帝国还是一个开源的去中心化生态。这种中立性构成了整个四层结构的稳定性底座:只要算力本身不被政治化——比如被用作出口管制工具,我们在之前的章节中讨论过这个风险——芯片层的垄断不会自动转化为对下游的控制。
真正的问题出现在哪里?出现在芯片层之上。当算力垄断形式从中性基础设施向垂直整合转化时——比如一家公司同时控制芯片供应和模型服务,并且利用这种双重身份来排挤竞争对手——那才是真正的系统性风险。目前这种情况在AI产业里还没有完全出现。英伟达不拥有自己的闭源模型,尽管它提供NeMo等工具;OpenAI不制造自己的芯片,尽管有报道称它在探索自研芯片;微软提供云服务但不设计GPU。每一层的主要玩家都还守在自己的核心领地里。但这种相互克制能持续多久,是后半本书需要面对的开放问题。
让我们回到那七十二小时的时间线,因为还有一个关键细节没有被完全展开。
11月22日,在阿尔特曼重新出任CEO的消息宣布后,路透社发布了一则报道,为这场戏剧提供了之前缺失的拼图。根据路透社援引两名知情人士的说法,在阿尔特曼被解雇四天之前,几位OpenAI的研究人员给董事会写了一封信,警告说他们认为一项重大人工智能发现可能对人类构成威胁。这个项目的内部代号是Q*,旨在开发人工智能在逻辑推理和定理证明方面的能力。
记录只到这一步。我们不知道Q*具体是什么技术架构,不知道那封信的准确措辞,不知道六人董事会在审议这封信时的内部讨论过程。但已披露的信息对于理解这场危机已经足够关键:一个非营利董事会,因为收到来自内部技术人员的AI安全警告信,决定行使2019年章程赋予它的权力,罢免了一位带领公司取得巨大商业成功的CEO。这个决策逻辑,从其自身视角来看,是完全一致的——OpenAI的非营利章程反复强调,公司的首要忠诚对象是“全人类”,当使命与商业利益发生冲突时,使命优先。但正是这个在其自身体系内自洽的决策逻辑,在全产业链上引发了连锁震荡。
这就触及到了四层结构最深层的悖论:每一层的设计逻辑在各自层面都是合理的,但当它们耦合在一起时,合理性之间的冲突可以撕裂整个系统。
非营利董事会的安全关切实属正当。如果我们真的相信AI技术可能带来存在性风险,那么“在收到内部研究人员的技术安全警告后认真审议并采取行动”恰恰是负责任的做法。问题不在于董事会的决策逻辑是否自洽,而在于这个自洽的决策逻辑产生的外部效应完全落在了其他层上——落在微软的130亿美元投资上,落在英伟达的股价上,落在Hugging Face上下载开源模型的开发者身上,落在数千家GPT API初创公司的商业连续性上。这些外部效应,没有一个被纳入了OpenAI董事会那个周五的决策考量。
这不是因为董事会成员冷漠或短视,而是因为OpenAI的非营利治理结构在设计时就没有为其决策配置考虑全产业链外部性的制度接口。六人董事会对OpenAI的非营利使命负责,而不是对AI产业链的系统稳定性负责。他们被授权决定CEO的去留,但没有人授权他们——也没有机制可以让他们——在做出这个决定之前评估其对算力市场、云服务生态、开源社区和应用层就业的影响。
这就引导出一个更基本的追问:在AI产业链上,谁有系统级的责任?当电网的一座主力电站可能跳闸时,调度中心会在几秒钟到几分钟内做出反应,因为它有对全网的责任和相应的权威。但在AI产业链里,不存在调度中心。有的是一系列双边合同——OpenAI与微软的投资协议,应用层公司接受的API服务条款,开源社区的许可证和贡献者协议——这些工具设计出来是为了界定局部关系,而不是为了管理全系统风险。
2023年11月的那七十二小时最终以一种充满戏剧性的方式收束。阿尔特曼在员工集体辞职威胁和投资者压力下重返OpenAI,董事会重组,劳伦斯·萨默斯等新成员加入。OpenAI宣布成立一个新的安全委员会,并承诺加强治理结构的透明度。危机平息了。
但平息不等于解决。那七十二小时作为一次全链路压力测试,暴露的问题不会因为阿尔特曼回归而自动消失。恰恰相反,它把一些问题从理论可能变成了被真实经历过的风险——应用层的每一家初创公司都意识到,原来你的主要供应商真的可以在没有任何预警的情况下陷入瘫痪;云服务商的战略团队都开始把“关键模型供应商治理风险”写入尽职调查清单;开源模型社区看到了自己在危机中的机会和局限。
这些认识不会自动转化为行动,但它们改变了决策的基线。在那之后,多模型策略不再是锦上添花的备选项,而变成了企业AI部署的标配。从应用层公司的视角看,同时接入OpenAI的GPT、Anthropic的Claude和至少一个开源模型——比如通过API服务来调用LLaMA——不是技术路线的偏好问题,而是商业连续性的底线要求。这个转变的规模有多大,要在后续的章节中具体展开,但它的起点就在那七十二小时里。
算力税和瓶颈转移这两个概念,在这里汇合。
算力税的形式,随着那次危机发生了微妙但重要的变化。在此之前,算力税主要表现为资金成本——买GPU的钱,付API费用的钱,租云实例的钱。但在那七十二小时里,另一种算力税科目暴露出来:治理脆弱性溢价。当你的算力供给方可以被一个非营利董事会的内部决议中断时,这个风险不是零,它是有价格的。有价格就意味着有人要支付它,支付者通常是最末端的那一层——应用层。
瓶颈转移正在朝这个方向移动。2023年初,瓶颈在芯片供给端——谁能拿到H100谁就有话语权。2023年中,瓶颈在模型能力端——谁的模型在基准测试中领先谁就主导定价权。到2023年底,随着开源模型快速追赶和那次危机的冲击,瓶颈开始向应用端转移——瓶颈不再是有没有足够好的模型,而是谁能把模型的输出可靠地翻译成商业价值,并且在这个过程中不被上游的震荡击垮。
这个判断需要被检验而不是被宣告,所以它会被放在本书后续的章节里用具体的产品和公司来追踪。但在第二个理论收束点,我们可以确定一件事:四层结构不是一条运转平稳的流水线,它在震荡中呈现出完整的样貌——每一层都以自己的方式回应冲击,算计自己的得失,而那些回应加在一起,并不自动等于一个稳定的系统。
当OpenAI在2023年11月17日那个周五下午发出解雇声明时,芯片层以股价波动做出反应,云服务层以高层斡旋和备用方案做出反应,开源模型层以暴涨的下载量做出反应,应用层以集体性的恐惧和后续的供应商多元化做出反应。这些反应各有各的逻辑,各有各的合理之处,但没有任何一层在那个时刻考虑了整个结构会不会因为它们的局部最优反应而变得更脆弱。
这或许就是四层协作系统最深层的现实:它不是被设计出来的,而是生长出来的。它没有架构师,没有调度中心,没有系统级的韧性标准。它有的是一群各自精彩、各自理性、各自承担自己的算力税和瓶颈转移成本的玩家。而整个系统的稳定,暂时还依赖于那些没有被测试到的极限——下一次震荡来临时,这些各自为政的反应还会继续相互缓冲,还是会像2003年那根碰到树枝的输电线一样,触发一个没有人预见到的连锁崩溃?
这个问题目前没有答案,正沉重地压在每一份GPU订单、每一份API合同、每一次开源模型的下载点击背后。