第 5 章
四层结构:一个协作系统的解剖
一块显卡的全球旅行,在2024年冬天多出一道关卡。中国国家市场监督管理总局于12月9日宣布对英伟达立案调查,理由是涉嫌违反反垄断法。
消息传出的当天,这家全球市值最高的半导体公司之一,单日市值蒸发接近千亿美元。市场并不担心某一张芯片突然失效,市场担心的是另一件事:当整个产业的运转都指回同一个物理组件时,这个组件的任何一次停顿,都会变成所有人心里的倒计时。这已经不是英伟达第一次被推上审查台。更早之前的2023年9月,法国竞争管理局的检查人员进入英伟达在巴黎的办公室,带走了部分文件。
2024年6月,美国联邦贸易委员会和司法部把目光同时投向英伟达、微软和OpenAI。不同国家的监管动作各有法律依据,但它们指向的直觉高度一致:在人工智能的供给链上,有些环节已经形成了难以绕开的关口。一条产线有一个环节被卡住,整条产线就要停工。这是制造业管理中最朴素的一条常识。可是AI产业的“停工”,从来不会表现为车间里的机器突然安静。
它会表现为云服务的可用实例在某个区域悄悄减少,表现为模型迭代的节奏被悄然推迟,表现为一个创业团队在核算成本时发现,自己原定的商业模式忽然不再成立。
所以理解AI的第一步,是不能只盯着某一个零件,哪怕那个零件正在被全球监管机构同时注视。AI不是一项技术。至少,它不该被理解成一项单一技术。这句话不太符合常识。媒体上的AI通常是一件事:一个会聊天的程序,或者一个能画图的工具。
但当你真正沿着一条请求追踪下去,看到的是一条非常长的链子。链子的一头是某座数据中心里正在发热的芯片,另一头是某个用户手机屏幕上刚刚生成的一封邮件草稿。中间还横着好几层东西,每一层都有自己的技术逻辑,也都有自己的人——他们都认为自己是这条链子的关键。这组关系可以被看成一个四层协作系统。
但在给每一层下定义之前,先做一个更日常的想象。把AI产业想成一座城市的供水系统。芯片层是水源地和净化厂。它不提供“智能”,它提供一种更基础的东西:在单位时间内完成海量计算的能力。
这种能力可以用来训练一个模型,也可以用来让一个已经训练好的模型回答一个问题。离开这一层,所有关于人工智能的叙述都会停在水库放不出水的那一刻。云服务层是市政管网。它由数不清的管道、加压泵站、阀门和接头组成。水源地的水要经过这套管网,才能稳定地送到每一幢建筑。
但管网真正的价值不只是运输。它同时负责计量。没有水表,自来水就无法变成可收费的商品。没有计费系统,就不会有云服务这个产业。云服务商把芯片的算力切成小时、分钟甚至秒来出售,这本身就是一种把物理能力翻译成商业语言的本领。开源模型层是一套公开的净化工艺图纸。
它不给你现成的水,也不替你铺水管。它公开的是一种方法:如何在本地,用有限的资源,搭一个小型净水站,把水质处理到勉强可用的程度。对市政水价不堪重负的人,可以照图纸自建小站。对大水厂来说,这份图纸是一种持续的威胁:因为公开的图纸越多,人们就越不需要依赖集中供给。应用层是水龙头,是洗衣机,是咖啡机。用户拧开水龙头,要的只是水。
至于水来自哪座水库、经过哪条管道、由哪家水厂处理,他们并不关心。一杯咖啡好喝与否,是他们对整个供水系统最直接、也最无情的验收。这个类比并不精确,但它一次就把最要紧的事情说清楚了:这四层之间并非上下游的接力关系,而是相互约束、相互定义的咬合关系。任何一层的变动,都会顺着水压和流向,传到另外三层。如果把这四层想象成一组齿轮,事情会更清晰一些。四个齿轮咬在一起。
芯片轮转得再快,如果云服务层的齿距不合,转速就传不下去。云服务层的计费设计得再精妙,如果开源图纸让很多人决定自己在家里装个小型过滤器,管网的流量就会下降。应用层在市场上叫得再响,如果芯片层突然被一纸禁令卡住,所有叫好都只能停留在演示视频里。这就是系统的第一特征:瓶颈在哪里,权力就向哪里集中。瓶颈不是固定的。
它会移动。今天卡在芯片的交付上,明天可能卡在云服务的数据锁上,后天可能卡在开源模型与商业利益的冲突上。每一次卡点转移,都会带来一轮权力重估。
这就是为什么“谁掌握了芯片,谁就掌握了AI”这句话,最多只说对了一半。芯片确实是最显眼的一层,但它从来不是唯一能决定整条链命运的一层。先看芯片层。今天的AI训练依赖一种特殊的芯片。
它最初为游戏渲染而设计,却在过去十几年间成为并行计算的基础构件。这类芯片的制造门槛,远比设计更高。一款高端训练芯片要经过电路设计、光罩制作、晶圆生产、封装测试等多个环节,横跨多个国家和地区。其中某些环节,比如极紫外光刻机所依赖的光学系统,其精密度已经逼近物理极限。全球能够稳定供应这些设备的,至今集中在极少数公司手中。
于是芯片层出现了一个明显的不对称:它在上游开放,在下游封闭。设计是开放的,制造是集中的,交付又是受管制的。某些高端图形处理芯片的出口,被一套精确到“每秒多少万亿次浮点运算”的规则所约束。一个看似技术性的指标,被写进出口管制文件之后,就变成了一种制度性的关卡。这个关卡不只会影响芯片厂商自己,还会沿着云服务层一路传导到每一个AI应用。
这一层里的瓶颈,真实含义并不只是“没有芯片”,而是“芯片的流通规则正在被地缘政治重新书写”。再看云服务层。云服务商是算力的二级市场。它们从芯片制造商那里获得算力,再以不同粒度出售。
云服务最大的贡献,是把一次性的巨大资本开支转化成可预测的运营成本。一个传统数据中心需要几个月甚至更长时间才能完成采购和部署,而一个云用户只需几分钟就能创建一组计算实例。这种便利让大量小团队第一次有了接触顶级算力的可能。
但云服务层有自己的临界点。它的规模越大,边际成本越低,它就越有能力用低价吸引海量用户。可一旦用户把数据、模型、部署流程全都托管在一个平台上,搬家的成本就会高得离谱。这不是某一家云厂商在恶意排他,而是数据本身有一种“重力”。你的数据越庞大,迁移它所需要的带宽、时间和工程成本就越高。
于是云服务层形成了一种“开放中的封闭”:租用的门槛极低,离开的门槛极高。这就是云服务层的权力来源。它不靠拥有芯片,它靠的是让芯片变得可用、可依赖、不可替代。
然后看开源模型层。这一层是四层中最晚出现、也最不安分的一层。开源模型的出现,改变的是前两层的竞争坐标。一个训练好的大语言模型,其权重文件可能只有几十到几百吉字节。这个大小意味着,一台配备了一定显示内存的个人电脑,就可以在本地运行它。过去最先进的模型只能待在数据中心里,以API的形式被调用。现在这些模型可以被复制、被修改、被分发。
开发者不再必须把请求发往云端。他们可以自己托管一个模型,在自己的机器上跑。开源模型所削弱的,正是云服务层的一部分议价权。你愿意牺牲一点精度,就可以绕开某条计费管线。这正是公开图纸的力量:它不直接提供水,却让人造净水站成为一种真实选项。
但开源模型并不能彻底摆脱上游依赖。训练一个大模型,仍然需要海量的算力。开源社区很少自己从头训练基础模型,他们更常做的是微调、蒸馏、量化和部署。换句话说,开源模型层降低了“读取”算力结晶的成本,却没有降低“生产”这些结晶的成本。这一层因而始终在公共品理想与商业化现实之间摇摆。
它是公共品,因为任何人都可以免费使用;它也是商业品,因为它的开发和维护需要真金白银的算力开销。更关键的是,它同时是武器:谁在什么时机开源一个模型,往往是一笔经过计算的产业布局。开源并不天然等于无私。它有时候是大厂用来削弱竞争对手的手段,有时候是小型实验室用来建立技术声誉的策略。
最后看应用层。这一层离普通人最近,也最容易产生幻觉。一个AI应用的启动成本,理论上远低于传统软件,因为大量基础能力可以直接从上游获得。
但门槛降低也意味着拥挤加剧。一个能自动生成营销文案的助手,本身并不难复制。当所有人都能调用同一个水平的模型时,产品之间的差异就转移到渠道、品牌、数据存量和对垂直场景的理解上。应用层真正的问题是价值翻译。一个昂贵的算力账单,必须由真实用户愿意买单的产品来覆盖。一旦翻译失败,账面上的高增长就会变成现金流里的高危险。应用层因此成了整条链子里最敏感的那面镜子:算力价格上涨,它就压缩毛利;模型许可证收紧,它就会失去某些功能;
云服务政策变化,它就要重构架构。这一层的权力,不来自控制资源,而来自接近用户。谁离用户更近,谁就更有可能把自己定义成价值的最终实现者。
但前提是,它得先活到用户愿意付费的那一天。现在,如果把四层放在一起看,一个过去常被忽略的问题浮出水面。在这条链子上,没有哪一层能完全决定另一层。芯片厂商不能命令云服务商如何定价,云服务商不能阻止客户把模型下载到本地,开源模型不能凭空制造算力,应用层更无法命令前面任何一层降价。
但每一层的变化,都会改变其他层的行动空间。这就是为什么“AI产业本质上是芯片厂商主导的垂直整合”这个解释,虽然直观,却站不住脚。垂直整合意味着从上游到下游是一个统一、可控、利润梯度均匀的系统。
但AI产业链更像一条河流:河床在不同地段的材质完全不同。有些地方是花岗岩,水流被迫改道;有些地方是泥沙,水流侵蚀出新的支流;有些地方则是人工闸门,水位被人为调节。河水经过每一段,都会改变速度和方向。
真正决定流量的,不一定是河水的来源地,而可能是某一段半堵死的河道。同样,不要误以为这四层正以一种精密协作的方式运行。恰恰相反,大部分时间里,它们处在相互摩擦与相互转嫁成本的状态。芯片厂商把研发风险转嫁给云服务商的预付款;云服务商把算力闲置的风险转嫁给用户的长约折扣;开源模型通过降低门槛,把风险从用户端又向云服务端推回一城;
应用层则不断在找哪一层愿意为它的试错买单。这种摩擦并不全是坏事。摩擦有时恰恰是系统保持弹性的原因。齿轮的比喻在这个地方需要被进一步修正。齿轮咬合,如果一齿卡住,整个系统会停下来。
但AI产业很少真的停下来。它是一个半耦合系统:某一层卡住了,其他层不至于立即停摆,但会在效率和成本上付出代价。芯片交付延迟,云服务商还能用旧卡跑;模型闭源,开发者还能用开源替代;云价格太高,应用还能选择在本地部署。这种“替代”从来不是免费的,代价最终会以某种形式回到系统里——要么是开发周期变长,要么是产品体验下降,要么是创新被推迟。
这意味着,看AI产业的正确动作,不是画一张权力阶梯图,而是画一张瓶颈地图。地图上,每一个可能的卡点,都对应一个权力中心。当芯片被管制,芯片层就成为权力中心;当云服务生态锁死,云服务层就掌握了议价权;当模型只能通过API获取,模型厂商就成了守门人;当用户只通过一个入口获得所有AI能力,这个入口就成了最后一公里的收费站。
但地图不能被画成一张静态图。因为瓶颈会转移,当所有人都盯着芯片时,云服务商可能已经悄悄完成了下一轮涨价;当所有人都讨论云锁定时,开源社区可能已经发布了一个足以改变对话的模型;当所有人都在观望开源时,应用层里某个小团队可能正把一个非常狭窄的场景做穿,进而反过来定义了上游的需求结构。
这就是四层结构的核心判断:它不是一个垂直的从属体系,不是一个单向的价值链,更不是一个可以被任何单一主体完全控制的金字塔。它是一个动态的协作系统,每层都有自己的逻辑和动机,彼此咬合,彼此摩擦,彼此转嫁风险,也彼此成就。
到这里,那杯咖啡的问题才真正浮现出来。一个人端起一杯咖啡。这杯咖啡的原料可能来自千里之外的水库,经过数道加压工序,穿过公里级的管道,最终在一个小小的水龙头上被释放出来。
但喝咖啡的人并不关心压强、流量和水质参数。他只关心一件事:这杯咖啡,对不对得起我花的钱。AI产业最终要面对的就是这杯咖啡。当芯片层的制造成本高到惊人,云服务层的账单密密麻麻,模型层的调用费用持续累积,应用层却只能交出一杯平凡的咖啡时,这套协作系统就会面临真正的拷问:所有这些昂贵、复杂、充满博弈的基础设施,到底在为用户创造什么?有时,它确实创造了一杯很好的咖啡。
一个医生拿到了更快的影像判读辅助,一个翻译者省去了三小时的重复劳动,一个偏远地区的孩子第一次有了能听懂他语言的辅导工具。这些时刻,四层的全部复杂性都得到了“翻译”。
但更多时候,那杯咖啡可能只是还可以。不糟,也不惊艳。它证明了这个系统能运转,却没有证明它值得这么多层的等待、抽成和摩擦。
立案消息落地后的几小时里,四层之间的联动几乎立刻显出形状。一个云服务商的客户经理没有等总部通知,就先把几家大客户未到期的算力合约重新翻出来看。一个开源模型社区的维护者在技术论坛里贴出提醒:不要急着升级到需要最新高端芯片才能完整运行的模型,接口兼容和低显存版本可能在未来几个月更值钱。另一个应用层的小团队则默默把原定开春上线的视频生成功能从宣传页上撤了下来。他们彼此不认识,也不共享情报。但他们都从同一条新闻里读出了同一个结论:上游那个最显眼的齿轮可能被卡住,而卡点会停留多久,没有人能保证。
这种反应并不来自某种严密的协作纪律。恰恰相反,它是一种半自动的摩擦传导。芯片层的管制消息先改变云服务商的采购预期,再改变云服务商的合约结构。过去可以按小时租用的实例,开始更多以长期预留套餐出现;过去随时可以申请的弹性扩容,开始被写成“视可用库存而定”。下游应用团队很快发现,自己的成本表里多出一行无法逐期预测的风险溢价。
有人选择继续留在云上,接受更高账单;也有人把模型拉回本地,用更小的权重和消费级显卡搭出一个能勉强运行的推理环境。表面上看,他们绕开了云服务的锁。实际上,他们只是把成本从云账单转移成工程师的调试工作和持续运行的不确定性。系统没有停摆,但它为继续运转付出了更高的摩擦。
这样一种传导也解释了为什么对AI产业的判断不能停在“谁卡住了谁”。真正值得画出来的不是一张权力阶梯图,而是一张不断被改写的瓶颈地图。2024年冬天,最亮的点暂时落在芯片层。但与此同时,掌握旧卡库存和云长期租约的云服务商也在悄悄重估自己的筹码,因为即使没有高端卡的增量,他们手里已经部署的旧卡和网络能力仍能为用户提供一段时间的替代。开源社区则在讨论如何用更小的模型、更细的量化、更节省显存的方式把性能稳定下来。应用层里最敏锐的那些人不再追问“谁卡住了AI”,而是开始问“这一次卡住之后,谁最可能把账单转嫁给我”。
更反讽的是,喝咖啡的人从不知道背后发生过什么。那个水龙头为什么有时会滴得很慢,为什么账单会突然变贵,为什么有些水永远送不到某片区域——这些都被隐藏在每一层各自的商业逻辑里。有一个具体的画面可以用来收束这一章。没有人坐在一张写着“四层架构图”的纸面前发号施令。
更真实的场景是,某座城市的一间办公室里,一个创业者看着云服务账单,又看了一眼自己银行账户的余额,然后转头对团队说:我们得想个办法。在几公里外的一间数据中心的机房里,某个指示灯闪了一下。一个计算实例刚刚被释放,另一个实例立刻被创建。水库、管道、图纸、水龙头同时运转,没有一个统一的指挥。
但恰恰是这样的同时运转里,藏着这个系统最深层的讽刺:它如此精密,又如此脆弱;它如此复杂,又如此容易被简化成一句“AI很厉害”或者“芯片卡住了”。而那杯最终被端上桌的咖啡,无论好喝与否,都已经不是任何一层可以单独决定的结果。它是一次啮合的产物。
水从源头出发,经过每一道关卡,改变了压力,付出了代价,最终抵达杯子。杯子里是什么,取决于其中每一层都让了一点什么。而那口咖啡的温度,会在下一段讨论中被重新提起:如果最底层的那个齿轮突然主动改变了转速,整条链子会发生什么。那不再是比喻。那是关于芯片层的权力游戏开始的声音。