第 2 章

一张显卡的全球旅行

联邦快递的货运飞机落地时,台北桃园机场的夜色还没散尽。卸货员从机舱里推出一只贴满黄色警告标签的航空箱,箱内是一张黑色静电袋包裹的电路卡,袋子封口处印有静电敏感警示,提醒接触前必须接地。这张电路卡就是英伟达A100,2020年5月发布时世界上最快的AI加速器。此刻它正准备开始一段跨越半个地球的旅行。

但真正值得追问的,不是它接下来要去哪里,而是它已经经历了什么。上一章末尾,我们停在一个问题上:如果算力是新的电力,那么今天的发电厂究竟掌握在谁手里?这张A100就是发电厂里最核心的一块砖。它看似只是一张显卡,却从来不是从某个工厂的流水线上简单地被生产出来的。恰恰相反,它是横跨三大洲、牵涉十几个国家、任何一环断裂就全线停摆的接力赛的产物。

我们先快速走一遍接力路线。一家美国公司设计它,一家中国台湾的公司制造它,制造机器来自荷兰,机器的光源依赖德国激光系统,光学镜片上的稀土涂层抛光粉来自中国江西的离子型稀土矿。

设计软件是美国加州的,软件里的电子设计自动化工具来自另外三家美国公司。而那三家美国公司的工具,后来被美国政府放进了一份出口管制清单。A100恰好就在这份清单上。

如果AI是一座城市,芯片就是它的道路系统。道路的宽度决定车流上限,收费站的位置决定谁要付出什么代价才能上路,施工许可证的发放权则决定城市扩张的节奏。我们说算力是新的电力,可电力不需要横跨半个地球去铸造一根导线,芯片需要。一张A100的诞生,本质上就是一场极限物理条件下的道路施工。

先看设计端。英伟达总部位于加利福尼亚州圣克拉拉,硅谷中心地带。这家公司成立于1993年1月,最早做的是图形处理器,也就是GPU,专为游戏里的多边形渲染服务。第一章讲过那个故事:游戏玩家对画面的欲望,意外推动了人工智能后来依赖的硬件基础。到2020年,同一家公司在图形处理器技术大会GTC 2020上发布了安培架构。A100就是首款基于安培架构的GPU。

安培架构是英伟达八代GPU历史上最大的一次性能飞跃,包含超过540亿个晶体管。这些晶体管全部集成在一片面积为814平方毫米的硅片上。

540亿个晶体管是什么概念?地球上每个人大约能分到将近7个。指甲盖大小的硅片里,有540亿个微小的电子开关,每个开关每秒能够翻转数十亿次。整块A100一秒钟可以执行约312万亿次浮点运算。312万亿次又是怎样的体验?如果让地球上所有人同时每秒做一次乘法,要凑够大约四万个地球的人口,才能追上一块A100的运算速度。

但这些极其复杂的电路设计,并非发生在硅谷的工厂里。英伟达是一家无厂半导体公司。行业里把这种模式叫作Fabless,意思是只做设计,不拥有任何一家实体工厂。A100的电路图、逻辑门排布、缓存规划、内存带宽分配,都是加州工程师在屏幕上一根线一根线画出来的。他们画的时候就知道:能把这套图纸变成实物的工厂,全球只有一家。那家工厂在台湾新竹科学园区,名字叫台积电,全称台湾积体电路制造公司。

A100的诞生地不在硅谷,而在台湾一间无尘室里。台积电的Fab 18工厂拥有多条5纳米和7纳米制程产线。A100使用的就是台积电7纳米工艺节点,简称N7。

7纳米有多细?一根人类头发直径大约8万纳米。台积电要在硅晶圆上蚀刻出宽度只有7纳米、间距仅几十纳米的金属导线,让540亿个晶体管按照设计图精确排列,误差不能超过原子尺度。我们把这个过程换算成城市道路的类比:相当于你要在一片指甲盖大小的地块上修建一座拥有540亿个交叉路口的大都市,每条道路宽度控制在30厘米以内,铺路机必须精确到一根头发丝的千分之一。而且,这座城一旦开工就不能停,因为任何一秒震动都可能让数十亿个交叉路口报废。

实现这种精度的机器叫光刻机。台积电使用的极紫外光刻机,来自荷兰阿斯麦。一台极紫外光刻机售价超过一亿美元。运输它需要约四十个货运集装箱、三架波音747货机,以及一整套恒温、恒湿、防震的物流方案。

机器内部的光源系统通过发射波长13.5纳米的极紫外光,把电路图案刻在涂有光刻胶的硅晶圆上。产生这种极紫外光的办法,像是一个工业童话:阿斯麦的机器里有一个真空腔,腔内以每秒五万滴的速度喷射直径约30微米的锡液滴。每一滴锡液被一束高强度二氧化碳激光击中两次——第一击把锡滴打扁成盘状,第二击在纳秒级时间内将其加热到约五万度,变成等离子体,激发出极紫外光。这个过程每秒重复五万次。五万度的等离子体距离硅晶圆只有不到两米,中间隔着一套由德国蔡司制造的反射镜系统,镜面平整度的误差以皮米计。皮米是纳米的千分之一。

这样一套系统,把全球几个最硬核的工业能力压缩在一间无尘室里。荷兰机械、德国光学、美国设计、中国材料,缺一不可。制造一片A100,需要台湾的工厂重复这个牵涉多国的极端精密流程,不能有丝毫闪失。全球半导体产业链不是经济学教科书里的“全球化分工”案例,它是物理制造能力的卡位战。

每一道工序都掌握在特定国家的特定公司手中,这些公司的决策直接影响AI产业的速度和方向。

理解了这一点,美国对华芯片出口管制的逻辑就清晰了。2022年10月7日,美国商务部工业安全局更新《出口管理条例》EAR,新增针对先进计算芯片和半导体制造设备的出口管制措施。其中最关键的内容是:任何包含超过一定算力阈值和互连带宽的芯片,向中国出口前都必须获得许可证。A100赫然在列。英伟达随后确认,受影响的产品包括A100和即将量产的H100。这就是后来人们常说的“芯片禁令”。

在道路系统的类比里,出口管制的实质不是禁售某款产品,而是在全球算力路网上设置收费站和限高杆。收费站是许可证制度:你要买这条路的使用权,得先问过发卡的人。限高杆是算力阈值:超过某个性能上限的芯片,不允许通过。更麻烦的是,这个限高并非固定不变。美国政府可以随时调整管制清单和算力参数。

2023年,英伟达推出专供中国市场的H20,性能被刻意限制在管制阈值以下,保留了H100的部分架构特点。没过多久,美国又在2025年4月15日阻止了H20出口,同年7月又恢复供应。限高杆每年都可能重新测量你的车身高度,再决定放不放行。

有人可能会说,这不过是技术竞争的正常手段,芯片层仍然由厂商主导垂直整合——台积电制造,英伟达设计,阿斯麦供货,开源和应用层永远改变不了底层的算力垄断。这个说法有一半是对的。目前确实没有任何开源模型或应用公司能替代台积电的先进制程,也没有人能绕开阿斯麦的光刻机。但事实的另一半是:管制本身在重塑产业链。

出口限制非但没有让芯片层更加铁板一块,反而制造了一条“合规性能带”。在这条带子上,买方支付的不仅是芯片价格,还有性能折损、替代方案研发成本和长期不确定性风险。这部分隐性成本,就是硬件层的算力税。它没有消失,而是被转嫁了——从美国政府的管制决策,转嫁到中国AI公司的研发预算和部署节奏上。

A100从台积电Fab 18的无尘室下线之后,旅行还没有结束。晶圆需要被切割成单独芯片裸片,每一片裸片要进行封装测试。封装测试一般由日月光等封测厂在台湾或东南亚完成。封测完成后,A100被焊到一块印制电路板上,加上散热器、显存颗粒和供电模块,最终包装成标准的PCIe卡或SXM模组,放进抗冲击泡沫内衬的纸箱,贴上联邦快递运单,发往全球各地。

这条供应链高度紧绷。2020年下半年,新冠疫情冲击全球供应链,同时虚拟货币挖矿需求近乎疯狂,英伟达RTX 30系列消费级显卡从上市起就严重缺货。在中国电商平台京东,曾出现数十万人半夜蹲守抢几十张显卡的场面。日本新蛋平台上,显卡加价20%到30%并强制捆绑主板销售。英伟达当时公开表示,供货紧张的情况短期内难以缓解。A100属于数据中心级产品,并不直接受消费市场抢购影响,但它的制造端和消费级GPU共享同一片晶圆产能。台积电7纳米产线的产能是固定的。

这条产线既要生产苹果的芯片,也要生产其他公司的处理器,还要兼顾英伟达的游戏GPU和数据中心GPU。当需求全面井喷时,瓶颈就从设计能力转移到了制造能力。这就是瓶颈转移的活样本。

AI产业链的权力中心并不固定在某一层。在2020到2022年之间,芯片制造成为整个链条最大的瓶颈。原因不是没有好的算法,不是云服务不够成熟,也不是应用找不到场景,而是物理世界的晶圆厂来不及生产足够多的芯片。台积电的产能,一度成为全球AI发展的事实上限。2021年,英伟达发布了基于ARM架构的Grace CPU,试图减少对英特尔服务器CPU的依赖,但Grace的制造同样需要台积电先进制程。瓶颈只发生了转移,并没有消失。

你可以在设计图上画出性能翻倍的芯片,但物理世界会用光刻机、晶圆产能、封装测试排期和货运航班那一整套残酷的约束,告诉你上限在哪里。这张A100到达数据中心之后,还要经历最后一段几百米的旅行——从卸货梯口送进服务器机架。

当调用者在浏览器里提交任务时,他看到的是一张选项菜单:GPU型号A100-SXM4-40GB或A100-PCIe-80GB、数量、运行时长、区域可用区。他或许不会注意到,菜单旁一行小字写着“受美国出口管制约束,仅限合规区域使用”。这些提示背后,是一整套追溯系统。云服务商必须记录每一块A100的序列号与物理位置,并保留出口许可证复印件。美国商务部工业安全局可以在不预先通知的情况下,要求核查某一块卡的最终用户和最终用途。

那张贴着黑色静电袋的电路卡,从台积电无尘室出发时,就已经被分配了一个ECCN编码——3A090。这个编码不是技术参数,而是一张制度标签。它像城市施工蓝图上用红圈标出的限高杆位置,规定了这条算力道路在哪个节点对哪些车辆放行。

在A100到达数据中心之前,还有几道更窄的门。A100从封测厂出厂后,先被装入防静电铝箔袋,再放进带有氮气干燥剂的密封袋,外层是抗冲击泡棉和防潮标贴。纸箱外除了联邦快递的运单,还贴着多份文件:商业发票、装箱单、原产地证明,以及一张印有出口管制分类编码ECCN 3A090的标签。这些文件在海关清关时被扫描进系统,与全球贸易数据库里的许可证信息交叉比对。从台北桃园机场到目的港,再到数据中心的最后一段陆运,每一步都有记录。

对于超大规模云服务商,通常有专门车队负责接收这类高价值GPU,司机必须使用带有实时GPS和温湿度监控的封闭货车。A100本身不像极紫外光刻机那样需要四十个集装箱,但它的敏感身份让物流过程同时运行在两套坐标体系里:一套是物理坐标——位置、温度、震动;一套是制度坐标——ECCN、许可证、最终用户声明。两者共同决定了它能否到达目的地。

比物流更早的瓶颈发生在制造端。在没有被分配产能之前,A100的设计图只是加州服务器里的一堆文件。2020年下半年,全球芯片荒加剧,台积电先进制程产线被苹果、AMD、英伟达等少数客户塞满。为获得7纳米产能,英伟达需要提前支付预付款,并与台积电签订长期产能协议。即便如此,A100在发布后很长一段时间里都处于供应紧张状态,数据中心客户往往需要等待数月才能拿到大批量订单。

原因不仅在于晶圆制造本身,还在于封装环节。A100并非简单地把GPU裸片和显存并排焊在基板上,而是采用了台积电的CoWoS封装技术,将一块大尺寸GPU裸片与多个HBM2e高带宽内存堆栈集成在一个硅中介层上。这个中介层面积大、布线密度高,良率爬坡缓慢,且产能高度集中在台积电的封装产线。一次封装失误,可能报废价值数万美元的芯片和内存。这意味着,制造环节的瓶颈与封装环节的瓶颈叠加在一起,形成了一条更狭窄的物理通道。台积电不仅控制了前端晶圆制造,也深度介入了先进封装,这使得它在这场AI算力卡位战中的位置比多数人理解的更加关键。

2022年10月7日更新后的《出口管理条例》中,美国商务部工业安全局为“先进计算芯片”设定了一个可调整的门槛。对A100来说,真正被卡住的不只是芯片名称,而是两个数字:片间互连总双向带宽达到600 GB/s,以及芯片综合算力阈值。任何满足这些参数的芯片,无论叫什么名字、由谁设计、采用什么架构,向受限国家出口前都需要许可证。这就像在城市道路的施工蓝图上,不是标注某一家建筑公司的名字,而是规定凡车道宽度超过某个值、桥洞高度低于某个限度的道路,都必须设置收费站,并且只有持证车辆才能通过。A100的814平方毫米硅片和540亿晶体管,恰好落在这个被标红的高性能区间里。

英伟达后来推出的A800、H20等产品,本质上是同一张蓝图上重新绘制的合规版本:缩小车道、降低限高,主动求变以绕过管制门槛。但每一次重新绘制,都会带来额外的研发投入、性能折损和供应链调整成本。这部分成本无法在物理世界里消灭,只能转嫁到使用者的账单、研发周期和竞争节奏上。

当这张A100最终在数据中心通电并接入算力池后,它身上的物理约束并未被抹除,而是隐藏进了后台。云服务商可以把它按时出租,价格随行就市,但每当美国商务部更新管制清单,或者台积电宣布调整产能分配,这些变化都会像暗流一样传导到前台。

一个训练任务的报价突然上涨,或者某款GPU型号在可用区里消失,背后往往不是市场需求波动,而是物理世界和制度关卡先发生了变化。对训练大模型的团队来说,他们并不需要知道这张卡从台北到加州的完整路线,也不需要读懂出口许可证上的每一项条款。他们只需要知道,今天能调用多少张A100、按什么价格调用、任务队列要排多久。

但这些看似技术性的参数,正是由那间无尘室、那台光刻机、那班货运飞机和那一纸许可证共同挤压而成的。道路系统的施工蓝图,就这样从设计工程师的屏幕上,一路铺展到运维人员的告警面板上。对使用算力的人来说,世界的那根物理横梁依然存在,只是变成了一行关于付费、配额与排期的晦涩文本。

一台标准的4U GPU服务器可以插8张A100,通过英伟达的NVLink和NVSwitch互联。8张卡之间可以每秒600GB的速度交换数据。这样一台服务器被推进机柜,接上光纤,通电,启动。然后,它就会从一个物理物件变成一个网络端点。数据中心监控室的屏幕上,刚才还在黑袋子里的那张卡片,变成了一个可分配的算力单元,显示为一串IP地址和GPU资源池里的若干空闲容量。

任何拿到访问权限的人,不需要走进这间机房,甚至不需要知道这台服务器放在哪里,就能在浏览器里打开一个网页,敲下几行代码,调用这块A100来训练一个神经网络。那块跨过半个地球、在极限物理条件下被制造出来的芯片,通电之后,它的物理属性反而从使用者的意识里消失了。

你买的不是一张硬件,你是通过网页、接口、命令行来租用它的运算能力。这就是本章必须停下来的画面。一张显卡的全球旅行,在它上架的那一秒钟结束;另一种完全不同的旅程开始。芯片在那里,却又好像不在那里。

它的制造成本高到惊人,制造过程脆弱到任何一环都可能断裂,但一旦接入网络,它就变成了账单上的一行条目,变成了某个云端服务商后台里默默运转的稀缺资源。没有人抱得动一整条全球供应链,但当这条路最终铺进数据中心,使用者的世界里只剩下一个可以呼来唤去的算力。它从物理世界出发,最终在虚拟世界里隐身。

于是新的问题自然升起:谁在运作那个网页?谁有权决定这块A100每小时收费多少、分配给谁、用来做什么?芯片制造层的卡位战告一段落之后,权力并没有消失。它只是从无尘室和海关闸口,悄悄移到了那些你在浏览器里看不见的隧道之中。那张显卡此刻正安静地待在机柜里,风扇发出低频的嗡鸣,而它承载的算力,已经流向了世界的另一端。