第 17 章

晶体管的叹息

2023年1月,尼克·凯夫收到了一首歌。不是歌迷翻唱他的旧作,而是一首以他的风格全新生成的歌。发送者用ChatGPT输入了提示词,几秒钟后,机器吐出了歌词和旋律框架。这位澳大利亚音乐人在《红手档案》上回应时,措辞激烈得不像在评论一件技术产品。他写道,写歌是“一项血腥的事业……这需要我的一些东西来发起新的和新鲜的想法。它需要我的人性。”他判定那首AI作品是“胡说八道,是对人性的荒诞嘲弄”。

同一个月,地球另一端,浙江大学医学院附属第一医院的吕海龙医生做了另一个实验。他让ChatGPT做一套中国执业医师考试卷的题目。满分100分,AI考了57分。不及格。

两件事看起来毫不相干。一个音乐人在捍卫创作的灵性,一个医生在测试机器的专业能力。但它们共享一个隐蔽的前提:2023年初的人们,已经开始认真对待生成式AI的能力——无论态度是警惕、好奇还是敌意,没有人再把它当成玩具。

ChatGPT在2022年12月发布后,两个月内用户破亿,OpenAI估值飙升至290亿美元。应用层的繁荣来得如此迅猛,以至于一个更根本的问题被喧嚣淹没了。支撑这一切的算力,它的增长方式正在发生不可逆的转变。这个转变的核心,是一个被反复宣告却从未被真正面对的预言——摩尔定律的放缓。

它本身不是新闻。英特尔创始人戈登·摩尔1965年提出的观察性预测——集成电路上可容纳的晶体管数量大约每两年翻一番,性能随之翻番,成本则减半——早在二十一世纪头十年就被预见到会因物理极限而终结。但终结是一回事,终结的后果是另一回事。

在AI需求以每年数倍甚至十倍速度膨胀的当下,放缓的含义被严重低估了。它不再是一个遥远的、属于半导体工程师的学术话题,而是即将重塑从芯片设计、数据中心运营到AI商业模式整个权力结构的迫近现实。要理解这个现实,需要把视线从软件界面下拉。

穿过ChatGPT的对话框,穿过云服务商的API接口,穿过服务器的机柜外壳,一路降到晶体管的尺度。2023年到2024年间,台积电的3纳米制程进入量产挣扎期。3纳米,这个数字听起来仍是一个工程尺度。

但把它翻译成原子世界,景象截然不同。一个硅原子的直径大约是0.2纳米。当芯片制程标注为3纳米时,晶体管中某些关键结构的尺寸,实际上已经缩到了只有十几个原子的宽度。你正在用十几个原子搭一个开关。

晶体管的基本功能极其朴素:它就是一个电子开关。给一个控制端加电压,电流就在另外两端之间导通;撤掉电压,电流就断开。导通是1,断开是0。几十亿个这样的开关排列在指甲盖大小的硅片上,以难以想象的速度开开关关,就构成了计算。

过去半个世纪,芯片性能的提升主要靠一件事:把晶体管做小。更小的晶体管意味着开关更快、能耗更低、同样面积能塞进更多开关。这就是摩尔定律的物理基础。

但当你把开关缩到十几个原子的宽度时,一个在宏观世界完全可以忽略的效应,突然变成了主角。

量子隧穿。这个名字听起来玄奥,直觉其实很简单。想象一道墙。在经典物理学里,一个球要越过墙,必须有足够的动能翻过去。但在量子尺度,电子不是球,它是概率云。它有某个概率直接出现在墙的另一侧——不是翻过去,不是钻过去,而是凭空出现在那边。墙越薄,这个概率越大。

当绝缘层的厚度缩到几个原子层时,电子“穿墙”的概率急剧升高。在芯片上,这意味着电子不再乖乖地沿着设计好的沟道流动。它们会泄漏到绝缘层,泄漏到邻近的晶体管,泄漏到任何不该去的地方。这个泄漏不是偶发的故障,而是物理定律给每个晶体管设定的硬边界。

这里有一个帮助直觉的类比。想象一道窄门,人们排队通过。你把门变窄,理论上单位时间能通过的人数应该不变——门窄了,但每个人通过的距离也短了。但实际上,当门窄到一定程度,通过的速度反而会下降。因为每个人都要侧身、停顿、调整角度。继续把门变窄,最终会达到一个点:通过效率不升反降。

制程微缩曾经让晶体管开关更快、能耗更低,但越过某个临界点之后,漏电和散热问题让每一次升级的性价比急剧下降。这不是工程问题。这是物理定律给人类划下的边界。

要理解这个边界有多硬,可以做一个对比。从1971年英特尔推出第一颗微处理器4004,到2020年代,单个芯片上的晶体管数量从两千多个增长到了数百亿个。这个增长速度超过了人类历史上任何其他技术的扩散速度。它把计算机从占满一栋楼的庞然大物变成了装在口袋里的薄片,把计算成本降到了近乎为零。整个信息时代的经济逻辑——软件吞噬世界、数据成为石油、AI突然爆发——都建立在这个指数曲线之上。

现在,这条曲线正在被物理定律压平。台积电3纳米制程的量产挣扎,是这个转折的缩影。根据公开报道,3纳米在开发过程中经历了多次延期,良率爬坡速度远慢于预期。所谓良率,就是一片晶圆上能正常工作的芯片比例。当晶体管尺寸逼近原子尺度,制造精度要求达到几个原子的级别,任何微小的工艺波动都会导致大量芯片报废。

这意味着成本的急剧上升。过去,制程升级带来的收益是双重的:性能提升,同时单位晶体管成本下降。现在,性能提升还在继续,但幅度在收窄,而成本的下降曲线已经明显放缓,在某些节点甚至开始回升。

这对AI意味着什么?AI训练对算力的需求,在过去十年里以每年大约十倍的速度增长。GPT-3的训练使用了大约三千亿个token,据估算算力消耗相当于数千张高端GPU运行数周。GPT-4的规模没有公开,但业界普遍认为其算力需求又上了一个数量级。这个需求增长不是线性的——模型越大,训练所需算力呈超线性增长。换句话说,想要模型聪明一点点,算力就得多用一大截。

一边是算力需求以指数级膨胀,一边是芯片制程红利在枯竭。这个剪刀差,是全书进入“前沿与边界”阶段的核心驱动力。

这里需要澄清一个可能的误解。说摩尔定律放缓,不是说芯片不再进步了。进步仍在发生,但进步的方式变了。

过去,制程微缩是进步的主引擎,它带来的收益是普惠的——每一代新制程都能让所有类型的芯片变得更好更快更便宜。现在,这个主引擎的推力在减弱,芯片行业被迫寻找其他路径来继续提升性能。

这些路径包括架构创新、先进封装和专用芯片设计。架构创新,就是重新设计芯片内部的布局和逻辑,让晶体管以更聪明的方式协同工作,而不是单纯靠增加晶体管数量来提升性能。英伟达的GPU之所以在AI时代占据统治地位,恰恰是因为它的架构天然适合并行计算——同时处理大量简单任务,而不是串行处理少量复杂任务。AI训练本质上就是海量的矩阵乘法,这正是GPU擅长的。

先进封装,是把多个芯片“拼”在一起,让它们像一个整体一样工作。传统上,芯片性能提升靠的是把更多晶体管集成到同一块硅片上。但当单块芯片的尺寸接近物理极限,另一种思路是把几块芯片通过高速互连封装在同一个基板上。台积电的CoWoS封装技术、英特尔的EMIB技术,都属于这个方向。

它的好处是可以用成熟制程生产多块芯片,再通过先进封装达到接近甚至超过单一先进制程芯片的性能。专用芯片设计,则是放弃通用性,为特定任务定制硬件。谷歌的TPU是专门为TensorFlow优化的AI加速器。苹果的M系列芯片把CPU、GPU、神经网络引擎集成在一起,针对特定工作负载做深度优化。亚马逊的Trainium芯片只做一件事:训练AI模型。这些芯片在通用任务上可能表现平平,但在它们被设计来做的那件事上,效率远超通用芯片。

这三条路径有一个共同特点:它们推进的速度,远慢于制程微缩曾经的速度。制程微缩是一条相对清晰的路径。每一代新制程,晶体管密度提升多少、性能提升多少、功耗降低多少,虽然难度越来越大,但目标明确。而架构创新、先进封装和专用芯片设计,每一条路径都需要针对具体应用场景做深度优化,没有统一的公式可以套用。这意味着进步变得更碎片化、更昂贵、更需要具体领域的专业知识。这个转变将从根本上改写四层协作系统的权力格局。

在制程红利充沛的年代,芯片层的竞争逻辑是相对简单的:谁能率先量产下一代制程,谁就能获得性能优势和成本优势。台积电、三星、英特尔三家争夺制程领先地位,下游的芯片设计公司——英伟达、AMD、高通——则在最新制程的基础上比拼设计能力。整个链条的利润分配相对均衡,因为每一代新制程带来的红利足够大,各方都能分到可观的份额。

但当制程红利枯竭,情况变了。掌握先进制程和先进封装能力的玩家,将获得前所未有的议价权。因为性能提升不再来自一个普惠的、可预期的制程升级节奏,而是来自少数几家代工厂的独家能力。

台积电在3纳米和先进封装上的领先地位,已经让它成为AI芯片供应链中不可替代的一环。英伟达的H100和后续芯片严重依赖台积电的CoWoS封装产能,而这个产能是有限的,扩产周期以年为单位。这意味着芯片层的稀缺性将进一步加剧。过去十年,芯片层虽然重要,但算力的增长曲线足够陡峭,下游的需求总能被满足——慢一点,但总能等到。

现在,算力增长曲线正在从指数变成陡峭的线性甚至对数。而AI对算力的需求曲线,非但没有放缓,反而因为模型规模的竞赛而加速上扬。两条曲线的交叉点,就是算力危机爆发的时刻。

这个危机不会以“芯片断供”这种戏剧性的方式出现。它会以更隐蔽、更渐进的方式渗透进整个产业链。

云服务商的算力租赁价格不再下降,甚至在某些时段上涨。AI创业公司发现训练一个先进模型的成本从千万级别跃升到亿级别。应用层公司不得不为有限的算力配额展开竞争,那些出不起高价的小公司被挤出市场。开源模型的迭代速度放缓,因为训练成本超出了社区能承受的范围。

这些后果已经在发生。2023年到2024年间,多家AI创业公司被大科技公司收购,核心原因不是技术或人才,而是它们无力独立承担下一代模型的训练成本。云服务商的GPU实例长期供不应求,等待时间以周甚至月计算。

英伟达的毛利率持续攀升,反映出其议价能力的增强——一家无厂芯片设计公司的毛利率超过了大多数拥有实体工厂的制造业巨头,这在半导体历史上是罕见的。这些都不是偶然的市场波动,而是结构性的转变。算力正在从一种可以预期成本下降的商品,变成一种稀缺资源。

回到尼克·凯夫。他在2023年初对AI创作的本能排斥,在当时被许多人视为艺术家的傲慢。但放在这个算力转型的背景下,他的反应有了另一层含义。他说的“这需要我的一些东西来发起新的和新鲜的想法”,指向的是一个更深的问题:当算力增长不再能靠制程微缩自动获得,创造力的来源是什么?

AI行业过去几年的繁荣,建立在一个隐蔽的假设之上:算力会一直变得更便宜、更充裕。这个假设让模型可以不断变大,让训练可以不断重试,让应用层可以不计成本地调用最先进的模型。但如果这个假设不再成立,整个行业的运转逻辑就需要重写。这不是说AI的进步会停止。而是说进步的方式必须改变。

这个转变最直接的后果,已经刻在了芯片行业的地理版图上。台积电的3纳米工厂集中在台湾台南的科学园区,先进封装产能则分布在苗栗、台中、龙潭等多个厂区。

这不是普通的工厂布局,而是一种物理上的锁定。每一座3纳米晶圆厂的建设成本超过两百亿美元,建设周期三到四年,投产后的良率爬坡又需要一到两年。先进封装产线的扩产周期同样以年为单位,而且封装技术与制程技术高度耦合——台积电的CoWoS封装只适用于它自家生产的芯片。

这意味着,当英伟达设计出一款新架构的AI芯片,它不能随意选择代工厂。它必须排队等待台积电的产能,而这个队列的长度由物理定律决定,不由市场需求决定。2023年,CoWoS封装产能的缺口据估算高达20%以上,英伟达的H100芯片从下单到交货的周期长达数月。这不是台积电效率低,而是当晶体管和封装都推进到原子尺度的极限时,良率的提升只能靠一次次试错、一次次工艺微调,没有任何捷径可走。

每一片晶圆上能正常工作的芯片数量,每一个封装基板上能成功互连的芯片组数量,都是用时间和报废品堆出来的。

这个地理锁定带来了一个更深层的后果:算力的供给弹性消失了。在过去,当市场对芯片的需求激增,代工厂可以通过增加产线、提升良率来逐步扩大供给。虽然也有周期,但供给曲线总体上是向上弹性的。现在,当制程推进到物理极限附近,供给曲线变得极其陡峭。

台积电可以建新厂,但新厂投产的时间尺度以年为单位,而AI需求的增长以月为单位。这个时间错配意味着,在可预见的未来,先进算力将长期处于供不应求的状态。这不是短期的供应链扰动,而是结构性的稀缺。

对于下游的AI公司来说,这意味着它们的商业模型必须重新计算。过去,一家AI创业公司可以做这样的规划:现在训练模型需要一千万美元的算力成本,两年后随着芯片升级,同样的算力可能只需要五百万美元。这个成本下降预期让很多商业计划变得可行——先烧钱占领市场,等算力成本下降后再实现盈利。

但现在,这个预期正在瓦解。如果算力成本不再下降,甚至在某些节点上升,那么所有建立在“算力会变便宜”这个假设上的商业模型都需要重写。

这个压力已经在产业链上逐级传导。云服务商是最先感受到的。亚马逊AWS、微软Azure、谷歌云在2023年到2024年间都面临同一个困境:客户对GPU实例的需求远超供给,但扩大供给的能力受制于芯片交付周期。它们的应对方式是涨价和配额制——不是明面上提高标价,而是通过更复杂的定价结构、更长的合同锁定期、更高的预留实例比例,把稀缺成本转嫁给客户。

对于大型企业客户来说,这只是预算问题。对于AI创业公司来说,这是生存问题。当算力成本占到一家公司总运营成本的50%以上,而成本不再下降,公司的估值模型就会出现根本性的裂缝。2023年下半年,硅谷多家AI创业公司在融资时发现,投资人开始问一个以前很少问的问题:你们的算力成本曲线是什么样的?

过去是“用更多算力砸出更好的结果”,未来必须是“用更聪明的算法、更高效的架构、更精准的数据,在有限的算力预算内做出更好的结果”。这个转变在技术上是可行的,但在商业逻辑上是痛苦的——因为它意味着过去那种靠堆算力建立护城河的策略失效了。芯片层过去十年享受的制程红利,正在变成整个AI产业链的算力税。

这个税收的税率,由台积电和英伟达这样的公司决定,由物理定律设定上限,由市场需求驱动下限。而征税的对象,是从云服务商到开源模型社区到应用层创业公司的整个下游生态。2023年11月,巴西一名地方法官因使用ChatGPT书写判决书出错而接受巴西国家司法委员会的调查。这件事与尼克·凯夫的愤怒、吕海龙医生的57分考卷,以及台积电3纳米制程的量产挣扎,看似分布在完全不同的领域。

但它们被同一条线索串联在一起:AI的能力边界,最终受制于物理世界的边界。晶体管不会因为人类的期待而突破量子隧穿的极限。硅原子不会因为应用层的繁荣而改变自己的直径。

物理定律不会因为商业模式的创新而让步。这就是“前沿与边界”的真正含义。前沿是AI正在触及的物理极限,边界是人类必须在这些极限之内做出选择的空间。制程红利枯竭不是一个技术问题,它是一个经济问题、战略问题、权力问题。它将决定在接下来的十年里,谁能获得算力、以什么代价获得算力、用这些算力做什么。

尼克·凯夫说写歌需要“我的人性”。他可能没有意识到,他触及了一个比艺术创作更大的问题。当算力的增长不再能靠物理缩微自动获得,整个AI产业也不得不面对一个类似的拷问:当廉价的制程红利耗尽之后,进步需要什么来驱动?这个问题的答案将决定四层协作系统接下来的权力流向。而物理定律已经给出了它的底线。

硅原子的直径不会改变。量子隧穿的概率不会因为市场需求而降低。一枚芯片的散热极限由热力学设定,不以任何公司的意志为转移。在这些硬边界之内,人类必须做出选择——而选择从来不是免费的。