第 6 章

芯片层的权力游戏

上海张江的一间会议室里,投影屏上停着一页招聘启事。岗位名称被红笔圈过,薪资范围旁边画了两个问号,但整页最刺眼的一行落在第五栏:需有CUDA移植或替代方案开发经验。

CUDA。这个词读起来没有中文意思,像某种缩写的硬块卡在句子里。但它在人工智能行业的重量,比精通Python更难绕过,比熟悉分布式训练更接近硬通货。一家芯片公司招人,不去要求候选人懂自己的硬件,反而要求懂英伟达的软件生态——这听上去荒诞,可人事扫过简历时,眼睛最先盯的就是这一行。它不是加分项,是入场券。

就在同一段时间,美国华盛顿的两家监管机构正在画一条线。2024年6月,司法部与联邦贸易委员会把人工智能领域的反垄断调查分开:联邦贸易委员会负责查微软和OpenAI,司法部负责查英伟达。这条线划得不带戏剧性,新闻只占了几行。但它点明了一件事:一家芯片公司,已经被美国司法体系当作整个AI产业里最需要被掰开来检查的权力节点。这就有意思了。

英伟达不拥有任何大模型,不运营任何云计算平台,不直接服务普通用户。它只设计芯片——晶圆是台积电刻的,光刻机是荷兰阿斯麦造的。英伟达总部在加州圣克拉拉,一间无厂半导体公司,没有自己的晶圆厂。可恰恰是这个最轻资产的公司,长成了整条AI产业链里最重的一颗压舱石。

为什么会是它?为什么不是那些真正拥有工厂的芯片制造商?为什么不是曾经统治半导体行业三十年的英特尔?

答案如果只停在英伟达的图形处理器跑人工智能更快,就没法解释今天的格局。因为更快这件事,在芯片史上从来不是护城河。德州仪器的芯片曾经最快,摩托罗拉的芯片曾经最快,IBM的芯片曾经最快——它们全都看着别人用生态把自己围死。英伟达真正做成的事情,要难得多,也可怕得多。

现在,从2024年这场反垄断调查倒着看。司法部查的,未必是英伟达的芯片卖得贵不贵,而是另一件事:当全世界的开发者、云厂商、人工智能公司都被一个接口绑在英伟达的硬件上时,这种绑法到底算不算一种垄断。

要理解这个,得先把这个接口拆开。它有一个名字,就叫CUDA。要讲清楚CUDA是什么,得先回到一个看似不起眼的时刻。2006年,英伟达发布了一套软件平台。这个名字的全称是统一计算设备架构,但对当时的大多数人来说,它只是显卡驱动程序旁边多出来的一个选项。那时英伟达的核心业务是游戏显卡,玩家装驱动是为了打游戏不卡顿。CUDA可以让人用显卡跑一些非图形的计算,听起来像工程爱好者的玩具。当时没人料到,这个“玩具”会在十六年后变成整条AI产业链最值钱的一层皮。

英伟达做了一件当时看来很傻、很费钱的事:它不把CUDA做成一个简单工具,而是一门完整的语言。它免费教开发者,用一种类似C语言的写法去指挥GPU做通用计算。免费提供编译器,免费提供调试器,免费提供文档,免费去美国各所大学开课。当时华尔街看不懂:这家公司卖显卡赚的钱,为什么要补贴一个没人用的计算平台?英伟达的毛利率因此被拖累了好几年,股价也长期不被当作真正的芯片股看待。

这个“傻决定”换来的东西,二十年后的今天才显出全貌。全世界数百万开发者,从研究生时代开始,就习惯用CUDA的语言去描述矩阵乘法、梯度下降、卷积操作。他们写的代码,一行一行都带着CUDA的语法特征,就像带着一种方言。这种方言一旦成为思维习惯,就不再是工具选择,而是条件反射。

当他们去别家芯片上写程序,发现对方虽然硬件理论性能不错,但没有这套方言时,第一反应不是去学一套新语言,而是这活没法干。这就是生态锁定的深度。它不是电缆接口那种物理锁定,不是螺丝拧进去就拔不出来。它锁的是人的时间、习惯和职业路径。

一个开发者花三年时间把CUDA写熟,投在英伟达生态里的不是钱,是青春;迁移到AMD或英特尔的平台,性能未必差,但代码要重写,调优经验要清零,文档要重读,故障要重新踩。这种成本大得让绝大多数公司宁愿多花几倍的钱买英伟达的卡,也不愿让工程师趟一趟未知的浑水。道理很像一家咖啡机公司。

英伟达不只卖机器,它还在全球各大城市开设免费咖啡师学校,教材只讲自家机器的操作面板,旋钮拧多少度、蒸汽棒放多深、压力表看哪一格,全都形成一套肌肉记忆。几年下来,全世界最优秀的一批咖啡师,都在用这一种面板做事。别的厂商后来造出了萃取效率更高的机器,蒸汽更足,锅炉更稳,价格还便宜三成——但咖啡师们不愿换。不是机器不好,而是没人想回到新手阶段,重新对着陌生的按钮发怵。机器参数可以一张表格比完,操作逻辑却长在人的身体里。

英伟达的GPU就是那台咖啡机,CUDA就是那块操作面板上的全部语言。开发者就是咖啡师。AMD和英特尔在旁边眼看着:自己也能造好机器,但咖啡师们只肯在自己的机器上做实验,一到量产订单,还是回英伟达。

这里得交代一个被反复误解的点。在AI芯片市场,AMD和英特尔长久以来并不缺硬件设计能力。

2020年5月,英伟达在GTC 2020主题演讲中发布A100,基于安培架构,集成超过540亿个晶体管,是有史以来最大的7纳米芯片,性能相较于前代提升了高达20倍,还可将单个A100分割成最多七个独立的GPU实例来处理各种计算任务。

竞争对手没多久也拿出了自己的产品。AMD有Instinct系列,英特尔有Gaudi和后续的加速器。论某些跑分,差距不是天堑。

但跑分和实际训练一个大模型之间,隔着一整片生态的泥沼。没有CUDA,那些跑分很难变成大厂的采购订单。换句话说,掉队的不是他们的晶体管,而是他们周围那群开发者。

而芯片层权力真正爆发,是在2022年底。ChatGPT上线,世界对算力的需求突然跳上一个此前不可想象的台阶。原本游戏显卡够用的时代,瞬间变成谁拿到高端GPU谁就能训练大模型的时代。英伟达的A100、H100一下子变成全球最紧俏的商品,交付周期拉长,价格翻倍,连中间贸易商都赚得盆满钵满。

H100基于Hopper架构,集成800亿个晶体管,拥有Transformer引擎和可扩展的NVLink互连技术——前者是专为大模型训练设计的电路块。它卖的不只是计算,是时间;谁拿到它,谁就能早一天训出模型,早一天上线抢市场。

于是局面变成这样:最底层的芯片,卡住了云服务商、开源模型团队和所有想要做应用的人。你可以在开源社区里免费下载到顶级模型的权重,但你没有卡来跑它。你可以买云服务,但云厂商自己都在求英伟达多供货。你可以自己研发芯片,但开发者生态还在CUDA那一边。最底层的硬件,拿走了最顶层的定价权。这不是说英伟达贪婪,而是整个系统的瓶颈在那一刻正好压在了它脚下。

芯片层由此开始征收一种算力税。这不是某个政府开的税种,也不是哪家公司账本上的正式科目,而是每一层为了获得算力向上游支付的隐性成本。云厂商买卡时多付的那部分溢价,最终会摊到每一笔按秒计费的账单上;开源团队为跑模型租机器烧掉的钱,本质上是在付一道生态闸门费;

应用层烧掉的风险资本,最后也有一部分流进圣克拉拉那间没有晶圆厂的办公室。没人会把这笔钱写进发票抬头,但每个人都在付。

而制度,又给这道生态锁定加了一把锁。2023年9月,法国竞争管理局突击检查了英伟达在法国的办事处。这类检查通常是为了保存证据,评估一家公司是否以不当方式排挤规模较小的竞争者。英伟达否认任何不当行为,但从监管者的焦虑里能看出一个更大的疑问:当AI产业的命脉集中在一家公司的软件生态里,这种集中是否还能用市场竞争来解释。

到了2024年6月,美国司法部与联邦贸易委员会的分工调查,把英伟达单独挑出来,这件事本身已经足够说明问题。调查集中在公司行为而非并购事宜,背景是OpenAI员工发布公开信,表达了对人工智能技术快速发展的担忧以及缺乏监管的意见。

真正的复杂之处在于,出口管制这个原本为限制中国AI能力而设计的政策,意外地给CUDA生态的锁定效应加了一层新的意义。

2022年之后,美国商务部工业和安全局对A100、H100这类高性能芯片对华出口实施许可证制度,实际上禁止最先进的英伟达芯片卖给中国客户。按常理推断,这应该是英伟达的坏消息:少了一个庞大的市场。

但短期内的结果却相反。中国的互联网公司、云厂商和人工智能实验室,在断供前疯狂抢购,H100的价格被炒到天价。英伟达的账上,那一季度来自受限市场的营收一度不降反升。

更重要的是,这种限制让CUDA生态在可合法购买的地区变得更加稀缺和宝贵。其他国家的开发者、云厂商想的是:一定要留在英伟达的生态里,因为中国被卡出去这件事,恰好证明了这个生态的价值。

但长期看,压力会往另一个方向传导。当最先进的芯片被禁止卖给中国时,中国的科技公司被迫转向自研替代方案。华为的昇腾、海光、寒武纪,以及壁仞科技、摩尔线程等创业公司,都开始往替代CUDA的方向狂奔。那些招聘启事上写明需要CUDA移植或替代方案开发经验的岗位,就是这种压力的直接证据。

写这行字的公司要的不是一个人,而是一整条离开CUDA的路。这里得诚实地说一句:我们也不知道这第二条路最终能不能走通。

生态这种东西,一旦形成,就有点像语言共同体。让人换一种语言,比造出新语言本身难得多。中国自研芯片可以在纸面上达到相当不错的算力密度,但真正难的是让足够多的开发者愿意像当年学CUDA一样,去学一套尚未成熟的国产方言。这需要时间、学校和足够多的就业岗位去支撑。出口管制短期内是断供的痛苦,长期看却可能催生一个独立于CUDA的平行体系。至于这个平行体系会是一个充满漏洞的替代品,还是一个真正能分庭抗礼的新中心,我们不知道。历史还没走到那一步。

回到眼前的现实,最直接的问题已经不是中国能不能替代CUDA,而是另一件事:这些已经插进数据中心机柜里的芯片,正在变成一头头吞电巨兽。一个满载H100芯片的数据中心机柜,功耗可以高达十千瓦以上,有的配置甚至更高。十千瓦是什么概念?

这种锁定并非抽象感受。英伟达在2024年3月的GTC上给过一个量级:全球已有超过五百万开发者熟悉CUDA,CUDA Toolkit的累计下载次数超过四千万次,GitHub上带CUDA标签的仓库以十万量级增长。一所大学的AI实验室里,从本科生到博士后,几乎每个人都在文档里搜过cudaMalloc和cudaMemcpy。这个事实比任何技术参数都更能说明锁定怎么发生:不是英伟达把门关上,而是每个开发者都自愿把最趁手的钥匙揣在口袋里。等别家芯片厂商想把人请进门,才发现对方手里没有那把钥匙的模具。更麻烦的是,他们连培养咖啡师的学校都还没建起来。

2022年10月7日,美国商务部工业和安全局第一次给这条护城河砌上制度外墙。那版规定没有点名A100或H100,而是画了一条性能线:当一颗芯片的综合运算性能(TPP)和芯片间互连带宽同时高过规定门槛时,出口到中国就需要申请许可证。A100、H100正好踩在这条线之外。

英伟达随后推出为中国市场改过的A800和H800,把NVLink互连带宽降下来,试图让芯片留在许可线内。这个动作在商业上很聪明,在制度上却很脆弱:它不是绕过规则,而是贴着规则游走。2023年10月,BIS更新管制,把“性能密度”作为补充门槛,A800、H800最终也被挡在门外。

制度没有因为一家公司改规则,却让这家公司的生态变得更稀有、更值得争夺。每一次收紧,都像在向全球客户重复一句话:能合法拿到CUDA生态的那批卡,只会更少,不会更多。于是抢购从算力需求变成仓位需求,再变成地缘溢价。

上海张江那张招聘启事,就贴在这条制度与生态的交界处。岗位名称通常叫系统软件工程师、AI编译器开发或异构计算平台优化,学历要求硕士以上,工作内容却写得异常具体:基于国产GPU完成CUDA代码移植、算子适配与性能调优,处理动态形状、算子融合、访存合并和内存池复用。换句话说,招进来的这批人不只要懂英伟达的方言,还要负责把成千上万行现成CUDA代码翻译成自己公司芯片能听懂的方言。

翻译从来不是逐字对应。线程块的同步方式、共享内存的大小、显存访问的合并策略,在英伟达架构上顺滑自如,换到国产GPU上就可能变成随机卡顿和几十小时的调试。咖啡师就算换了机器,也知道蒸汽棒该插多深;可一旦面板旋钮位置、压力曲线和安全阈值都变了,旧肌肉记忆反而会变成伤害。

中国自研芯片公司真正要补的,不是一两颗芯片的性能差距,而是整条从编译器、算子库、调试器到高校课程和开发者社区的软件栈。那东西无法靠一笔融资买来,只能靠许多届学生、许多家公司和许多个通宵熬出来。也正因如此,我们目前无法判断这条离开CUDA的路能不能走通。

讨论到这里,权力已经从晶体管密度悄悄移向开发者习惯。但生态锁定和出口管制加在一起,并没有让那些被锁住的算力安静下来。正相反,每一块H100从纸箱里拿出来,插进服务器,通上电,就开始变成需要持续喂电、散热和计量成本的工业负载。它不再是显卡,而是吞电巨兽的开关。CUDA让开发者不忍离去,出口管制让客户不敢等,芯片层由此赢得了定价权;但定价权之下,电表已经开始转动。至于这电表由谁设计、按什么规则收费,芯片层的答案已经用完。

一个普通家庭夏天的空调加冰箱加洗衣机一起满载,大概也就这个数量级。可H100机柜不是一台,而是一排一排地码在数据中心里,像图书馆的书架一样密集。它们二十四小时不关,全年无休。一个机柜一年吃掉的电费,按工业电价粗算,轻易达到数万美元。芯片本身的采购成本,单块H100早就在几万美元的区间浮动,一个机柜里塞下几十块这种卡,硬件成本就是数百万美元。还没算冷却、网络设备和运维人工。

这些数字堆在一起,会让人产生一种很直接的感觉:芯片层已经完工了,最底层的齿轮正在高速转动,但谁来为这些吞电巨兽买单?如果只有几家巨头买得起卡、付得起电费,那四层系统上面的开源模型和应用层,又该怎么把天价成本消化掉?这个问题不是芯片能回答的。

它直指上面一层:云服务。当算力变成像水电一样可以按用量付费的东西,那个电表怎么转,就成了下一场权力的中心。

眼前这一刻,司法部的调查人员还在慢慢翻阅英伟达的档案。上海张江的人事还在招聘网站上刷新简历。

圣克拉拉的工程师还在为下一代架构铺陈新的CUDA接口。全世界的AI公司还在为拿不到货而焦虑。最底层的定价权稳稳地坐在那里,像一块压舱石,纹丝不动。而它周围,账单正在一张一张地堆高。这些账单的负重,已经不能靠芯片层自己来回答了。

当一台台吞电巨兽被塞进机柜,当地租、电费、冷却和折旧逐月累积,硬件本身的价格反倒成了入场券,真正压在所有从业者心头的,是一道新问题:谁有资格把这些天价成本拆成无数笔小额账单,又按什么规则来转动那只电表。芯片层用生态锁定赢得了定价权,但它无法独自完成从计算到服务的转化。那个转化动作,恰好落在上一层——云服务的计费系统里。在算力成为水电之后,掌握阀门的人开始向每一滴水收取过路费。