第 1 章

从ChatGPT在2022年底的爆发切入

对话框先于理论抵达普通人手里。那个网页很素净,没有仪表盘,没有复杂设置,底部只有一个空白的输入框。人们随手敲进一句想要它帮忙写请假邮件的话,几秒钟后,一段措辞得体、语气温和的文字出现在屏幕上。有人让它写诗,有人问它二战史,有人请它解释量子纠缠,有人干脆和它聊了一个通宵。

2022年11月30日,OpenAI公司把ChatGPT交给了公众。五天之后,用户数突破一百万;到次年一月,这个数字超过一亿。它成为有记录以来增长最快的消费者应用之一。

《大西洋》杂志的德里克·汤普森把它列入2022年年度突破,用的说法是生成式人工智能的一次爆发,并判断它可能会改变人们对工作方式、思考方式以及人类创造力真正含义的认识。这个判断说得很重,但放在当时的气氛里,不算夸张。

人们第一次在屏幕上碰到一种东西:它读得懂问题,组织得出推理,甚至会在一个错误答案后面补上一句看起来很诚恳的承认,说它理解对方的困惑。真正让人不安的,是它偶尔会一本正经地编造事实。

OpenAI自己承认,ChatGPT有时会写出看似合理但不正确或荒谬的答案,在大型语言模型里,这被称为幻觉。它的奖励模型围绕人类监督设计,过度优化会反过来影响表现。可有多少用户读得到这份技术说明呢。

更多的人只是感到,机器突然像在说话。媒体开始追问一个表层问题:人工智能是不是学会了思考。这个问题很热闹,却把最要紧的线索遮住了。

我们真正该问的,是这种能力为什么在2022年底才以普通人都能触摸的方式爆发出来。它没有发生在算法论文刚发表的年份,也没有发生在某个大学实验室第一次跑通原型的季节,而是发生在旧金山这家公司决定把对话框公开的那一天。要回答这个为什么是现在的问题,不能只盯着ChatGPT本身。它是一个结果,不是原因。

先看结果背后的时间差。驱动ChatGPT的核心架构叫Transformer,谷歌的研究者在2017年就发表了那篇论文。论文提出的机制,让模型可以并行处理长序列中的注意力关系,不必按顺序一个词一个词地啃。

这个想法后来成为大语言模型的地基。可论文发表之后,世界并没有立刻被改变。

它还需要另一块地基。再往前看,ChatGPT能做对话、写文章、调代码,靠的是模型记住了语言中大量的统计模式。这种记忆和计算需要巨大的硬件投入。用户每一次提问,背后都有一排排机器在算。它们不是普通的中央处理器,而是一种专门为并行计算设计的芯片。没有这些芯片,Transformer论文还是一篇论文。

这就要把时间拉回到更早的一个现场。2012年,多伦多大学。那一年有一场名为ImageNet的大规模视觉识别挑战赛。比赛的任务很简单:给出一张图片,机器要判断里面是什么东西。但规模很大,训练数据包含上百万张标注图片,类别超过一千种。参赛队伍大多用了各种人工调优的识别方法,错误率卡在百分之二十几。就在那一年,一个叫AlexNet的模型以压倒性优势夺冠,前五错误率降到百分之十五点三,比第二名低了超过十个百分点。这个差距在竞赛圈里引起震动。

人们后来常常把这一刻称作深度学习时代的起点。但重启的原因很具体。

AlexNet用的核心算法并不新鲜。卷积神经网络的基本思想,杨立昆早在1989年就写进了论文。那篇论文里已经有卷积层、池化层、反向传播这些后来被反复提起的概念。理论早就摆在那里,像一张设计图。

AlexNet真正做对的事,是给这张设计图配上了合适的动力。它用两块英伟达GeForce GTX 580图形处理器训练网络。这两块原本为电子游戏设计的显卡,让一个包含六千万个参数的神经网络能在可接受的时间里完成训练。作者在论文里写得很明白:如果换成当时的中央处理器,同样的训练会漫长到不切实际。

这不是一个算法胜利的故事。这是一个供给条件突然打开的故事。要理解这句话,先得弄清楚图形处理器和中央处理器到底差在哪里。中央处理器像一位极精明的数学家,什么题都能解,但一次只能专注做几件事。图形处理器像一大群高中代课老师,每个人算得没那位数学家快,却可以同时批改几百分卷子。

神经网络的训练恰好是后一种活儿:大量相似的计算同时进行,彼此之间不太需要等待。游戏显卡之所以合适,是因为渲染画面时就要同时处理几百万个像素,每个像素做一遍类似的变换。这种并行能力,歪打正着地撞上了神经网络的需求。于是,一个被锁在论文里的算法,找到了一种能释放它的硬件形态。

这就是这一章想说的第一件事:我们正在经历的这场人工智能浪潮,并不是机器突然学会了思考,而是算力终于找到了释放思考形态的方式。这个区别很重要。它意味着,整条故事的主线不该沿着算法每年变聪明多少去画。聪明这件事很难标刻度。真正能标刻度的,是算力什么时候到位、以什么价格到位、由谁提供、又由谁控制。算法决定了思考可能的形状,算力决定了这些形状能不能从图纸变成现实。

这里的算力,并不是一个抽象的科技词。它可以被理解成人工智能时代的电力。这个类比值得展开,因为它能帮我们绕开很多术语。十九世纪末,电被发明出来。发电机能转,灯泡能亮,实验室里也演示过电弧。

但电本身没有立刻改变世界。真正改变世界的,是电网。当电力变成一种可计量、可调度、可租赁的商品之后,工厂才不再需要自己建在旁边的小河上,电车才敢沿着城市跑,家电才像雨后春笋一样冒出来。电网把一种自然力变成了基础设施,于是所有依赖这种力的新玩意儿都有了生长的土壤。

人工智能也站在类似的位置上。算法早就有了,就像发电机早就有了。图形处理器架构的成熟,让算力第一次以适合神经网络的形态出现。云服务的普及,把这种算力变成了可租赁的水电。开源模型降低了使用门槛,让更多人和小公司不必从零开始。应用层再把能力翻译成具体价值:一段对话、一张图、一个翻译、一次诊断辅助。这四层合在一起,才构成今天的人工智能产业链。

所以,ChatGPT在2022年底的爆发,表面上是应用层的胜利,实际上是一场算力供给革命的结果。

算法研究者花了三十年把思考的可能形态描出来,芯片产业花了十几年把跑这些形态的硬件做出来,云服务商再用几年把硬件变成可调用的基础设施,最后才是OpenAI这样的公司把对话框推到公众面前。

这里有一个概念需要在这一章落地:算力税。算力税不是政府征的税。它指的是,产业链上每一层为了获取算力,都不得不向上游支付一笔隐性成本。这笔成本可以体现为资金,比如云账单;可以体现为数据,比如训练大模型需要抓取并清洗海量语料;可以体现为锁定效应,比如某个框架只在某种芯片上跑得最快;也可以体现为议价权的让渡,比如你离不开某个供应商的卡,谈判时就很难硬气。

ChatGPT爆发时,用户大多不直接付钱。但每一句回答都有成本。OpenAI要为云端的图形处理器使用时长付费,云厂商要为采购芯片和数据中心付费,芯片厂商则掌握着产能和架构的节奏。这笔成本逐层向上游流动,最终落在谁那里,谁就掌握了这一层最硬的约束。

用户看到的是一次免费的魔法回答,产业链上却已经完成了一轮算力税的征收。这不是一个抽象的推演。

ChatGPT上线初期,对2019年9月之后的事件知之甚少。这意味着模型的知识被截断在一个时间点。原因不只是数据采集的截止,还在于训练一个涵盖更新语料的模型需要更多算力、更多时间和更多钱。一个技术上的截止,背后是算力账单上的小数点。

BBC在2022年12月报道,ChatGPT不能表达政治观点或从事政治活动。这当然有产品政策的考虑,但任何对模型行为的约束,都需要在训练和微调阶段投入计算资源。你可以把护栏加上去,护栏本身也要烧算力。

这就引出了另一个概念:瓶颈转移。人工智能产业链的权力中心,会随技术瓶颈的突破而移动。当算法理论是瓶颈时,权力偏向那些能提出新架构的研究机构。当算力是瓶颈时,权力偏向芯片厂商和云服务商。当模型太重、太贵时,权力偏向能把模型做小、做开源、做低门槛的人。当应用太稀薄时,权力又偏向能把能力翻译成具体价值的公司。

AlexNet的胜利,是算力瓶颈被暂时突破的时刻。两块游戏显卡让卷积神经网络从论文里走了出来。随后几年,深度学习迅速应用到语音、图像、翻译等领域。这个阶段,GPU成为行业里最紧俏的资源。英伟达从一家游戏显卡公司,变成人工智能基础设施的核心供应商。它的财报和供应链,开始牵动整个行业的节奏。

到了大模型时代,算力瓶颈没有消失,只是转移了位置。2017年的Transformer架构解决了序列建模的部分难题,算法瓶颈被打开,算力瓶颈立刻变得更加尖锐。训练一个像GPT系列那样的大模型,需要成千上万块高端芯片同时工作,需要庞大的数据中心,需要稳定的电力和散热。也就是说,旧的瓶颈刚一松动,新的瓶颈就在上游凸显出来。这条链永远在最紧的地方重新定价。

算力的供给侧也在不断重新组织自己。2021年4月,英伟达发布了首款基于Arm架构的数据中心中央处理器。

同一个月,它推出了全新的DGX SuperPOD,一个云原生、多租户的超级计算机,专门面向企业开放人工智能能力。也是那个四月,它发布了面向自动驾驶汽车的AI处理器NVIDIA DRIVE Atlan。这些消息分属不同产品线,却指向同一个动作:算力供给者不再满足于只卖显卡,它要往中央处理器、整机系统、数据中心方案甚至行业场景里延伸。

这三件事如果单独看,不过是某家公司的产品发布。放在本章的线索里,它们却有更重的含义。当算力成为一种类似电力的基础设施时,供给者会自然地向上下游扩张,试图控制从发电到输电再到用电的更多环节。DGX SuperPOD想做的是把算力打包成接近电网调度的形态。数据中心的Arm架构CPU,是想把中央处理器这个原本相对独立的部件也纳入同一套算力网络。自动驾驶处理器,则是在提前卡位一个未来会消耗巨量算力的应用场景。这还只是公开的产品动作。

背后的供应链更复杂:先进制程、封装、光刻设备、内存带宽、数据中心选址、电力成本,每一项都构成算力供给的约束。也就是说,算力看似充裕,实则从来不是抽象无限的东西。它被工厂的产能卡着,被制程的良率卡着,被数据中心的电费卡着,被出口管制的名单卡着。于是,人工智能的繁荣,从一开始就带着强烈的产业地理和权力色彩。

回到ChatGPT的爆发现场,我们再去看那个空白输入框,它其实是一个四层系统的最末端。用户在那个框里输入一句话,触达的是应用层。应用层调用了模型层。模型层运行在云服务层的某个实例上。云服务层又跑在芯片层提供的算力底座上。四层之间的每一次调用,都伴随一笔算力税。每一层的议价能力,取决于它离不可替代的瓶颈有多近。

有时候,瓶颈会短暂地向下游移动。当模型架构有突破时,应用公司会突然发现自己能做以前不敢想的事。但这种乐观通常持续不了太久。因为应用越繁荣,算力消耗越大,上游的供应就越紧张。瓶颈重新回到芯片层。于是,权力也重新回到芯片层。

这就是瓶颈转移的实质:它不让任何一层永远舒服。这个判断也许会让一些读者不舒服。

常见的说法是,人工智能的进步主要源于算法突破。研究者提出新模型,打败旧模型,行业就往前跳一步。这个说法没有错,但它只讲了故事的一半。

算法突破决定了某条路能不能走通,供给条件决定了你能在这条路上跑多远。AlexNet之前的卷积神经网络不是没有想法,是没有足够的算力。Transformer之后的语言模型也不是2017年底立刻涌现,因为当时的算力还不足以把参数推上去。如果把人工智能的历史看成一条平滑的智力增长曲线,我们就会错过最关键的起伏。

真正的曲线更像是台阶:算法在等待计算资源,资源被某个产业选择释放出来,然后算法突然跨上一大步,接着整个产业链的瓶颈又挪到新的地方。这里的推动者不全是算法科学家,还包括芯片工程师、云平台架构师、开源社区维护者、应用产品经理,以及那些决定投资多少资源的机构。这也是为什么,ChatGPT的爆发不能只被写成AI能写诗画画式的惊叹。

那太轻了。这个现象背后是一段产业结构的缓慢积累:从1989年卷积网络的论文,到2000年代图形处理器的迭代,到2012年两块游戏显卡跑出的竞赛结果,到2017年Transformer架构的提出,再到云服务把训练和推理变成按小时计费的业务。最后才是2022年的那个输入框。如果算力是新的电力,那么谁控制了发电厂,谁就控制了整条产业链的命脉。这个问题不是杞人忧天。电力的历史已经给出过教训。电网不是天然中立的。

谁建了发电站,谁就决定了电费、供电范围和接入标准。工厂主会为了接入电网而改变选址,电车公司会为了电价而调整线路,家电制造商必须把电压和插头设计成电网兼容的规格。电力的普及确实带来了繁荣,也带来了新的依附关系。算力正在重复这个过程。今天的人工智能应用,无论看起来多么轻巧,最终都要回到那几座算力发电厂。

它们的机房在什么地方,使用什么制程的芯片,由谁代工,功耗多少,能租到什么价格,这些看似枯燥的问题,决定了一个对话框能不能在深夜迅速回话,决定了一个初创公司能不能训练自己的模型,也决定了一个国家的研究机构能不能跟上最前沿的规模。还有一件事是我们暂时不知道的。

如果算力更早到位,历史会不会改写。假如1989年的杨立昆手里有几万块图形处理器,深度学习会不会提前二十年爆发。这个问题没有确定答案。

它透出历史的魅力:理论可以在纸上等很久,最终把它唤醒的,常常是一个来自完全不相干行业的硬件选择。我们只能观察到,历史确实选择了那样一条路:先是游戏玩家对画面的需求推动了显卡进步,然后研究者发现那些为游戏而生的芯片恰好是神经网络的燃料。这种路径依赖,让算力供给从一开始就带着偶然性。图形处理器不是为人工智能发明的。它最早服务的是游戏和图形工作站。

英伟达的工程师们当年把并行计算能力一点一点做进显卡时,脑子里想的恐怕是怎样让游戏画面更流畅,而不是怎样改变人工智能。可正是这种为娱乐而生的硬件,最后成了通用智能的底座。

历史的因果链常常不按人的原先意图走。理解这一点,就看懂了ChatGPT爆发的另一层意味。那个输入框之所以能出现,是因为在它下面有一条被反复改造、不断集中的算力供应线。用户看到的是一次神奇的技术飞跃,产业链看到的则是一场算力供给的革命。两者的信息差,正是公众理解人工智能的最大鸿沟。

现在,压力被递到了一个具体问题上:如果说算力是新的电力,那么今天的发电厂究竟掌握在谁手里。那些芯片来自哪里,经过哪些工厂,又在什么规则下被允许卖到世界各地。这个问题已经超出了产品评测和功能体验的范畴,它指向产业链最底层的权力格局。回答它,必须先去一片具体的芯片上走一遭。