第 9 章
开源模型的岔路口:从社区玩具到商业武器
如果连最有钱的巨头都无法完全信任这个算力交易所,那么,是否存在一条可以绕过它的旁路?这个问题在2023年初有了一个看似意外的答案。不是另一家云厂商。不是某种新芯片。
而是一个被很多人当作极客玩具的东西:开源模型。2023年7月,微软年度合作伙伴大会上发生了一个让科技媒体措手不及的画面。萨提亚·纳德拉站在舞台上,身后的大屏幕同时亮出了两家公司的标志:微软和Meta。他宣布了一项合作——Meta刚刚发布的Llama 2大语言模型,将通过Azure云服务向企业客户提供。
台下响起礼节性的掌声。但如果你了解这两家公司过去几年在AI领域的站位,这个画面就不太对劲。微软是OpenAI最大的金主和独家云服务提供商,2020年9月就锁定了GPT-3的独家授权。Meta是被排除在GPT生态之外的社交媒体公司,在AI竞赛中看起来落后了一截。按理说,他们应该在模型层上互相卡位。但他们没有互相卡位。他们选择了合作。这不是一个简单的商业联盟。
Llama 2的发布,是AI产业链上开源模型层身份转变的决定性时刻。不是因为它技术有多好——虽然确实不错——而是因为它把“开源”这个词从社区理想主义的旗帜,变成了商业博弈的武器。要理解这个转变的份量,需要先回到一年前,回到那个让整个产业突然意识到开源模型不只是玩具的时刻。2022年8月,一家名叫Stability AI的伦敦创业公司发布了Stable Diffusion。
这是一个图像生成模型,你输入一句话,它输出一张图。功能上,它和OpenAI在2021年推出的DALL-E没有本质区别。区别在于,Stable Diffusion是开源的。不只是“公开了论文”那种开源。他们把模型权重文件完整地放了出来,任何人都可以下载、部署、修改、商用。文件大小只有几个GB,可以在消费级显卡上运行——就是那种你玩游戏用的显卡,一两千块钱的那种。这个事在当时引起的震动,可以这样理解。
OpenAI花了几千万美元、动用了成千上万块A100显卡训练出的DALL-E,是一个藏在保险柜里的秘密武器。Stability AI的创始人Emad Mostaque公开表示,他们的模型训练成本不到60万美元,用的是从亚马逊云服务上租来的256块A100显卡。然后他们把保险柜打开了,把武器图纸贴在了网上。社区炸了。在接下来的几个月里,基于Stable Diffusion衍生出来的项目数以千计。
有人把它做成了Photoshop插件,有人用它生成游戏素材,有人把它塞进手机App。一个由志愿者组成的社区,用消费级显卡和开源代码,在图像生成这个方向上,硬生生把OpenAI的闭源优势抹平了。这个时刻传递出一个信号:开源模型不是玩具。它是一条可以绕过算力垄断的现实路径。但这个信号里藏着一个容易被忽略的细节。Stable Diffusion的训练确实“只”用了256块A100。
一块A100在2022年的售价大约一万美元,256块就是256万美元。Stability AI租用的是云服务,按小时付费,60万美元的训练成本是这么算出来的。对于一家拿到一亿美元融资的创业公司来说,60万不算贵。但对于一个在车库里折腾硬件的极客社区来说,60万美元是一道无法跨越的墙。
这就是开源模型的第一层矛盾:模型是开源的,但训练模型的能力不是。2023年2月,Meta的AI研究团队发布了一个叫LLaMA的模型——注意大小写,这是第一代,不是Llama 2。LLaMA的发布方式很特别。Meta没有开发布会,没有合作伙伴站台,只是在研究论文里附上了一个申请链接:如果你是研究者,填表申请,审核通过后可以把模型权重发给你。这在开源社区眼里已经算是一种进步了,毕竟GPT-3和DALL-E连申请的窗口都没有。
但Meta显然低估了社区的行动力。模型权重文件被泄露了。有人把申请到的权重文件上传到了4chan和BitTorrent。
几天之内,全球任何一个有网络连接的人都可以下载到LLaMA的完整权重。Meta的“受控开源”计划在一夜之间变成了彻底的开放。
紧接着发生的事情,让整个产业看到了开源模型的真正威力。社区开发者们开始疯狂优化这个模型。他们发现,LLaMA虽然参数量比GPT-3小很多——最小的版本只有70亿参数,最大的也不过650亿——但性能出奇地好。经过量化压缩和指令微调,一个能跑在笔记本电脑上的模型,居然在某些任务上接近了GPT-3.5的水平。
量化压缩是什么?可以这样理解:原始模型里的每一个参数都是一个32位的浮点数,就像一本书用精装铜版纸印刷,每一页都厚实、昂贵、沉重。量化压缩相当于把同样的内容印在轻薄的再生纸上——信息没少,但体积和成本大幅下降。一个原本需要专业显卡才能运行的模型,压缩后可以在手机芯片上跑起来。
社区开发者做这件事的速度和创造力,让Meta的研究人员都感到惊讶。他们本来只是想发篇论文,结果意外地成为了开源AI运动的旗手。
但Meta的管理层看到的,是另一幅图景。2023年7月,Meta正式发布Llama 2。这次不是研究论文附带申请链接,而是一场精心策划的商业发布。扎克伯格亲自出镜录制视频,宣布Llama 2将免费开放给研究者和商业用户使用。同时,微软的纳德拉站在另一个舞台上,宣布Llama 2将通过Azure云服务分发。
“免费”和“开源”这两个词放在一起,听起来像是慈善。但如果你仔细读Llama 2的社区许可协议,会发现一些微妙的措辞。协议里有一条:如果你的产品或服务在Llama 2发布之日拥有超过7亿月活跃用户,你需要从Meta获得单独的商业许可。
这条限制在开源社区引发了争议——它不符合开源倡议组织定义的标准开源条款。但争议归争议,7亿月活这个门槛,在2023年只有少数几家公司跨得过去:谷歌、苹果、微软、亚马逊、腾讯、字节跳动。换句话说,Meta把模型免费给了全世界绝大多数开发者和企业,但给少数几家竞争对手留了一扇需要敲门才能进的门。
这不是慈善。这是一步精妙的战略棋。在Llama 2发布之前,AI模型层的权力格局是这样的:OpenAI和谷歌拥有最强大的闭源模型,通过API按调用量收费。开发者如果想把AI能力集成到自己的产品里,要么付钱给OpenAI,要么付钱给谷歌云,要么自己从头训练——第三种选择的成本高到几乎不可行。
这种格局对Meta来说很不利。Meta的主业是社交网络和广告,它需要AI来驱动内容推荐、广告定向和用户增长。如果模型层被OpenAI和谷歌垄断,Meta就不得不在一个自己无法控制的底座上建造自己的业务。更糟糕的是,苹果和谷歌控制着移动操作系统,如果他们把闭源AI模型深度集成到iOS和Android里,Meta的社交应用就可能被系统级的AI助手取代。
扎克伯格在2023年的一次财报电话会议上把话说得很直白:核心业务依赖于竞争对手提供的技术,这是Meta不想处的位置。开源Llama系列,就是Meta的破局之策。
第一,它削弱了OpenAI和谷歌在开发者生态上的先发优势。当开发者可以免费获得一个性能不错的开源模型时,他们就不必把自己绑在OpenAI的API上。每一个选择Llama的开发者,都是OpenAI失去的一个潜在客户。
第二,它让微软无法独占模型层的控制权。微软是OpenAI的最大投资者,也是Llama 2在Azure上的分发伙伴。但Meta刻意避免让任何一家云厂商成为开源模型的唯一分发渠道。Llama 2同样可以通过亚马逊AWS和谷歌云获取。如果微软试图通过Azure锁定Llama生态,开发者可以转身去AWS部署同样的模型。
第三,也是最重要的一点:通过免费分发高性能模型,Meta把模型层从稀缺资源变成了公共基础设施。当一个东西变成基础设施,它的商业价值就从拥有这个东西的人手里,转移到了知道怎么用好这个东西的人手里。
这听起来有点绕,但其实是个很古老的逻辑。电灯泡刚发明的时候,最赚钱的是卖灯泡的公司。
但当电力变成基础设施——每家每户墙上都有插座——最赚钱的就变成了制造电器的人:冰箱、电视、电脑。灯泡本身成了低利润的大宗商品。
Meta想让模型层变成灯泡。它不靠卖模型赚钱,它靠的是当所有人都用上AI模型之后,社交网络上会产生更多内容、更多互动、更多广告库存。模型越普及,Meta的广告业务越受益。
这个逻辑在Llama 2的发布合作伙伴名单上得到了验证。除了微软,Meta还宣布与高通合作,把Llama 2优化到可以在骁龙芯片上运行。高通的芯片装在全世界大多数安卓手机里。Llama 2的目标不是停留在云端,而是跑进每一个人的口袋。
但这里有一个很实际的问题。训练Llama 2花了多少钱?Meta没有公布确切数字,但根据业内估算,训练一个700亿参数的模型,大约需要消耗相当于2000块A100显卡运行一个月以上的算力。按云服务的市场价格,这大约是几百万到上千万美元。这还不算之前无数次失败的实验、调参和消融研究。
把这些隐性成本算进去,真实花费可能翻倍。Meta付得起这笔钱。它2023年的资本支出超过250亿美元,其中相当一部分用于扩建AI算力基础设施。几千万美元的训练成本对它来说,只是算力预算里的一个零头。
但社区付不起。这就是“公共图书馆与印刷厂”这个类比要解释的东西。开源模型像一座公共图书馆,大门敞开,任何人都可以走进去,免费借阅最新的知识。但建造这座图书馆的砖瓦——那些GPU集群、高速网络、冷却系统——以及印刷藏书的机器——训练流程、数据管道、超参数调优——仍然掌握在少数几个拥有印刷厂的人手里。
图书馆的藏书可以自由流通,但谁能决定下一批新书上架?谁能决定哪些书不再更新?谁能决定图书馆的开放时间?答案不是“社区”。
Llama 2发布几个月后,微软在Azure Marketplace上架了一项服务,企业客户可以一键部署Llama 2的API端点,按调用量付费。
微软提供的不是模型本身——模型是免费的——而是运行模型所需的算力、网络、监控、安全和合规基础设施。
这就是算力税的转移。在前面的章节里,我们讨论过云服务如何通过虚拟化技术把物理硬件变成按需租赁的抽象算力,并在这个过程中征收一层算力税。当模型层是闭源的时候,算力税藏在API调用的单价里——你分不清你付的钱有多少是给模型的,有多少是给底层算力的。当模型层变成开源,这两个部分被拆开了:模型免费,算力收费。但算力税的总量没有减少,只是变得更透明了。
对于企业来说,部署一个开源模型的实际成本,不是下载那几GB的权重文件,而是租用能够运行它的GPU实例。一个700亿参数的Llama 2模型,即使在量化压缩后,也需要至少一块A100级别的显卡才能以可接受的速度进行推理。如果你需要同时服务几百个用户,你需要一个GPU集群。如果你需要微调模型以适应自己的业务场景,你需要更多的算力和更长的租用时间。所有这些,都在云厂商的计费表上滴答作响。
微软的Llama 2 on Azure服务,本质上是在说:模型我帮你部署好了,你不用操心底层基础设施,只需要按调用量付钱。这和OpenAI的API商业模式,在形式上已经没有本质区别。区别只在于,OpenAI的API背后是一个闭源模型,Azure的背后是一个开源模型。但对于调用API的企业开发者来说,他们看到的东西是一样的:一个端点URL,一份按token计费的价格表,一个监控面板。
开源模型的理想主义者可能会说:你可以自己部署,不用云服务。技术上是这样。但现实是,大多数企业没有运维GPU集群的能力和意愿。他们想要的不是一堆需要自己组装的零件,而是一台插上电就能用的机器。云厂商卖的正是这种便利——而这种便利,就是算力税的新载体。
回到Meta的战略棋局。Llama 2的发布确实削弱了OpenAI在模型层的垄断地位,但它没有削弱云服务层的权力。恰恰相反,开源模型的普及让云厂商的算力生意更好了。
每一个下载Llama 2的开发者,都是云厂商GPU实例的潜在客户。亚马逊AWS在Llama 2发布后迅速跟进,推出了自己的部署方案。谷歌云也加入了支持行列。三家最大的云厂商都在争相成为开源模型的首选运行平台。他们不关心模型是不是开源,他们关心的是模型运行在哪里。运行在哪里,算力税就交到哪里。
这就是开源模型层的核心矛盾:它解放了模型,但没有解放算力。它打破了模型层的垄断,但把权力转移到了云服务层。瓶颈转移了,但没有消失。
2023年底,开源社区开始出现一种新的声音。一些开发者提出,仅仅开放模型权重是不够的,应该开放训练数据、训练代码和超参数配置——也就是所谓的“全栈开源”。如果只有权重是开放的,社区就无法复现训练过程,无法验证模型的安全性和偏见程度,也无法从根本上摆脱对巨头算力的依赖。但“全栈开源”面临一个几乎无法逾越的障碍:数据版权和算力成本。
训练一个700亿参数模型所需的数据集规模是万亿token级别,这些数据大部分来自互联网抓取,涉及复杂的版权和隐私问题。即使数据可以合法公开,存储和分发这些数据也需要庞大的基础设施。更不用说,重新训练一遍模型所需的算力,是绝大多数机构无法承担的。所以“全栈开源”到目前为止,仍然是一个口号多于现实的愿望。
这就引出了一个更深层的问题:当开源模型的主体从社区志愿者变成科技巨头,开源的目的是什么?在软件时代,开源运动的核心动力是自由——自由使用、自由修改、自由分发。理查德·斯托曼在1983年发起GNU项目时,他的敌人是专有软件公司,他的武器是GPL许可证。GPL有一个著名的“传染条款”:如果你使用了GPL许可的代码,你的衍生作品也必须以GPL许可发布。这确保了开源代码永远不会被闭源软件吞并。
但Llama 2的社区许可协议里没有传染条款。它允许商用,允许修改,允许分发,但它在7亿月活的门槛上划了一条线。
这条线不是法律意义上的copyleft,而是商业意义上的保留追索权——对最大的几个竞争对手,Meta保留了一扇需要敲门才能进的门。这不是自由软件运动的精神。这是商业开源的精神。商业开源不是新事物——红帽Linux、MySQL、MongoDB都是商业开源的成功案例。它们的共同模式是:核心产品开源,通过企业级支持服务、托管云服务或高级功能收费。但Llama 2的模式更进一步。
Meta不靠Llama 2本身赚钱。它没有提供Llama 2的企业支持服务,没有推出Llama 2的付费版本。它把Llama 2免费送出去,然后在自己的社交网络帝国里收获AI普及带来的广告收益。这是一种全新的开源战略——如果它还能被称为开源的话。更准确地说,这是一种将开源武器化的做法:用开源模型削弱竞争对手的模型层优势,同时让自己的核心业务免受AI垄断的威胁。这不是社区玩具变成了商业武器。这是从一开始就被设计成武器。
2022年的Stable Diffusion,是这场转变的序曲。它证明了开源模型可以在性能上匹敌闭源模型,给了社区一个希望。但Stability AI本身是一家商业公司,它的开源策略部分出于理想主义,部分出于市场竞争的需要——作为一家小公司,闭源和OpenAI正面竞争没有胜算,开源反而能快速建立生态。2023年的Llama 2,是这场转变的正章。
它把开源模型从小公司的逆袭工具升级为大公司之间的制衡武器。Meta的开源不是为了对抗商业逻辑,而是为了在商业逻辑中占据更有利的位置。到了2024年,这场转变的影响已经清晰可见。开源模型生态形成了两层结构:上层是少数几个有能力训练基础模型的巨头——Meta、谷歌、微软、阿里巴巴;下层是成千上万家使用、微调和部署这些模型的开发者和企业。上层提供原材料,下层进行加工制造。这听起来像是一个健康的产业分工。但问题是,上层的巨头之间并不是中立的原材料供应商。
他们有自己的核心业务,有自己的竞争对手,有自己的战略目标。他们开源模型的决定,不是出于对知识共享的信仰,而是出于对自身商业利益的精密计算。当Meta开源Llama 3的时候,它会在许可协议里加入什么新的条款?当谷歌开源Gemma的时候,它会不会在某些关键能力上有所保留?当微软发布Phi系列的时候,它会不会把最先进的版本留在Azure的付费墙后面?
这些问题的答案,将决定开源模型层的未来走向。而社区——那些真正相信开源精神的开发者——在这些决策中几乎没有发言权。他们可以自由使用模型,可以提交代码贡献,可以在论坛上讨论改进方案。
但决定下一版模型是否开源、以什么条件开源、在什么时间节点开源的权力,始终握在巨头手里。公共图书馆的大门确实敞开着。但图书馆的建造者、维护规则和新书上架的决定权,不在普通读者手中。