第 4 章
以Meta开源LLaMA系列模型为叙事主线
先在脑海中忘掉“开源”这个词,只看一个下载按钮。那个论坛以匿名、混乱和垃圾帖闻名。一个不起眼的帖子发出来,正文里没有解释,没有截图,只有一个链接和几行参数。链接指向一个不小的文件,打开来既不是电影,也不是游戏包,而是一组纯粹的数字。发帖者没有多说什么,下载的人却似乎瞬间明白了那是什么。
这件事发生在聊天生成预训练变换模型(ChatGPT)引爆世界之后两个多月。2023年2月,距离开放人工智能(OpenAI)在2022年11月30日推出ChatGPT已经过去十周。就在几周前,也就是2023年1月,这家公司宣布用户数突破一亿,创下消费级应用程序的增长纪录。全世界正被一种新的技术情绪包裹,有人兴奋,有人警惕,有人急匆匆地寻找船票。
而在那个匿名帖子悄然流传的同一时期,更主流的世界里忙于另外几件事:微软在2023年2月7日推出必应人工智能预览版,宣称它使用的模型比ChatGPT更强;谷歌在当月也发布了自己的对话服务巴德(Bard)。
大的科技公司正排着队把聊天机器人塞进搜索框、办公套件和云后台。真正令人在意的,并非那些发布会的闪光灯,而是一个阴暗角落的下载进度条。
要理解那个文件为什么有分量,得先退回一步,看看此前开发者的处境。ChatGPT爆火后,人们很快发现,它不仅仅会聊天。它能起草邮件、解释概念、写程序和做摘要。于是,大量开发者、创业公司和研究者开始问同一个问题:我能不能直接拿到那个模型?
答案非常简单:不能。不是技术上不能,而是制度上不能。模型权重被锁在开放人工智能的服务器里。你能做的,是向它发送请求,接收结果,然后按使用量付费。这种模式与云服务一脉相承:模型被包装成一种远端的中央空调,用户享受冷气,却摸不到压缩机。
于是,开发者的命运被一根无形的绳子拴住。如果上游涨价,你只能接受。如果接口政策改变,你只能适应。如果服务突然中断,你的产品就停摆。
这种无力感,正是上一章所说的“算力税”的延伸:模型公司训练模型,云厂商提供运行环境,两者联手在开发者门口设置收费站。偏偏在这时,那个匿名帖子出现了。文件里装的,是LLaMA-7B的模型权重。
这里先拆掉一个术语。权重是什么?可以把一个训练好的模型想象成一个刚刚完成住院医师训练的年轻医生。他读过大量的病历,通过无数次考试,已经掌握了诊断的直觉。训练结束后,他脑子里那些已经内化的知识、经验和判断方式,会以某种稳定的连接强度保存在神经网络中。大型语言模型也一样。它在海量文本上训练完毕后,那些学到的语言规律和知识线索,被压缩成一组巨大的数字集合,每一个数字代表某个连接或特征的强弱。这组数字,就是权重。
权重有一个反直觉的特点:一旦训练完成,它就不再依赖那套昂贵的训练硬件。训练一个大型语言模型,需要成千上万张高性能显卡连续运转数周甚至数月。这笔开销以百万、千万美元计。但训练结束后的权重,只是一堆数字。它可以被拷贝、压缩、上传、下载。
就像一本医学教材,编写时需要大量专家和实验,但印刷出来的书可以便宜地寄往任何地方。印刷厂可能关门,书还在。把这句话说破:模型是知识,权重是知识载体,训练它的算力是印刷厂。
在2023年之前,知识载体的流通几乎完全被模型公司和云厂商联合掌控。你拿不到书,只能租用朗读服务,按分钟付费。LLaMA的出现,让一本原计划只放在玻璃柜里的书,突然有了手抄本。
Meta公司在2023年2月对外发布LLaMA系列模型。初衷并不激进。它希望向学术研究人员提供一套性能接近前沿、但更加高效的模型,用于开放科学。根据当时的安排,申请者需要提供机构邮箱,承诺不用于商业目的,并等待审核。审核通过后,才能获得权重文件。这套流程听起来合理,但它建立在一个前提出上:模型像图书馆的珍本,借阅必须登记,馆员有权拒绝。
可数字文件的真实性质,让这扇玻璃门变得极其脆弱。只要有一个获得许文件的人把它放到网上,控制就解体了。
匿名帖子里的链接,等于让那本珍本突然出现在街角复印店的公共电脑里。事情的发展速度超出了所有官方的预期。开发者拿到文件,很快发现,这个模型的体积不大,能力却不弱。它无法在每一个指标上都击败闭源巨兽,但在许多日常语言任务上,表现已经接近GPT-3.5的水平。更重要的是,它足够“轻”。
这一点意义深远。大型语言模型的世界里,参数规模并不直接等于能力,但它直接决定运行门槛。一个参数规模较小的模型,可以在普通电脑上加载,在一块中档显卡上完成推理。所谓推理,就是让训练好的模型干活:输入一段文字,输出一段新文字。过去,推理发生在云端机房里。现在,它发生在开发者自己的桌子下面。
这个变化如果只从技术角度理解,就太小了。它真正的产业后果是:当一个模型可以在本地运行时,开发者不再需要把每一句话都发送给某个云端的接口。计次收费的账本停止转动。下载依然需要网络,运行仍然需要算力。但模型本身,从黑箱变成了文件。从服务变成了物品。
一个人可以掌握物品,却无法掌握一项由别人定义的服务。随后发生的,是一场全球范围的数字作坊运动。开源模型托管平台拥抱脸(Hugging Face)成了这场运动的主要工坊。这里原本就是研究者分享数据集和模型的中转站。LLaMA文件泄露后,衍生模型像湿热的天气里的菌落一样增殖。有人把模型微调成对话助手,有人把它压缩到更小的体积,有人让它在手机上运行,有人给它接上代码编辑器。
需要解释一下“微调”。预训练模型像一个通才:它会读写、会推理、会聊天。但它不一定熟悉某一家医院的病历格式,也不一定懂得某类法律文书的固定句式。于是,开发者用少量特定领域的数据,在原有模型基础上再训练一小段时间,让它对某个任务更熟练。这个过程就叫微调。打个比方:预训练模型是完成通识教育的大学毕业生,微调则是入职后的岗前培训。时间短,成本低,但方向明确。
在闭源体系下,微调的门槛极高。你拿到的是接口返回的结果,不是模型本身。你可以住酒店,却不能重新装修。
在开源体系下,你不仅能住进去,还能打墙、换管道、改窗户。当几百个、几千个这样的衍生模型开始同时出现时,一个原本看不见的权力结构开始松动。过去,谁控制模型,谁就控制调用模型的通道。现在,模型像一种可自由改装的机器,散落到数万个不共享工牌的人手里。这些人不构成公司,没有正式组织,也没有统一的质量标准。他们依靠同一个底座模型、几个共享工具和一种近乎游戏的心态,把AI能力从云端的高塔里搬了下来。
这种组织方式,在软件历史上并不陌生。1990年代初,一个芬兰学生在一个技术邮件列表上发布了一条简短消息,说自己在写一个“业余爱好”的操作系统内核。那个内核后来被称作Linux,被数万名程序员共同完善,最终成为服务器世界的主流选项。再往前,1998年,网景公司把自己的浏览器源代码公开。那是一个商业公司主动把核心资产交给社区的历史性时刻。它传递出一个清晰信号:源代码的开放,不必然是乌托邦的空想,而是一条可操作的道路。
LLaMA的泄露与这些事件有一个重大区别:它不是公司主动开源,而是意外泄露。但它激发的协作逻辑,却和Linux、网景的方向惊人地相似。
开源运动的本质,从来不只是一种道德态度。它是一种生产组织方式。传统软件公司靠秘密源代码、封闭组织、专利诉讼和商业渠道来维持统治。开源社区靠公开代码、分布式贡献、社区规范和声誉机制来组织生产。当这种组织方式被移植到AI模型上时,它改变的首先不是技术,而是议价能力。议价权这个词听起来有点干,但落到具体处境里非常实在。
假设有一个小型创业公司,想在2023年初开发一款辅助医生整理病历的人工智能工具。在闭源格局下,它的路径很窄:调用某个大模型的接口,按处理的字符数付费。如果上游涨价,它只能接受;如果接口条款变化,它只能适应;如果平台暂停服务,它的产品就瘫痪。更麻烦的是,它无法拿到模型本身,因此无法对模型进行任何深度定制。产品差异化的空间被压得很薄。
LLaMA泄露之后,这家公司多了一个选项:下载模型权重,在自己的服务器上运行,或者租用任何一家便宜得多的图形处理器云。模型不再由上游公司独家控制,而是由开发团队自己掌握。它可以根据自己的语料微调,可以打包到离线设备,可以给客户部署到内网。
这意味着,模型层和算力层之间的那根捆绑绳,被剪断了一根。过去,想调用模型,往往必须同时购买模型的访问权和算力的运行权。两者捆绑销售,开发者没有拆分能力。现在,开发者可以先获得模型,再自由选择运行地点:自己的电脑,朋友的服务器,便宜的云平台,甚至一台二手显卡拼成的机器。选择的自由,就是议价权的核心。
这个论点必须经受一次严肃的反驳。有人会说:开源模型虽然免费,但计算资源仍然稀缺。云厂商依然控制着图形处理器的供应和租用价格。就算模型不要钱,算力还是要钱。开源模型用不了高端算力,最后还是要回到云平台。所以,算力垄断没有被打破,只是换了一件外套。这个反驳有相当大的事实分量。
开源模型依赖底层算力,这是任何人都无法否认的。即使一个小型模型可以在一张中档消费显卡上运行,更大的模型、更快的响应、更复杂的微调任务,仍然需要专业级硬件甚至集群。如果云厂商提高图形处理器租用价格,开源模型的持有者依然要付这笔钱。所以,不能说开源模型彻底推翻了算力垄断。
它的作用不是消除垄断,而是移动了战斗的位置。在闭源格局下,云厂商和模型公司联手在模型层征税。开发者面对的不是一个垄断者,而是两个绑定在一起的垄断者。你付的钱,一杯是模型使用费,另一杯是算力租金;有时账单上甚至分不清哪笔钱属于谁。
开源模型把模型层拆了下来。即使算力层仍然被少数芯片公司和云厂商控制,开发者至少可以不再依赖某一家的模型。模型公司不能再单独决定谁有资格使用模型;云厂商也不再能强制捆绑某个模型。
这样一来,算力税没有消失,但它的征收方式发生了变化:过去它依附在模型上,现在它回到了计算本身。这是一种更纯粹、也更难绕开的稀缺。但至少,斗争的地形变了。
这在产业链上产生了一个微妙的效果。权力从“模型+算力”的捆绑中松动,向纯粹的算力集中。如果算力成为唯一真正的瓶颈,算力提供者反而要面对更直接的竞争——因为模型不再是绑定条件,用户可以自由跑到价格更低、速度更快的算力供应方那里去。
于是,OpenAI的商业模式所代表的旧合同第一次出现了一道看得见的裂缝。不过,不能走到另一个极端。开源并非乌托邦。它只是把问题推到了更靠后的地方,而且某些问题变得更加棘手。
首先是安全滥用。当模型权重可以被自由下载和修改时,接口层面设置的安全过滤机制就失效了。任何人都可能改写模型的防护层,制造一个没有伦理限制的版本。这在社区中并非完全理论上的担忧。一旦模型进入公共领域,你无法只让好人使用,同时阻止坏人拿它做坏事。
其次是商业可持续性。训练大型模型极其昂贵,谁来持续为开源模型买单?Meta有广告收入可以做战略性投入,但小公司和个人无法支撑长期训练。
如果只看官方发布页上的参数表,7B、13B这些数字其实并不起眼。它们指的是模型内部参数的规模,单位为“十亿”。真正让这次泄露变得不一样的,是这些参数背后的文件大小。LLaMA-7B的权重文件在完整精度下不过13GB左右,13B版本约26GB。放在2023年的一台中档游戏电脑上,只相当于一部高清电影的占用空间。经过社区随后的量化处理,7B模型甚至能被压到4GB上下,塞进一台没有昂贵图形卡的老旧笔记本。
这意味着,训练所需算力与部署所需算力之间,存在一道极宽的鸿沟。前者的成本足以把普通人挡在门外,后者的成本却低到几乎可以忽略。过去,模型公司把这道鸿沟藏了起来,让用户以为只要使用AI,就必须同时负担训练和运行的双重成本。泄露事件则把这层包装剥开了:最昂贵的部分已经发生在过去,而你此刻需要的,可能只是一块足够放下一组数字的硬盘。
这种“轻”,也改变了模型传播的速度。在Hugging Face上,原本以研究模型身份出现的LLaMA,很快被拆解、改名、重新上传。衍生模型数量不是缓慢爬升,而是以一种接近复利的曲线增长。头几天出现的变体大多只是把原始权重重新打包,加上更简明的说明;接着,人们开始用少量指令数据微调出对话型版本;再往后,社区里出现了针对中文、代码、医学文本等特定用途的版本。它们大多没有经过严格评估,有的甚至只是个人尝鲜的产物。但从产业链角度看,这种参差恰恰说明了一件事:模型不再是一条只有少数公司能通行的窄路,而是一片每个人都能进入、也都要自己负责的公共工地。
这种局面的历史参照,不只是Linux。1990年代末,网景把Navigator浏览器的源代码公开后,短时间内也出现了大量衍生版本。多数派生浏览器后来消失了,但代码本身并没有浪费。
它被吸收、被重组,最终成为Mozilla项目新的地基。开源世界从不承诺每一个分支都成功,它只承诺失败不会以封闭的方式结束。模型权重泄露后的社区演化,遵循的是同一套逻辑:部分衍生模型无人问津,部分被合并,少数存活下来并成为后续工作的起点。关键是,这些活动不再需要经过任何单一机构的批准。许可争议在这里变得非常具体。Meta最初随LLaMA发布的条款明确拒绝商业使用,并要求研究机构申请获得授权。
但泄露发生后,这些限制在实践上已经难以执行。一个已经躺在公共网络里的文件,不会因为你补发一页声明就重新回到玻璃柜中。围绕许可的争执延续了很长时间,但它没有改变事实层面的传播。社区行动与其说是对条款的公开反抗,不如说是沿着数字信息惯常的路径绕了过去。
拥抱脸这样的平台靠商业客户和企业服务维持运营,这笔钱是否足够支撑整个开源生态,没有人能给出肯定答案。记录只到这些平台仍在运转,仍在更新,但持续稳定盈利的答案尚未出现。
再次是碎片化。社区里衍生版本数量庞大,彼此之间互不兼容,质量参差不齐。一个开发者可能花一晚上下载五个模型,最后发现没有一个能在自己的数据上稳定运行。选择多了,决策成本反而上升。这些风险都是真实的,不能用一句“开放必胜”来搪塞。
但回到2023年2月那个时刻,当下载链接在匿名论坛上悄悄流传时,一个更深层的逻辑已经启动了。数字信息天然趋向于自由流动。它可以被延迟,可以被阻碍,可以被打上各种许可标记,但一旦它以纯数字形式存在,它的复制成本就无限接近于零。
这个世界里,试图用物理围墙的逻辑去管理智力成果,从来都极其艰难。音乐、电影、软件、书籍都曾经历过这样的拉扯。模型权重不过是这条漫长名单上的新成员。由此也可以回到那个问题:开源模型真正的意义是什么?
它不是为了免费,而是为了选项。它给那些被排除在闭源体系之外的人一个进入的机会。它把调用AI能力的成本,从一笔持续不断的税,变成了一次性的获取加上按需的算力支出。它没有消灭算力稀缺,却终结了一种特定的捆绑:模型与云端服务的不可分割。当模型变得唾手可得,另一个问题自然浮了出来。那是一个普通的工作日深夜。某个独立开发者的房间里,一台不算新的台式机发出低沉的散热声。
屏幕上没有华丽的界面,只有深色背景的命令行窗口。他敲下一段文字,几秒后,模型返回了一段流利通顺的回复。这台电脑没有连接任何外部接口,没有被收取任何计次费用。模型就静静地躺在本地硬盘里,像一个可以随手翻阅、也可以任意修改的文件。这个画面一点也不浪漫。没有颁奖,没有发布会的追光。
但就在这间再普通不过的房间里,AI能力第一次变得像一台自己可以修理的机器,而不是远处只能仰望的城堡。当图纸和参数已经公开,稀缺的就不再是能否造出车,而是能否把车开进那些从来没人去过的路上。