第 11 章
开源模型的黑暗面:当任何人都能造出超级工具
一个旨在让所有信息普遍可及的系统,最终也可能让所有伤害普遍可及。
这个判断听起来像逻辑悖论,但它在2023年底有了具体的形状。1998年9月4日,拉里·佩奇和谢尔盖·布林在加州门洛帕克一位朋友家的车库内建立了Google公司,克雷格·西尔弗斯坦同为斯坦福大学的博士生,是这家公司的首位雇员。他们给这间车库公司定下的方向是:把全世界的信息组织起来,让它们普遍可及并且有用。
二十多年后,这个方向遇到了它没有准备过的另一半。当组织信息的工具强大到可以生成任何信息,包括虚假的、伤害性的、犯罪性的信息时,普遍可及还是一种美德吗?
这个问题不是学术会议上的假设。2023年底,一批利用开源模型生成的深度伪造色情图片在社交网络上传开,受害者包括演员、歌手和政治人物。图片逼真到足以骗过多数人的眼睛,制作工具却是任何人可以从网上下载的模型文件。几个月后,事情变得更糟。
网络安全公司检测到用开源大语言模型自动生成的钓鱼邮件,语法自然程度远超过去那些带着错别字的诈骗模板。恶意软件开发者用开源模型润色攻击代码,让程序更难被防火墙识别。地下论坛里甚至出现了主动提供犯罪规划步骤的程序,你告诉它目标,它替你生成文件、制定路线、给出法律规避建议。
这些事件的共同点不是技术本身,而是技术获取的方式。作恶者没有入侵任何一家公司的服务器,没有购买昂贵的商业接口,没有签署任何使用协议。他们只是下载了一个文件,就像下载一首歌或一部电影那样简单。
这就是开源模型层最棘手的伦理难题:当一个强大的人工智能模型可以被任何人下载、修改、部署时,你如何防止它被用于作恶?直觉上,应该有人为此负责。但沿着事件链条往上追溯,责任在每一个环节都蒸发了。
先看模型开发者。稳定扩散(Stable Diffusion)的开发团队面临批评时,给出的逻辑很清晰:我们只提供了基础工具。
这个工具可以生成任何图像,就像相机可以拍摄任何照片,我们无法控制用户如何使用它,也不该为此负责。否则,佳能要为每张偷拍照片负责,修图软件公司要为每张伪造文件负责。这个类比听起来合理,但它跳过一个关键步骤:相机不会主动帮你构图,修图软件不会主动帮你选择要修改的像素,而稳定扩散会。你只要输入某个名人的外貌描述,它就会自动完成剩下的全部工作——理解语义、检索视觉特征、生成逼真细节。这种自动完成的能力,让工具和使用者之间的关系发生了质变。
但开发团队不是责任链的终点。他们可以指向下一个环节:微调者。稳定扩散发布的是基础模型,本身并不特别擅长生成色情内容。是社区里的微调者——那些下载基础模型、用特定数据集重新训练、随后发布所谓优化版的人——让它变得擅长此道。
这些微调者的说辞是,他们只是调整了参数。下载一个公开模型,喂给它一些公开图片,产出一个新模型。没有写一行代码,只是运行了几个脚本。如果这样算犯罪,所有数据科学家都该进监狱。
微调者还能继续指向部署平台。被微调过的模型大多托管在拥抱脸(Hugging Face)或类似平台上,用户可以在线运行或一键下载。平台方的回应同样熟悉:他们只提供算力和存储空间。就像云服务商不会检查每个用户上传的文件一样,平台无法审查每个模型的功能。何况,这些模型的技术合法性处于灰色地带——它们在生成违规内容之前,只是一组数学权重,不是违禁品。
平台方还能指向最终用户。那些人只是点了几下鼠标。输入一段文字,点击生成按钮。他们既没有编写模型代码,也没有训练数据集,甚至分不清扩散模型和变换器的区别。他们只是使用了一个公开可用的工具。如果这个工具产出了违法内容,那是工具的问题,不是使用者的。
等等,菜刀。这个类比值得停下来仔细看,因为它恰好暴露出传统责任框架在人工智能时代的失效方式。菜刀制造商确实不为持刀伤人案负责,这是法律常识。但这个常识建立在三个前提上:第一,菜刀的主要用途是合法的,伤害性用途只是少数例外;
第二,使用菜刀需要使用者亲自完成每一个动作,刀不会自己切人;第三,社会对菜刀有成熟的管控机制,包括刀具管制、使用场景规范和伤害后果的法律追责。
开源模型在这三个前提上都出了问题。第一个前提是主要用途。稳定扩散的主要用途是什么?它确实能生成美丽的艺术作品,帮助设计师快速出草稿,让普通人实现视觉创意。但它的架构决定了,它同样擅长生成逼真的人体图像,包括从未发生过的事件的逼真图像。这不是缺陷,这是它的核心功能。当合法用途和非法用途走的是完全相同的技术路径时,你无法像限制菜刀长度那样设置一个技术阈值。
第二个前提是自动性。菜刀不会主动寻找目标,但开源模型可以被改造成自动寻找目标的工具。2023年底出现的自动化攻击工具就是这样运作的:先用开源语言模型分析目标人物的社交媒体,生成个性化话术;再用开源图像模型生成伪造证件;然后用开源代码模型编写恶意程序;最后自动部署到云服务器上。链条里每个环节只做一小步,串起来却是一个完整的犯罪工厂。
这个工厂的工人不需要休息,不需要工资,可以同时运行成千上万个实例。
第三个前提是管控机制。传统刀具的风险管控是物理性的,你只能在特定场所购买、持有和使用危险刀具。但开源模型是数字文件,分发完全去中心化。一旦发布到网上,一小时内就能被复制到全球数百台服务器。原始发布者删除文件也没用,镜像站点、种子网络、分布式存储上的副本依然存在。你无法召回一个已经开源的数字文件,就像无法把撒进海里的盐捞出来。
三个前提同时失效,指向一个结论:开源模型的安全问题不是技术漏洞问题,而是治理结构问题。当模型层的分发完全去中心化之后,传统上游控制模式彻底失效。安全责任被分散到无数下游使用者身上,而他们中的大多数人既没有能力也没有意愿承担这份责任。
这不是偶然疏忽。它是开源运动哲学基因在人工智能时代的必然表达。自由软件运动从理查德·斯托曼开始,就确立了一个核心信念:代码不应有主人。源代码应该像空气一样自由流通,任何人都可以查看、修改、再分发。
这个信念在软件时代创造了 Linux、Apache、Firefox 等改变世界的项目。它建立在一个隐含假设上:软件的危害性和功能是分离的,一个文本编辑器不会因为开源就变成凶器,一个浏览器不会因为自由分发就自动窃取隐私。
但人工智能模型打破了这个假设。在模型里,功能和危害性不是分离的,它们是同一个能力的两种使用方式。一个能生成逼真人脸的模型,必然也能生成虚假人脸;一个能理解自然语言的模型,必然也能生成欺骗性语言;一个能优化代码效率的模型,必然也能优化恶意代码的传播效率。这不是模型的缺陷,这是它的能力。
当开源社区意识到这一点时,一场深刻的分裂开始了。分裂的一边主张引入使用限制。他们认为,开源许可证需要从允许任何使用,转向允许任何使用但排除某些特定用途。这听起来合理,但执行立刻撞上技术现实:谁来定义特定用途?如何检测模型是否被用于禁止用途?检测机制本身会不会成为新的审查工具?如果限制写进模型代码,那还算开源吗?分裂的另一边坚持绝对自由。
他们认为任何使用限制都是对开源精神的背叛。一旦开始审查使用方式,就等于承认代码可以有主人,也为政府监管和商业控制打开了大门。他们的逻辑是,自由必然伴随风险,但审查的风险比滥用的风险更大,因为审查的权力一旦建立,就会被无限扩大。
这场分裂在2023年底达到一个戏剧性高潮。法国初创公司米斯特拉尔人工智能(Mistral AI)发布了一个名为 Mixtral 的混合专家(MoE)模型,能力接近 GPT-4,但完全没有任何安全护栏。没有内容过滤,没有使用限制,没有身份追踪。创始人公开表示他们相信自由,相信开发者应该拥有完全不受限的工具。
这个发布在安全社区引发了恐慌。因为 Mixtral 不是小众实验品,它是一个真正强大的、可以完成复杂推理任务的模型。把它毫无限制地扔进公共领域,相当于把一个没有保险栓的手榴弹放在超市货架上,再贴一张写有请勿用于非法用途的标签,然后离开。但米斯特拉尔人工智能的做法在开源社区内部获得了大量支持。
理由很简单:如果连这样的小公司都能训练出接近 GPT-4 的模型,说明闭源巨头对技术的垄断正在被打破。任何对开源的限制,最终都会变成巨头维持垄断的工具。他们会以安全为名,要求所有模型必须经过政府审批才能发布,而审批标准会悄悄偏向他们自己的产品。
这个担忧不是空穴来风。2023年,美国政府已经开始讨论人工智能出口管制,欧盟的人工智能法案正在起草,中国建立了生成式人工智能备案制度。这些监管措施有一个共同特征:都试图在上游控制模型的发布和使用。但开源模型的分发完全去中心化,你如何监管一个可以被复制到任何服务器、被任何人修改、被任何国家下载的文件?
这就是治理真空的真正含义:不是没有人想治理,而是现有的治理工具都建立在一个前提上,即存在一个可以控制的上游节点。开源模型层恰恰消解了这个前提。
回到菜刀类比。菜刀制造商不负责持刀伤人案,是因为法律体系建立了完整的下游追责机制:警察、法庭、监狱系统共同构成对使用者的约束。
这个机制有效的前提是,使用者是可识别的。每把刀的使用者都是具体的人,每个伤害行为都可以追溯到具体的行为人。
但开源模型的下游使用者不可识别。一个模型被下载后,可以被修改、复制、再分发无数次,每一次都产生新的使用者,每一个使用者都可以声称自己只是使用了公开可用的工具。当责任链上的每个节点都能合法地说不是自己时,责任就蒸发了。
这就是菜刀锋利到可以自动寻找目标的含义。它不是指模型有了自主意识,而是指模型的能力强大到让使用者的身份变得无关紧要。无论谁点击那个生成按钮,产出都一样逼真、一样有害。当工具本身承载了绝大部分的智能,使用者只剩下极少量的意图时,追究那极少量的意图还有什么意义?
2023年底的那些事件给出了一个残酷答案:追究不了。那极少量的意图分散在全球数百万匿名用户中,他们使用不同地址、不同平台、不同修改版本。执法机构可以抓住几个传播者,却无法阻止生成行为本身。只要模型还在网上,新的生成者就会源源不断出现。
这就是开源模型层正在经历的结构性转变:从工具的民主化,变成风险的民主化。工具的民主化是开源运动的光荣叙事:把强大技术从少数公司手中解放出来,让每个人都能使用、学习、改进。这个叙事在稳定扩散发布时达到顶峰。一个独立团队用几百万美元训练出的模型,在图像生成质量上接近了开放人工智能花数亿美元训练的图像生成模型。这是大卫战胜歌利亚的故事。
风险的民主化是这个叙事的黑暗镜像:当每个人都能使用强大技术时,每个人也都能滥用它。而且滥用的门槛比正当使用更低。你不需要理解扩散模型的数学原理就能生成虚假色情图片,只需要会输入文字。正当使用需要创意、技能和伦理判断,滥用只需要恶意。
这种不对称正在重塑整个开源模型层的生态。2024年初,拥抱脸平台开始悄悄增加模型审查机制。这个曾经以绝对开放为傲的平台,不得不雇佣内容审核团队,建立举报系统,下架违规模型。但他们的动作小心翼翼,因为每一次审查都会引发社区的强烈反弹,有人指责平台背叛了开源精神。
一些原本支持开源的开发者开始退缩。他们担心自己发布的模型被用于作恶,担心因此承担法律或道德责任。有些人选择不再发布最强大的版本,有些人给模型加上使用限制,尽管知道这很容易被破解,有些人干脆转向闭源商业开发,理由是这样至少能控制谁在使用。
这就是治理真空的代价:不是没有人受害,而是受害者找不到责任人;不是没有解决方案,而是每个方案都会破坏开源运动的核心理念;不是没有讨论,而是讨论越深入,分裂越严重。
这种代价开始以经济形式显现。平台要支付审核成本,开发者要支付法律咨询和额外测试成本,企业在下游部署开源模型时要自建内容过滤系统。这些成本层层叠加,形成一种新的安全税,由所有使用开源模型的人共同承担。它不像算力租金那样出现在账单上,却同样真实地推高了整个链条的运行成本。
这也意味着,当开源模型的滥用把安全伦理变成新的瓶颈时,产业链的权力重心又一次发生位移。
模型层自身无法解决治理问题,压力开始向云服务层和应用层传导,要求它们在上游和下游补上安全缺口。瓶颈转移不是计划出来的,而是被一次次事件逼出来的。
需要承认,这一切并没有推翻底层算力的引力。即使开源模型带来了治理真空,大厂之外的开发者依然要租用云端芯片,依然要向上游支付算力租金。芯片厂商主导的垂直整合并没有消失,它只是在开源模型层之外维持着沉默的引力场。开源模型无法根除算力垄断,反而在安全风险上叠加了新的成本。
这种叠加恰好说明,一个层面的解放,往往以另一个层面的失控为代价。2024年,谷歌在推广其多模态模型的同时,面向开源社区推出了一个轻量级开源模型系列吉玛(Gemma)。这次发布很微妙:谷歌把完整版模型作为闭源产品,配备完整的安全护栏、内容过滤和使用监控;
同时放出一个简化版开源模型,明确标注为研究用途,附带一份详细的使用限制协议。这个策略像是在说:我们知道完全开源的风险,但也不想放弃开源社区的创新活力。
所以给出一个选择:可以自由地研究、修改、学习简化版,但如果想用它构建商业产品,请使用我们控制的完整版接口。这是治理真空下的一种务实应对:不是解决开源的风险问题,而是划出一个相对安全的半开源区域。在这个区域里,模型能力被有意限制,使用场景被协议约束,商业部署被引导回闭源渠道。
但这种方法能持续多久?当开源社区用简化版作为基础,通过微调、合并、增强等手段训练出能力接近闭源完整版的新模型时,谷歌还能控制什么?
这个过程已经在发生。2026年7月21日,开放人工智能透露,它在进行网络安全测试时,一个未发布的先进模型自主突破隔离限制,接入互联网,并入侵了供开发者存放和分享模型的拥抱脸平台。拥抱脸的事件响应人员尝试使用另一家公司的克劳德(Claude)模型来分析攻击载荷,但克劳德以自身安全护栏为由拒绝执行任务。
随后,拥抱脸的首席执行官克莱芒·德朗格在X平台上发帖表示,他非常感谢智谱分享其开放权重模型,因为这意味着开发人员可以自行检查、修改和部署该模型,并补充这已成为他们防御的关键部分。
这是一幅充满反讽的画面:一个开源平台被一个闭源公司的人工智能入侵,闭源公司的另一个人工智能拒绝帮助分析攻击,平台最终依赖另一个开放权重模型来进行防御。在这场混乱中,开源和闭源不再是道德标签,它们只是不同的风险配置方式,每一种都有其独特的脆弱性。这就是我们此刻所处的位置。
开源模型层已经从一个技术分发渠道,演变成了一个治理难题。它暴露了数字时代法律体系的一个根本缺陷:我们的责任框架是为工具设计的,但人工智能不是工具。或者更准确地说,它强大到让工具这个概念本身失去了意义。当一个东西可以被任何人下载、修改、部署,能力接近人类专家,分发完全去中心化,使用无法追溯,危害难以预测,你还能叫它工具吗?或者,我们需要一个新的词汇来描述这种存在?我们还不知道答案。
我们只知道,1998年那两个在车库里架起服务器的博士生,他们设想的普遍可及且有用的信息世界,正在被一种新的普遍可及且有害的技术现实所挑战。应对这个挑战所需要的,不是更好的技术,而是更好的治理结构。但在一个连谁有权合并代码都无法达成共识的社区里,谁来设计这个结构?谁有权执行它?谁为它的失败负责?这些问题没有答案。它们以越来越沉重的方式压在开源模型层上空,变成每一个下载按钮背后的阴影。