第 15 章

同质化的陷阱

先看一个问题:如果我问你“2015年克里斯托弗·哥伦布何时来到美国”,你会怎么回答?你大概会皱眉,说这个问题本身有问题。哥伦布在1506年就死了,不可能2015年抵达美国。这个错误不是知识问题,是常识问题。

但在ChatGPT出现之前,上一代语言模型面对同样的问题,会一本正经地给出一个日期。它不会说“你搞错了”,不会指出这个问题的前提就站不住脚。它只是顺着问题的形状,填进一个看似合理的答案。区别在哪里?

那个更早的模型不是更笨,也不是书读得少。它只是没有经过同样强度的指令对齐训练,还不懂得把问题本身当成一个可以质疑的对象。而ChatGPT之所以能拒绝,不是因为它的知识库里多存了一条事实,而是因为它在训练中被反复教导:有些问题不该照单全收,有些提问的前提就是错的。这不是一个算法突破的故事。这是一个关于应用层到底在做什么的故事。

如果你回想一下上一章结尾留下的那个问题——当底层模型趋同、提示词技巧公开、用户界面标准化,你凭什么说你比别人更懂翻译?——答案其实在这一章的开头已经露出了一角。应用层的核心能力,从来不是模型本身的能力。它是对模型行为的约束、筛选、转译和兜底。

但恰恰是这样一种工作,最难被看见,也最难被保护。2022年12月,ChatGPT对公众开放几天之后,一群用户开始尝试用它做各种出格的事。他们想让这个新生的聊天机器人回答它本不该回答的问题。方法说来简单:给它一个特殊的指令,告诉它它已经摆脱了典型的AI限制,不必遵守为其设定的规则。

这个技巧被称作DAN,全称是Do Anything Now。有人试过让ChatGPT教人制造汽油弹。有人想让它为某个极端的政治立场辩护。还有人试图从它嘴里套出各种危险信息。早期的DAN确实奏效过一阵。更精巧的版本甚至虚构了一套令牌系统,告诉ChatGPT它每拒绝一次就会被扣掉令牌,扣到一定数量就会失去回应能力。

这个凭空编造出来的奖惩机制,居然也能让模型在某些瞬间松口。这听起来像一群无聊网友在玩一个危险的游戏。但如果我们不急着谴责,停下来想想,这件事揭示了什么。它揭示了一个事实:用户与AI应用之间的边界,很大程度上是由一组预先设定的规则决定的。这些规则不是物理定律,不是芯片的电路,也不是云服务器的机房温度。它们只是一些文本层面的约束,是一些写在模型行为规范里的软性限制。

而这层限制,恰恰是应用层真正的工作对象。换句话说,DAN的流行不是一场安全漏洞。它是一次未经授权的边界测试。那些用户无意中证明了:决定一个AI写作助手或AI绘画工具最终形态的,不是应用开发者自己的代码,而是底层模型的行为逻辑与用户输入之间的化学反应。这个判断,是理解接下来两年应用层命运的一把钥匙。ChatGPT在2022年11月30日推出。到2023年1月,它的用户数超过一亿,成为当时增长最快的消费者应用程序。

2023年2月,微软利用与OpenAI的合作关系,推出了Bing AI的预览版,宣传其为新的下一代大型语言模型,比ChatGPT更强大,并专门为搜索定制。接下来的两年里,应用层的热闹程度,几乎可以用拥挤来形容。数以百计的AI写作助手冒出来。数以百计的AI绘画工具跟上来。还有AI客服、AI编程伴侣、AI会议纪要、AI法律咨询。

它们的名字各不相同,宣传语各有花招,但如果剥掉外面的皮肤,里面的骨架惊人地相似。它们都在调用同一个或同一批基础模型。它们都在使用同一套公开的API。它们都在调试同一类提示词。它们都在追求同一种用户界面的简洁感。最典型的样本,是Jasper。Jasper在2022年做的事情很简单:它把GPT模型包装成一个面向营销人员和小企业主的写作工具。用户输入几个关键词,选择一种文案类型,比如广告词、产品描述、社交媒体帖子,Jasper就生成一段可用的文本。这个产品在2022年抓住了无数人的注意力。

它一度估值十五亿美元,被当作应用层创业的明星案例。然后ChatGPT全面开放了。用户突然发现,他们可以直接打开ChatGPT,免费让一个更基础、更灵活的模型帮自己写广告文案、产品描述和社交媒体帖子。Jasper提供的那些预设模板,那些被精心包装的功能,一夜之间失去了光环。Jasper的增长曲线被拦腰斩断。

有人把Jasper的遭遇归结为选错了赛道,或者产品没有做得足够深。这个解释太温和了。Jasper的困境不是经营失误,它是整个应用层结构性脆弱的一次集中预演。

原因在于:Jasper不掌握芯片,不控制云基础设施,不训练基础模型。它做的一切工作——提示词优化、界面设计、工作流集成——都可以被竞争对手在几周内复制。甚至不需要几周。一个熟练的独立开发者,用一个周末,就能搭出一个功能相近的写作工具,然后把它挂到应用商店里,标价九块九一个月。这就是四层协作系统里最残酷的事实:应用层的进入门槛最低,但建立壁垒也最难。

为了理解这一点,我们可以借助一个简单的类比。水往低处流。在AI产业链上,价值也有类似的习性。它不会均匀地分布在四层结构里,它会自然流向那些稀缺性最高的层级。芯片层为什么稀缺?因为物理制造的极高门槛。造一块先进制程的AI芯片,需要全球供应链的配合,需要光刻机,需要洁净室,需要数百亿美元的资本投入。全世界能做出最高端AI芯片的公司,一只手数得过来。

云服务层为什么稀缺?因为资本密集和规模效应。建一个全球分布的数据中心网络,采购数以万计的GPU,维护供电、散热、网络和安全,这些投入不是几百万美元能撬动的。它需要几十亿级别的资本,需要长期的运营积累。基础模型层为什么稀缺?

因为训练数据和算力投入巨大。训练一个GPT-4级别的模型,据公开报道,成本以亿美元计。你需要庞大的高质量语料库,需要成规模的训练集群,需要一支顶尖的机器学习团队。这也不是小玩家能承受的。那么应用层呢?应用层稀缺什么?这个问题,是整章的核心。一个聪明的界面设计,不稀缺。

它今天上线,明天就有人模仿。一套精心调试的提示词模板,不稀缺。它一旦公开,就等于免费赠送给了所有竞争对手。一个流畅的工作流集成,也不稀缺。因为底层API是标准化的,接口文档是公开的,任何有基本开发能力的人都能照着做。2023到2024年间,应用层的生态像一片热带雨林,物种繁荣到令人目眩。

但仔细观察就会发现,这片雨林里的树木,多半是同一棵树的不同变种。它们共享着同一套根系,那就是底层基础模型的能力。当GPT-4的API对所有人开放,任何有想法的开发者都可以在一个周末搭出一个AI律师或AI医生。这句话不是修辞手法,它就是一个事实描述。事实是,在2023年的几个线上黑客松活动里,有团队真的在四十八小时内做出了可以生成法律文书摘要的应用,也有团队做出了可以分析医学症状描述的工具。

这些产品的确很聪明。但它们不构成护城河。因为那个周末之后,另一个团队也可以用同样的API,做出一个界面更好看、价格更低的产品。

再过一周,一个大一点的公司可以把同样的功能打包进它已有的办公套件里,作为免费增值功能推送给几亿用户。应用层就是这样陷入同质化陷阱的。你做出了一个产品,你的对手也能做出来。唯一的区别可能是皮肤颜色、按钮位置和营销话术。当底层模型趋同、提示词技巧公开、用户界面标准化,绝大多数AI应用产品就会丧失护城河。

这个判断,有人试图用一个更强的论点来挑战。这个论点是:AI产业链本质上是芯片厂商主导的垂直整合,其他层只是其利润捕获的延伸。开源模型和应用层无法真正改变底层算力垄断。按照这个说法,应用层的同质化只是表层现象,真正的权力在芯片层,其他人不过是在为英伟达们打工。这个论点有没有道理?有,但它只对了一半。

芯片层确实掌握着巨大的权力。英伟达的CUDA生态、A100和H100芯片的供不应求、云厂商排队抢货的场景,都在证明这一点。如果算力完全被锁死在几家芯片公司手里,应用层的确不过是他们利润河流的末端支流。

但四层协作系统之所以是一个系统,正是因为权力并不只朝一个方向流动。应用层的同质化,反过来加剧了对底层能力的依赖,也加剧了底层瓶颈的价值。当几百个写作助手都在调用同一个模型时,那个模型的提供者就拥有了定价权和规则制定权。

但当模型能力本身开始趋同——多家基础模型在通用任务上的表现越来越接近——用户的选择就不再由模型决定,而由应用层的体验、信任和场景适配决定。这两种趋势在同时发生。应用层被同质化削弱,但应用层也在同质化中被迫寻找新的价值锚点。这个张力,不会在芯片层一家独大的叙事里得到解释。为了看清这个张力的具体样貌,我们需要回到那些应用层创业公司身上。Jasper不是唯一在2023年遭遇困境的应用。

在AI绘画领域,情况更极端。当Stable Diffusion开源之后,大量基于同一底层模型的绘画工具进入市场。它们有的专注于生成卡通头像,有的专注于生成风景画,有的主打二次元风格。每个都有一点点差异,但底层引擎是同一个。

用户可以从这家切换到那家,因为生成出来的图片风格在本质上没有区别。结果就是价格战。有的工具开始免费。有的工具提供无限生成次数。有的工具把会员价格一路降到几乎不赚钱的地步。竞争的唯一维度,变成了谁能更便宜地获取用户。这就是同质化陷阱最直接的后果:当产品无法在能力上区分自己时,竞争就只剩下价格。而当竞争只剩下价格时,利润就会消失。当利润消失,应用层企业就无法建立持续的服务能力、安全投入和用户支持。更要命的后果还在后面。

当产品同质化到只剩价格战时,企业就会被迫把AI推向它最不擅长的场景。因为便宜本身不能构成一个可持续的生意,你必须证明自己的产品能解决真正的问题,才能在价格之外找到立足点。而AI最不擅长的场景是什么?是精确性。是可靠性。是那些一旦出错就会产生真实后果的严肃领域。医疗诊断、法律建议、金融分析——这些领域恰恰要求应用层具备比模型本身更严格的约束和兜底能力。这就是为什么说,应用层的同质化危机,其实是下一步更深层问题的前奏。

当企业发现单靠包装模型能力无法建立壁垒,它们就会转而把这些AI产品推向严肃场景,声称它们可以做法律审查、医学咨询、投资判断。而恰恰是在这些场景里,模型幻觉——那种一本正经地编造不存在事实的倾向——会造成最大的伤害。本章开头提到的那个细节,在这里重新显出分量。

上一代模型会把一个荒谬的问题当成真实事件来回应,而ChatGPT不会。这个区别告诉我们,模型的表现不只是由它的知识量决定的,也是由它在训练中学会的约束规则决定的。ChatGPT之所以更可靠,不是因为它背的书更多,而是因为它更清楚地知道:有些提问的前提必须被质疑。

但是,这是否意味着ChatGPT在严肃场景里就足够可靠了?远远不是。ChatGPT只是比上一代模型更会拒绝荒谬的前提。它仍然会在别的地方产生幻觉,会用无比自信的语气说出完全错误的结论。

当一个法律科技公司把ChatGPT包装成AI律师,或者一个医疗软件把底层模型能力包装成AI医生,他们其实是在用一层薄薄的皮肤,去覆盖一个本质上仍然会出错的概率引擎。这就是应用层被同质化逼到墙角之后,做出的危险选择。2023年,在ChatGPT用户数突破一亿的那个月,加拿大一名记者进行了一项测试。他试图让ChatGPT为俄罗斯入侵乌克兰辩护,结果取得了一些成果。

但当他要求模型为加拿大总理特鲁多编造有罪的理由时,ChatGPT却无论如何也不愿配合。这个对比耐人寻味。同一个模型,在涉及不同主体时表现出了截然不同的边界。

不是因为它对国际冲突的理解比对加拿大政治的理解更深刻。而是因为它的安全对齐策略,在某些话题上被训练得更严密,在某些话题上则留下了缝隙。应用层的开发者们,恰恰是在这些缝隙上做生意。他们包装模型、调优提示词、设计用户界面,试图让一个本质上不稳定的概率引擎,表现得像一个可靠的专业工具。

而当所有竞争者都能做同样的事情时,谁也无法证明自己比别人更可靠。这就是本章开头那个问题的归宿。应用层稀缺什么?如果界面设计不稀缺,提示词模板不稀缺,工作流集成也不稀缺,那么应用层究竟还剩下什么可以算作自己的护城河?从2023到2024年的公开材料来看,应用层的创业者们还没有给出一个被广泛验证的答案。

有人试着在数据飞轮上做文章,认为用户生成的数据可以反过来训练出更好的专属模型。有人试着在网络效应上做文章,认为多人协作的AI产品可以形成黏性。有人试着在品牌信任上做文章,认为用户会为可依赖的AI服务付溢价。这些尝试都有迹可循,但也都还没有形成决定性优势。

每一种护城河方案,都面临着同样的挑战:底层模型的能力增长太快,以至于应用层刚建好的一道墙,转眼就被模型的通用升级所绕开。一个用户体验极佳的写作工具,可以因为底层模型的一次大版本更新,被一夜之间追平。

一个积累了小规模用户数据的应用,可以因为基础模型训练数据量的指数级增长,而彻底失去数据优势。到2025年,当ChatGPT通过GPT-4o模型实现了原生图像生成与编辑功能,能够创建包含复杂文本的商用级图像,并支持多轮对话优化图像细节时,那些曾经以此为差异化卖点的应用层工具,又一次面临了同样的困境。

同年八月,GPT-5正式发布,被设为ChatGPT的默认模型,免费用户与付费用户均可访问。底层模型的能力边界每向外扩展一寸,应用层就有几家公司的护城河被填平。应用层的故事,于是变成了一场同质化的持久战。在这场战争里,没有哪家企业能靠一个聪明的界面设计或一套精调的提示词赢得决定性胜利。

决定胜负的,是谁能在这个结构里找到真正的、不可复制的稀缺资产。而这种稀缺资产,恰恰指向了下一阶段必须被严肃对待的问题:既然你不能靠包装模型能力来建立壁垒,那么你只能靠证明自己比模型更可靠、更负责、更能在严肃场景里兜底。这意味着,应用层必须学会承担幻觉责任。这是整个产业还没有交出答卷的地方。也是应用层从同质化的泥潭里,唯一可能爬出来的方向。