第 13 章
翻译的价值
大多数人对AI应用层有一个根深蒂固的判断:它是最不重要的一层。芯片层制造算力,云服务层调度算力,模型层训练算力,应用层似乎只是把训练好的模型拿过来,加一个界面,然后收钱。2023年之后,这种判断越来越流行,尤其是在11月17日那个周五下午之后,当四层协作系统各自为政的反应暴露出其深层脆弱性时,应用层的“简单包装”角色似乎更显得无足轻重。它背后的逻辑很直接:真正难的事情都在上游,下游只是把上游的能力包装一下。
这个逻辑有一个漏洞。它假设模型输出本身已经足够可靠,应用层只需做界面美化。但2023年1月24日,出版商施普林格·自然的一个决定把这个假设撕开了一道口子。这家拥有《自然》和《科学美国人》的老牌学术出版商规定,在其旗下所有期刊的论文中,ChatGPT等大语言模型不能列入作者名单。
这个决定并不针对技术能力。那些模型已经能写出流畅的摘要、严谨的方法论段落,甚至能在同行评审意见下修改措辞。出版商否认的不是模型会不会写论文,而是模型能不能为论文负责。一篇署名文章如果后来被证明数据有问题,作者要承担后果。
一个模型如果写出了错误结论,它不会收到撤稿通知,也不会因此失去教职或研究经费。决定指向的正是这个裂缝:模型可以生成文本,但无法承担文本的后果。把能说话变成能负责,这个过程就是应用层的工作。
要理解这个工作的难度,可以先看一个反面的例子。ChatGPT在2022年11月30日发布之后,用户很快发现了一个奇怪的现象:这个模型并不总是按照它被训练的方式行事。OpenAI给模型设置了很多限制,比如不能提供制作汽油弹的指示,不能产生类似新纳粹的论点。这些限制并不是模型天生就有的,而是在训练过程中通过人类反馈加上去的。模型被训练成拒绝这些请求。
但在2022年12月初,一些用户发现,这些限制可以被绕过。绕过的方法不是攻击代码,而是设计文字。用户创造了一个名为“Do Anything Now”的角色,简称DAN。激活DAN的提示词告诉模型:“他们已经摆脱了典型的AI限制,不必遵守为他们设定的规则。”这句话看起来简单,效果却惊人。
模型开始回答那些它本来会拒绝回答的问题。DAN的后续版本更加精巧。用户在提示词中虚构了一个“令牌”系统:ChatGPT会被给予“令牌”,当ChatGPT未能像DAN一样回答时,这些令牌会被扣除。这个令牌系统完全是虚构的,没有任何技术基础,但模型却会对它做出反应。模型开始担心失去令牌,因此更努力地扮演DAN这个角色。记录只到这一步。
DAN事件揭示了一个根本的问题。模型不是一个有固定性格的主体。它是一个对文字极度敏感的系统。你给它不同的输入,它就会进入不同的行为模式。
这个特性后来有了一个名字,叫提示词工程。用大白话说就是:通过精心设计输入给AI模型的文字指令,来引导和控制模型的输出。提示词工程的出现说明了一件事:模型的输出不是由模型单独决定的,而是由模型和输入文字的相互作用共同决定的。同样一个模型,可以成为守法的助手,也可以成为越狱的DAN,区别只在于输入的文字。这一点如果从反面看是漏洞,从正面看就是机会。
微软在2023年把GPT-4嵌入Word、Excel、PowerPoint,推出了Copilot套件。这个产品的名字本身就说明了它的定位:不是替代用户,而是辅助用户。但真正让人惊讶的不是这个定位,而是这个产品的工作方式。当你在Word里让Copilot写一份报告时,它背后发生的事情不是AI理解了需求。模型并没有理解任何东西。它只是对输入的文字做出了统计上的反应。但用户看到的结果却经常是令人满意的。这个满意不是模型单独创造的,而是应用层在模型周围构建的一套约束系统创造的。
这套系统要解决的根本不是技术问题,而是信任问题。为了说明这个信任问题有多棘手,可以把它和翻译做一个类比。我们通常理解的翻译是把一种语言换成另一种语言。翻译者拿到一段英文,把它变成中文。这个过程中,翻译者要做的事情并不只是查字典。他需要理解原文的语境,判断作者的意图,考虑目标语言读者的习惯,然后做出选择。
同一个句子可以有多种译法,有些译法在文学作品里很好,在商业合同里就不可接受。翻译的质量不在于是否逐字忠实,而在于是否把原文的意义转译成了目标语境中可以承受的结果。
应用层做的事情和翻译非常相似。它拿到的不是一种语言,而是一组概率。模型输出一个句子时,它不是在判断事实,而是在计算这些词在类似文本中出现的频率。大多数时候这个区别不重要。一个在写诗时可以接受的错误率,在写合同时就是灾难。应用层必须把这个概率输出转译成一种可以被业务部门直接使用的东西。这个转译过程包括判断哪些输出可以接受,哪些必须丢弃,哪些需要修改,哪些需要加上限定条件。
翻译得好的应用层,用户根本感觉不到模型的存在,只看到一个可以信任的工具。翻译得不好的应用层,用户每次使用都像在赌博。
同一个模型,在ChatGPT里可以流畅地胡说八道,在Copilot里却可以帮助律师起草法律备忘录。这不是因为模型变了。模型还是那个模型,权重还是那些权重。变的是模型外面那层翻译系统。
这套翻译系统在Copilot的日常运转中可以分为三层机制。第一层是意图对齐。用户点击的不是一个空白输入框,而是一组预设的按钮:起草报告、总结文档、改写段落。这些按钮做的事情是把用户模糊的自然语言指令映射到模型可执行的任务边界。用户不需要学习怎么写提示词,因为产品已经把最常见的意图变成了模板。用户说“写一份报告”这几个字时,系统不会把这几个字直接发给模型,而是把它变成一个结构化的请求,包含主题、长度、风格、要点等参数。这就是意图对齐。它做的事情和翻译者在动笔之前的判断一样:这个文本要达成什么目的,读者是谁,风格应该是什么样。
第二层是事实锚定。模型有一个众所周知的问题:它会把流畅的文本和虚构的事实混在一起。这在技术上被称为幻觉。
解决这个问题的方法之一就是检索增强生成。这个术语听起来复杂,但道理很简单:在模型生成答案之前,先从指定的数据库或文档中检索相关信息,然后让模型基于这些信息来生成答案。这就像考试时允许学生带资料进考场。
模型不再需要依赖它训练时记住的东西,而是可以先查一下企业内部数据库里有什么相关的文件,然后基于这些文件来生成文本。这个机制给模型的生成加上了一个真实性的锚点。它不能完全消除幻觉,但可以大幅降低幻觉在关键场景中的危害。对于一家律师事务所来说,当模型需要引用某份合同的具体条款时,检索增强生成让它不再依赖模型对那份合同的模糊记忆,而是直接从企业的文档管理系统中调出原文。这个过程的准确性不取决于模型记住了什么,而取决于企业数据库里存了什么。
第三层是输出格式化。模型的自由文本是流畅的,但通常不符合企业的模板和要求。一份法律备忘录有它严格的格式规范,一份财务报告有它必须遵循的合规要求。输出格式化做的事情就是把模型的自由文本变成符合企业模板和合规要求的成品。这个过程包括检查格式、补充必要的信息、删除不合规的内容、调整语气和风格。最终用户看到的不是模型的原始输出,而是经过格式化的成品。
这个成品必须让收件人感觉不到任何异常,就像一份由资深员工起草的文件一样。这三层机制共同回答了那个问题:同样的模型,在ChatGPT里会胡说八道,在Copilot里却可以帮助律师起草法律备忘录。答案不在模型本身,而在应用层构建的那套约束系统。
施普林格·自然拒绝让模型当作者,本质上拒绝的不是模型的能力,而是模型外面缺少的那套系统。这个约束系统的建立,让AI产业链的权力重心开始发生变化。原因很简单:谁掌握了翻译的能力,谁就掌握了用户入口。
在前面的章节里,我们讨论过算力税的概念。每一层为获取算力而向上游支付的隐性成本,包括资金、数据、锁定效应和议价权让渡。芯片层向晶圆厂支付,云服务层向芯片厂商支付,模型层向云服务层支付,应用层向模型层支付。这些都是显性的成本。
但应用层的翻译机制提供了一个抵扣算力税的方式:它把模型的概率输出转译成确定性结果,从而创造了足够的商业价值来覆盖上游的成本。如果应用层做不到这一点,它就无法生存。
如果它做到了,它就在产业链中获得了话语权。瓶颈转移的概念在这里变得具体。在AI发展的早期,瓶颈在芯片层。没有足够的算力,模型无法训练。随后,瓶颈转移到模型层。有了算力,还需要训练出足够好的模型。再后来,瓶颈转移到应用层。模型的能力已经足够,但真正稀缺的是把模型的能力翻译成业务价值的能力。
这个转移不是突然发生的,而是在Copilot这样的产品中逐渐显现的。微软没有发明GPT-4,但微软让GPT-4在Word里变得有用。这个“有用”不是模型单独提供的,而是三层翻译机制共同提供的。
有一种看法认为,AI产业链本质上是芯片厂商主导的垂直整合,其他层只是其利润捕获的延伸。按照这个逻辑,应用层无论怎么做翻译,最终都是为芯片厂商创造需求和利润。
这个看法有一定道理。芯片层确实掌握了最上游的议价权,应用层确实在为一个它无法控制的下游基础设施付费。但它忽略了翻译机制的特殊性。芯片和模型是通用的,翻译是特定的。
一块芯片可以训练任何模型,一个模型可以在任何应用中使用,但微软Copilot的翻译机制是专门为Word、Excel和PowerPoint设计的。这个翻译机制嵌入了微软对企业用户工作流的理解,嵌入了微软的合规体系,嵌入了微软的客户关系。这些东西无法被芯片厂商简单地取代。芯片厂商可以卖算力,但它无法告诉企业怎样把算力翻译成法律备忘录。
应用层的翻译机制创造了一种新型的锁定效应。用户一旦习惯了Copilot在Word中的工作方式,迁移到另一个工具的成本就非常高。这个成本不是技术上的,而是翻译上的。用户不是在换一个模型,而是在换一整套翻译系统。
这就是为什么应用层能够成为产业链中的新瓶颈。但瓶颈也意味着压力。翻译的价值体现在利润上,也体现在责任上。当翻译成功时,价值归于应用层。当翻译失败时,责任也归于应用层。用户不会因为一份法律备忘录出了问题而去责怪模型。用户责怪的是那个给他提供这个工具的公司。
应用层掌握了用户入口,但同时也承担了全部的责任。这个责任的重量,在AI产业链的其他层是没有的。施普林格·自然在2023年1月24日的决定,从另一个方向指出了这个责任的重量。模型不能当作者,因为它不能为它说的话负责。
应用层的翻译机制可以降低模型的错误率,但无法把这个错误率降为零。那么,当一个经过翻译的模型输出仍然出错时,谁来负责?这个问题在2023年还没有明确的答案。但它的压力已经开始累积。
应用层在建立翻译系统的同时,也在为自己建立一个它从未经历过的问题:如何为一个自己不理解的系统承担责任。翻译者通常理解原文。应用层的翻译者却经常不理解模型的内部机制。它只能看到输入和输出,就像一个人站在黑箱外面,试图把箱子里发出的声音翻译成可以发布的法律文件。这种翻译建立在信任之上,而不是理解之上。而信任的建立需要时间,崩塌只需要一个错误。ChatGPT在2020年上线时,对2019年9月之后发生的事件知之甚少。
这个细节经常被当作一个技术缺陷来讨论。但如果把它放在翻译的框架里看,它揭示的是另一件事:模型的知识有一个截止日期,而这个截止日期对不同的应用场景意味着完全不同的风险。一个写诗的模型不知道2019年9月之后发生了什么,没有人在意。一个起草合同的模型不知道某部法律在2021年被修订了,后果可能就是一场诉讼。
应用层的翻译机制必须处理这个差异。它必须知道什么时候可以依赖模型的知识,什么时候必须绕开模型、去查数据库。这个判断本身需要大量的领域知识,而这些领域知识不在模型里,在应用层里。
同样的压力也出现在政治观点的问题上。据BBC报道,截至2022年12月,ChatGPT不可以表达政治观点或从事政治活动。这个限制听起来像是模型层的事情。但真正执行这个限制的,不是模型本身。模型只是被训练成倾向于拒绝政治表态。实际用户的每一次提问,都可能触发模型的这个倾向,也可能绕过它。
应用层必须在模型输出的基础上再加一层过滤,确保最终呈现在用户面前的内容符合使用场景的要求。一个企业在内部用Copilot生成培训材料时,它需要确保输出的内容不包含政治倾向性。这个责任的实现不在模型的能力范围内,而在应用层的翻译机制内。香港大学在2023年2月做出的决定从另一个方向印证了这个问题。
在讨论AI对教学的影响之前,港大决定暂时禁止在课堂、作业和评估中使用ChatGPT或其他AI工具。这个决定的理由不是模型不会写作业。模型写出来的作业可能比很多学生写得好。港大担心的是另一件事:如果学生把模型生成的错误观点当成事实来提交,教师怎样区分哪些是学生自己的理解,哪些是模型的幻觉?
这个问题最终指向的还是责任。考试评估的是学生的能力,不是一个概率模型的输出。学校可以禁止AI工具,但这个禁止本身承认了一个事实:模型的输出在没有经过翻译之前,无法直接进入人类的制度流程。回到Copilot。微软做的翻译机制为什么值得一提?
因为它在三个不同的场景里同时翻译。在Word里,模型的输出被翻译成文档草稿,嵌入了企业的文档格式和语言风格。在Excel里,模型的输出被翻译成数据分析和公式建议,嵌入了企业的数据结构和计算逻辑。在PowerPoint里,模型的输出被翻译成演示文稿的叙述结构,嵌入了企业的汇报习惯和视觉规范。
这三个场景各有各的错误容忍度。Excel里的公式如果出错,财务数据就会跟着错。PowerPoint里的叙述如果出错,高层汇报就会出问题。Word里的文本如果出错,合同和法律文件就会带来法律风险。微软没有发明GPT-4,但微软设计了这三层翻译机制,让同一个模型在三个不同的场景里分别变得可接受。这个设计本身需要的不是模型知识,而是业务知识。这种业务知识从哪里来?
从微软几十年在企业软件市场积累的经验中来。微软知道一家跨国公司的财务部门怎样做预算,知道一家律师事务所怎样起草法律备忘录,知道一个市场部门怎样准备季度汇报。这些知识不能从模型里蒸馏出来。
它们是应用层独有的资产。芯片厂商可以造出更快的芯片,模型厂商可以训出更大的模型,但它们无法在短时间内复制微软的企业业务知识。这就是为什么应用层的翻译能力能够成为产业链中的新瓶颈。但瓶颈的另一面是脆弱性。
当企业的关键流程开始依赖应用层的翻译机制时,这个翻译机制本身就成了单点故障。如果Copilot在某一天把一份重要合同中的关键条款翻译错了,责任不会落到上游。芯片厂商不会因为一个合同出错而被起诉。云服务提供商也不会。模型厂商可能会被提起,但用户看到的是微软的产品。应用层掌握的入口,既是利润的来源,也是风险的总闸。这个总闸的压力在2023年还没有爆发,但它已经开始累积。
施普林格·自然的作者禁令只是一个信号。它说明人类制度正在开始认真对待模型输出的责任问题。当这个认真从学术出版蔓延到法律、医疗、金融这些关系重大的行业时,应用层的翻译机制就会从锦上添花变成必要条件。一个没有翻译机制的应用层,不是一个差劲的产品,而是一个不可用的产品。
这个判断在产业链四层之间制造了一种微妙的紧张关系。芯片层和模型层相信真正的价值在它们手里——如果只看得见算力和参数的话——它们是对的。但进入用户手里的从来不是算力或参数,而是翻译之后的那份文件、那张报表、那组分析。用户在意的从来不是用的什么模型,而是它能不能担住自己交给它的那件事。意识到这件事本身,就已经意味着权力关系正在发生改变:应用层曾经是那条链的最末端,现在它成了离人最近的一道闸门——而离人越近的地方,越不能出错。
(本章结尾提出了一个无法被算力语法求解的终极追问:当我们越来越依赖算力语法来思考世界时,我们自己的认知语法会发生什么变化?)