第 16 章
以2023年发生在美国的两起标志性事件为叙事主线
生成式AI最危险的时候,不是它犯错的时候,而是它看起来完全正确的时候。这句话需要一点解释。我们习惯把技术故障想象成某种显眼的崩溃——屏幕花掉、程序卡死、弹出红色的错误提示。
但大语言模型的“幻觉”恰恰相反。它输出流畅的段落、标准的法律引文格式、自信的医学措辞,每一个句子都严丝合缝地接在上一句后面。错误藏在这种流畅里,就像一滴墨水落进深色地毯——你只有在弯腰凑近、逐字检查的时候,才会发现那不是一个真实的判例,而是一组被精巧编织出来的词语序列。
2016年,Google首席执行官孙达尔·皮柴在加州山景城总部宣布公司将全面转向“人工智能优先”。他说的是计算的核心任务正在发生根本性迁移——从处理已知信息转向生成新内容。这个判断在七年后的2023年得到了大规模验证,但验证的方式并不完全令人愉快。
当生成能力进入法庭、诊室和交易大厅时,它撞上了一堵皮柴当年没有提到的墙:在这些地方,“生成”和“编造”共享同一套工作机制,而后果由谁来承担,整个产业还没有想清楚。2023年春天,纽约南区联邦法院收到了一份不寻常的文件。说它不寻常,不是因为案情复杂——原告声称在飞机上被服务推车撞伤膝盖,被告航空公司以诉讼时效已过为由申请驳回。这类航空伤害索赔在美国联邦法院系统中并不罕见。不寻常的是原告律师提交的答辩书里引用的六个判例。Martinez v. Delta Air Lines, 2022 WL 17890214。Varghese v. China Southern Airlines, 2022 WL 4896541。Miller v. United Airlines, 2022 WL 11235813。每一个判例都带着完整的卷宗编号、判决日期和详细的案情摘要。格式规范,引文准确,法律推理与原告律师的论点严丝合缝地对接。
对方律师收到文件后开始核查。他们调出了法律数据库里的记录,输入了那些卷宗编号。系统返回空。换了一个数据库,同样的结果。再换一个,还是没有。六个判例,从案件名称到编号到判决摘要,没有任何一个存在于任何可以查证的法律记录中。
它们被一个名叫ChatGPT的语言模型完整地虚构了出来。律师在随后的听证会上承认,他使用ChatGPT进行法律研究,并且“没有意识到它可能生成虚假内容”。法官的结论直截了当:提交法庭文件的律师有责任核实其所引用的每一项权威来源。工具可以辅助研究,但责任的链条不因工具的介入而断裂。处罚决定很快做出,事件迅速传遍了美国法律界的每一个角落。
几乎在同一时期,医疗领域发生了一件性质相同但后果更令人不安的事。一位研究人员在测试大型语言模型的诊断建议能力时,输入了一组症状:持续胸痛、呼吸困难、左臂麻木。这是心肌梗死的典型前兆。
在某个版本的输出中,模型生成了详细的分析和建议——它建议患者先尝试家庭疗法,观察症状是否自行缓解,再考虑是否就医。对于一个正在经历心肌梗死的患者来说,这个建议是致命的。在另一项独立测试中,模型被要求为一位有复杂用药史的患者推荐药物调整方案。它生成了一个看似合理的建议,但核查发现,它推荐的两种药物之间存在已知的严重相互作用风险——这种风险在任何标准药物配伍数据库中都会被标记为禁忌。模型没有核查数据库。它只是在预测,给定这段症状描述和用药史,最可能出现在下一句话里的药物名称是什么。
这两起事件——虚构的法律判例和危险的医疗建议——在时间上的邻近不是巧合。它们共同标志着一个转折:2023年,生成式AI从“令人惊叹的新奇事物”进入了“后果不可逆的严肃场景”,而它的核心工作机制与这些场景的基本要求之间,存在一道尚未被充分理解的结构性裂缝。要理解这道裂缝,需要先放下一个常见的误解。
很多人把大语言模型的“幻觉”想象成一种偶尔发生的故障——就像打印机偶尔卡纸,大多数时候正常工作,少数时候出问题。这种类比是错的,而且错得关键。大语言模型不是在“偶尔编造”。它是在“持续生成”。
它的全部工作就是预测下一个最可能的词。给它一个句子开头——“法院在判例中认定”——它会基于训练数据中数百万份法律文件里这个词组后面通常跟着什么,来预测接下来应该出现的词语序列。这些序列在统计上最可能是连贯的、符合文法的、看起来像真实法律文本的。但它们是否对应现实世界中的某个具体判例,模型既不知道,也没有任何机制可以去知道。
这不是一个可以通过调试修复的bug。这是大语言模型概率性生成机制的内在特征。
把它放在创意写作场景中,“编造”可以被重新描述为“想象力”——它能写出不存在的奇幻世界设定,能编出从未发生过的对话,这些正是用户付费购买的价值。但把同一个机制放在法庭或诊室里,“编造”就是“谎言”。不是模型变坏了。是场景变了。
在娱乐和创意场景中,用户对“真实性”的期待是宽松的。一首AI生成的诗歌不需要事实核查。一段AI编写的奇幻小说设定不需要引文出处。
但在严肃场景中,真实性的标准是刚性的。一个不存在的判例可以导致律师被处罚、案件被驳回、当事人的合法权益受损。一个错误的医疗建议可以延误治疗、加重病情、甚至危及生命。在这两个场景之间,横亘着一道应用层必须跨越的鸿沟——而跨越的方式,至今没有标准答案。
应用层公司很快意识到了问题的严重性。2023年下半年到2024年初,整个产业围绕“如何驯服幻觉”展开了一场密集的技术竞赛。三条主要路径逐渐浮现出来,每一条都试图从不同角度给模型的生成能力加上约束。
第一条路径叫检索增强生成。它的思路很直观:在模型开口回答之前,先让它去查资料。传统的大语言模型回答问题只靠训练时记住的词语共现模式。
检索增强生成在模型和问题之间插入了一个搜索步骤——用户提问后,系统先去一个可信文档库里查找相关信息,找到后把这些信息连同问题一起喂给模型,让模型基于查到的材料来组织回答。这就像给一个博学但粗心的学者配了一位图书管理员。学者不再凭记忆回答一切。每次被问到问题,管理员先递给他几本翻到相关页码的书。学者仍然负责组织语言和推理,但他的输出被锚定在了可追溯的来源上。
法律科技公司率先采用了这条路。到2023年底,多家面向律所的AI工具开始将检索增强作为标配功能。它们不再让模型直接回答法律问题,而是要求模型先在真实的判例数据库里检索,然后基于检索结果生成分析。如果数据库里没有相关信息,模型应该回答“未找到相关判例”,而不是编造六个看起来像真的。
但这套方案有代价。第一个代价是延迟。纯生成模式下,模型从接收问题到输出答案只需要几百毫秒。
加上检索步骤后,系统要先执行搜索、等待数据库返回结果、把结果嵌入提示词,然后再启动生成——整个过程可能延长到几秒甚至十几秒。在法律研究场景中,这个延迟或许可以接受。但在需要实时交互的应用中——比如语音助手、实时翻译——几秒钟的等待足以毁掉用户体验。
第二个代价更隐蔽。检索增强的有效性完全取决于文档库的质量和覆盖范围。如果库里的资料不完整、过时或有偏见,模型的回答也会继承这些问题。更重要的是,检索步骤本身就要做一个判断:哪些文档与当前问题相关?这个判断由另一个算法做出,而这个算法也可能出错。于是问题从“模型是否编造事实”变成了“检索系统是否找到了正确的事实来源”——复杂度转移了,但没有消失。
第二条路径叫输出校验。它的逻辑同样直观:让另一个模型或一套规则引擎来审查生成结果。主模型生成回答后,校验系统介入,检查其中是否存在事实错误、逻辑矛盾或违反安全规范的内容。如果发现问题,要么标记给用户,要么自动修正,要么直接拒绝输出。
这就像给那位学者配了一位编辑。学者写完之后,编辑通读一遍,用红笔圈出可疑的断言,标注“请核实”或直接划掉。在医疗AI的场景中,校验系统可以接入药物配伍数据库,自动检查模型推荐的用药方案是否存在已知的相互作用风险。如果检测到风险,系统可以拦截这条建议,转而输出一个更保守的方案或建议咨询医生。
输出校验在安全敏感场景中已经得到了应用。一些面向企业的AI平台开始内置“事实核查层”,在模型输出到达用户之前对其进行二次审查。
但这条路同样有代价,而且这个代价触及了一个更深层的矛盾:校验系统自身也可能出错。如果一个校验系统被设计得过于严格——比如,只允许模型输出那些可以在训练数据中找到逐字匹配的内容——它会把大量正确的、有价值的创造性回答也过滤掉。医学诊断中,有时候正确的判断恰好是反直觉的、罕见的、在常见模式之外的。一个过度保守的校验系统可能把这些正确答案当作“异常”拦截下来。反过来,如果校验系统设置得过于宽松,它又起不到实质性的过滤作用。
更麻烦的是,校验系统本身也是基于规则的或者基于另一个AI模型的。如果是基于规则的,规则永远无法覆盖所有边界情况——现实世界太复杂了。如果是基于另一个AI模型的,那谁来校验这个校验模型?这变成了一个无限递归的问题。每一步校验都需要更多的算力、更多的延迟、更多的成本——而这些成本最终会体现在产品的价格标签上,或者被转嫁到用户身上。
第三条路径是人机协同。它承认技术和规则都无法完全消除风险,于是把最终决策权保留在人类手中。AI生成建议,人类做判断。AI起草文件,人类审核签字。AI提出诊断假设,医生确认并承担责任。这条路最符合直觉,也最符合现有的法律和伦理框架。
那位纽约律师的问题不在于他使用了ChatGPT——使用工具本身没有错——而在于他没有履行审核义务就签字提交了。如果他在收到模型生成的判例后,花一个小时去法律数据库里逐一核实,那六个虚构的判例根本不会出现在法庭文件中。人机协同的逻辑就是把这个审核步骤制度化:AI是副驾驶,人类是机长。
但这条路同样有代价,而且这个代价直接消解了许多企业引入AI的初衷。如果每一个AI输出都需要人类专家花同样的时间去审核,效率提升在哪里?一个律师用AI花十分钟起草了一份文件,然后花两个小时核实每一个引用来源——加起来可能比他自己从头研究还要慢。一个医生用AI获得了诊断建议,然后需要亲自查阅所有相关文献来确认建议的可靠性——那AI帮了什么忙?
人机协同在那些审核成本远低于错误成本的情况下是合理的。在核电站控制系统中,在航空安全决策中,在重大外科手术中——错误代价太高了,即使AI能节省时间,人类审核这一步也必须保留。
但在大量商业和法律日常工作中,如果人机协同意味着“AI加速了草稿阶段但拖慢了整个流程”,企业就会面临一个真实的诱惑:跳过审核步骤,直接信任AI的输出。这正是那位纽约律师做的事。他不是不知道应该核实。他只是假设了AI的输出是可靠的——这个假设在2023年那个时间点上,被铺天盖地的宣传和演示强化了无数次。
ChatGPT上线五个月就积累了上亿用户,媒体上充斥着它通过律师资格考试、通过医学执照考试、写出高分论文的报道。“通过考试”这个表述本身就容易产生误导——人们听到它,会以为模型具备了法律判断能力或医学诊断能力,但实际上它只是在特定类型的考题上生成了符合评分标准的答案。考试可以靠模式匹配来通过,法庭和诊室不行。
这三条路径——检索增强、输出校验、人机协同——共同指向同一个结论:幻觉不是可以通过技术迭代彻底消除的问题,它是大语言模型工作机制的固有属性。应用层的真正任务不是“消灭幻觉”,而是“管理幻觉的风险”。这意味着做出一个产业层面上的判断:在哪些场景中,幻觉的代价是可承受的?在哪些场景中,即使是最先进的管理手段也不足以把风险降到合理水平?这个判断正在重塑AI应用层的竞争格局。回到第15章讨论过的同质化困境:当所有应用层产品都接入差不多的底层模型、提供差不多的功能时,企业为了差异化会做什么?
一个自然的冲动是把AI推向更高风险、更高价值的场景——法律、医疗、金融、司法。这些场景中,AI能创造的价值更大,能收取的费用更高,竞争也相对不那么拥挤。但恰恰是这些场景中,幻觉的代价最严重。
于是出现了一个残酷的推论:同质化压力把应用层公司推向了高风险场景,而高风险场景放大了幻觉的后果,幻觉的后果最终由应用层公司承担——不是模型提供商。这是一个责任归属的结构性问题。当那位纽约律师被处罚时,OpenAI没有受到任何法律追责。ChatGPT的用户协议里写了免责声明:模型可能生成不准确的信息,用户应自行核实。当医疗AI给出危险建议时,责任链条指向的是部署这个系统的医疗机构或软件开发商,而不是底层模型的训练者。
应用层站在了风险的最前沿。这并不意味着模型提供商可以高枕无忧。监管压力正在从应用层向上传导。2023年到2024年,欧美多国的立法讨论开始聚焦一个问题:模型训练者是否应该为可预见的误用承担部分责任?
这个问题还没有确定的答案,但它的存在本身就构成了一个压力点。如果未来法律要求模型提供商对输出内容的真实性承担更多责任,整个产业链的权力格局将再次发生变化——云服务层的合规成本会上升,开源模型的自由分发可能受到限制,芯片层的算力部署需要考虑审计和追溯功能。
但在当下这个时间点上,承担幻觉后果的首要主体是应用层公司。它们必须做出选择:要么继续向高风险高回报的场景推进,同时承受随时可能爆发的声誉危机和法律诉讼;要么退回到低风险场景中,接受更薄的利润和更激烈的同质化竞争。
一些公司开始尝试第三种策略:重新定义自己在产业链中的角色。它们不再把自己定位为“AI服务提供商”,而是定位为“AI风险管理商”——主动向客户承诺,自己部署的AI系统经过了多层幻觉管理措施的约束,输出的内容经过了检索增强和输出校验的双重过滤,并且每一份重要文件都有人类专家的审核记录。它们把“可信”本身变成产品差异化的卖点。
这种策略的逻辑是:既然所有人都接入差不多的底层模型,那么真正的差异化不在于模型能力本身,而在于围绕模型构建的风险管理体系。客户愿意为“可依赖的AI”支付溢价——不是因为它的回答更聪明,而是因为它的回答更不容易惹上官司。
这个逻辑有商业上的合理性,但它也揭示了一个更深层的焦虑:应用层正在从“技术提供商”变成“责任缓冲层”。它们站在底层模型和终端用户之间,吸收来自两边的压力——底层模型的不确定性向上冒,终端用户的责任追究向下压。在这个位置上生存,需要的不是更好的算法,而是更厚的法律预算和更谨慎的合规流程。
算力税在这个故事里以一种新的形式显现出来。前面章节讨论过,芯片层的垄断使得每一层向上游支付隐性的成本——更高的采购价格、更紧的供应约束、更弱的议价权。但在应用层面对幻觉问题的过程中,另一种算力税浮现了:为了管理幻觉风险而支付的额外成本。
检索增强需要更多的计算资源来执行实时搜索和文档嵌入。输出校验需要运行额外的模型或规则引擎。
人机协同需要雇佣和培训人类审核者。这些成本最终都转化为对算力的更多需求——不是用来训练更大的模型,而是用来约束已有模型的输出。算力税不只是金钱的流动,它也是一种风险的转移机制:下游为上游的不确定性买单。
这就是瓶颈转移的又一个案例。当芯片层的供应瓶颈通过产能扩张逐步缓解后,权力重心向云服务层转移;当云服务层的差异化空间被压缩后,开源模型层成为新的战场;当开源模型的同质化趋势显现后,应用层成为创新的焦点;而当应用层撞上幻觉管理这堵墙时,瓶颈再次转移——这一次不是向产业链的某一层转移,而是向整个产业链与外部社会之间的界面转移。
幻觉问题不是一个技术问题,它是一个社会契约问题。当AI开始参与法律判断、医疗决策、金融分析时,社会要求的不只是准确率——它要求可追溯的责任归属。而大语言模型的概率性生成机制,恰恰在最根本的层面上挑战了这个要求:你无法追溯一个概率分布为什么在那个时刻输出了那个特定的词序列。
你可以分析权重,可以重现计算过程,但你无法说清楚“为什么是这个判例名称而不是那个”——因为在模型的内部,并没有一个“选择真实判例”的机制存在过。我们不知道如何让一个概率生成系统承担法律责任。我们甚至不知道“承担法律责任”这个概念在一个没有意图、没有知识、没有真假判断能力的系统中意味着什么。
法律体系是为有意图的行为者设计的——人、公司、组织。当行为的来源是一个语言模型时,现有的责任框架出现了断裂。这不是一个可以通过技术改进来弥合的断裂。它是一个需要在法律哲学层面重新思考的问题。
那位纽约律师被处罚之后,美国多个州的律师协会发布了关于使用AI工具的指导意见。核心内容大同小异:律师可以使用AI辅助工作,但必须遵守与传统法律研究相同的勤勉义务;提交给法庭的每一份文件,签字律师对其内容的真实性负最终责任。这些指导意见没有禁止AI,只是重申了一个古老的原则:工具可以变,责任不能转移。医疗领域的反应更谨慎。
美国医学会和其他专业组织开始推动建立AI辅助诊断的标准化评估框架,要求任何用于临床决策支持的AI系统都必须经过独立的准确性验证和持续监测。一些大型医院系统在部署AI工具时采取了分阶段策略:先在非临床场景中试用,再在低风险临床场景中由医生监督使用,最后才考虑在更关键的场景中部署——每一步都有明确的审核和退出标准。
这些应对措施都是合理的,但它们也暴露了一个尴尬的事实:整个产业在把AI推向严肃场景时,并没有事先想清楚幻觉管理的问题。技术跑在了制度前面,而制度追上来的方式通常不是预防性的设计,而是事后的事故响应。每一次事故推动制度向前走一小步,制度每走一步,应用层公司的合规成本就增加一点。最终,管理幻觉风险的成本会成为应用层竞争的一个决定性变量——那些能把这项成本降到最低的公司,将获得结构性的竞争优势。但降低成本不等于消除风险。
只要大语言模型的核心工作机制不变——只要它仍然是一个预测下一个词的机器,而不是一个验证事实真伪的机器——幻觉就会一直存在。应用层能做的,是在模型输出和现实世界之间筑起防线:检索增强是第一道,输出校验是第二道,人类审核是第三道。每一道防线都有代价,每一道防线都可能被突破,但三道加在一起,可以把大多数不可承受的风险挡在外面。
对于那些代价实在太高、防线实在筑不起来的场景,唯一的理性选择是退回来。不让AI做最终决策,不让AI独立面对患者或法官,不让AI在没有人类监督的情况下操作用于临床或法庭的工具。
这不是技术悲观主义。这是对概率性生成机制本质的清醒认识。算力正在思考。但它思考的方式和我们不同。它不是在判断真伪,它是在编织连贯。这种编织能力在合适的场景中是无价的创造工具,在不合适的场景中是危险的谎言制造机。
区分这两种场景的边界在哪里,边界如何随着技术进步而移动,边界之外的责任由谁来承担——这些问题在2023年那两起事件之后不再只是学术讨论的题目。它们变成了应用层公司每天必须面对的商业决策,变成了每一份用户协议里试图用法律语言围堵的风险敞口,变成了整个AI产业链继续向前推进时无法绕开的一道坎。