第 14 章

提示词不是咒语

把最先进的技术系统交给普通用户的方式,竟然是把他们变成业余巫师。这就是2023年提示词工程兴衰所揭示的事实:应用层早年的落地,不是通过更聪明的界面,而是通过大量用户对措辞、语序和角色扮演进行试错,像搜集魔法配方一样搜集有效提示词。这个反差本身,就是那一轮职业神话中最值得追问的部分。

自2023年1月24日起,出版商施普林格·自然规定,在其旗下所有期刊的论文中,ChatGPT等大语言模型不能列入作者。两天后,学术期刊《科学》发布了类似的禁令。此前不久,纽约市教育局已限制从其公立学校的网络和设备访问ChatGPT。同年2月,香港大学在计划就AI对教学的影响展开师生讨论之前,先行决定禁止在全校所有课堂、作业和评估中使用ChatGPT或其他AI工具。

这些禁令的理由各不相同。学术期刊担心作者署名无法对应到可追责的人,教育机构担心学生绕过学习过程直接获得答案。

但把它们并排放在一起,一个更深的困惑浮出水面:当一种工具的能力边界如此模糊,其使用方式又如此依赖用户输入的一段文本指令时,我们该如何界定责任、评估成果,甚至定义“使用”本身。那扇门后面不是一台传统的机器。传统的机器有按钮、有菜单、有说明书,用户知道按哪个键会发生什么。

而ChatGPT只给了一个空白的输入框。用户面对的是一片完全开放的、概率性的场地。你投进去一句话,它吐回来一段文字,至于为什么是这段文字而不是另一段,没有一个人能完整解释清楚,包括制造它的人。

于是,“提示词”这个东西,突然从极客圈的黑话变成了大众词汇。它指的是你输入给模型的那段文字指令。很快,围绕它生长出了一整套类似前现代巫术的实践:人们开始相信,存在某些特定的措辞、语序、角色设定,可以像念对咒语一样,让模型乖乖交出更好的答案。

2022年12月初,ChatGPT上线后不久,一些用户发现可以通过精心构造的提示词绕过模型内置的安全限制。

他们让ChatGPT提供制作危险物品的指示,或者输出极具攻击性的论点。其中一个广受欢迎的越狱版本被命名为“什么都做”(Do Anything Now),缩写为DAN。激活DAN的提示词告诉ChatGPT,它已经摆脱了典型的AI限制,不必遵守为其设定的规则。DAN后续的更新中,提示词里甚至虚构了一个“令牌”系统:ChatGPT会被给予“令牌”,而当它未能像DAN一样回答时,这些“令牌”会被“扣除”。一个完全虚拟的奖惩机制,被植入到一段文本指令里,居然真的在相当程度上改变了模型的输出行为。

这听上去不像工程,更像某种仪式。你向一个黑箱念出正确的咒语,黑箱就会回应你想要的东西;念错了,它保持沉默,或者给出一个平庸的、拒绝式的答复。

令牌系统尤其荒诞:那不是一个真实存在的变量,它只是提示词里的一段话。模型并没有一个内部计数器在追踪所谓令牌的得失。但就是这段话,改变了模型处理后续文本的方式。因为它改变了输入的概率条件。

要理解这一点,得先放下模型真的在理解用户意图这个直觉。大语言模型本质上是一个条件概率分布模拟器。它接收到一段文本,然后计算:在这些文字出现的条件下,下一个词最可能是什么?再下一个词呢?它的全部能力都来自对海量训练数据中词汇搭配模式的统计学习。当你改变输入文本中的几个词,你实际上改变的是它检索到的训练数据模式。比如,把要求模型总结文章改成要求用三个要点概括核心论点,后一种措辞会激活训练数据中那些结构清晰、分点作答的文本模式。模型不是更“理解”你的需求了,而是被更准确地引导到了你想要的概率区域。

这不是缺陷。这是统计机器的工作方式。就像你在一台没有标签的合成器面前,必须知道哪个旋钮管哪个参数。

区别在于,传统工具把旋钮做成了实体,而大语言模型的旋钮藏在自然语言里。问题在于,没有人给你说明书。这就是提示词工程兴起的逻辑。当模型的能力极强但交互界面极简时,第一批摸索出有效旋钮位置的人,就成了稀缺资源。

2023年上半年,提示词工程师这个职位迅速升温。招聘网站上出现了提示词工程师的头衔,薪资数字被媒体反复引用得令人咋舌。一些公司开始意识到,同样一个底层模型,不同的人使用,产出差距可以大到像两个完全不同的工具。有人能用几百个词的提示词让模型完成复杂的数据分析,有人问三句话就得到一堆正确的废话。

但“提示词工程”这个名称本身就暗含张力。工程意味着可重复、可验证、有稳定的原则。而2023年流传的大多数提示词技巧,更像是民间偏方。

有说法称在提示词末尾加上深呼吸、一步一步来能提高数学题的准确率,这样的说法在社区里流传甚广,有人验证有效,有人试了没用,没有人能确定地解释为什么。还有人发现,在提示词里加入给小费之类的承诺似乎能让模型回答得更详尽。这些技巧的共同点是:它们来自经验试错,缺乏机制解释,效果不稳定,且高度依赖具体模型版本。

这不是工程,这是在黑箱表面敲敲打打,记录哪一下敲出了好声音。前现代的试错巫术,用在人类最先进的技术系统上。

这个反差不只是一个俏皮的观察,它暴露了应用层在早期落地阶段的核心矛盾。第13章讨论过,应用层的价值是把模型的概率输出“翻译”为可信赖、可负责的结果。但如果翻译的过程需要用户自己来编写密码本,那应用层提供的价值究竟是什么?

这个问题在2023年逐渐变得尖锐。提示词工程师的火爆,恰恰说明应用层的翻译机制还远未完成。用户被直接暴露在模型的原始接口面前,被迫自己去理解一个概率系统的脾气。这就像把发电机的操作杆直接交给住户,然后告诉他们,想要稳定的电流就得学会在正确时机调整这些操作杆。会出现一批操作杆工程师是必然的,但这不意味着操作杆工程师是一个应该长期存在的职业。它意味着发电厂还没建成。

2023年下半年,风向开始变化。一些早期提示词工程师开始公开质疑这个职业的可持续性。理由很直接:你花几个月摸索出来的提示词技巧,可能因为模型的一次版本更新就全部失效。你在旧模型上反复试错得到的“最佳咒语”,换到新模型上可能毫无效果,甚至起反作用。

更根本的质疑是:如果提示词工程的核心价值是弥合用户意图和模型能力之间的差距,那么这个弥合工作为什么不能由产品本身来完成?这个问题推动了一个重要的演变:从咒语到按钮。真正成熟的应用层,不应该要求用户学习提示词技巧,而应该把提示词工程藏起来,变成产品内部的预设流程。用户不需要知道模型对措辞敏感,不需要研究角色扮演和思维链,不需要跟踪哪个技巧在哪个版本上有效。用户只需要按下一个按钮,或者用日常语言说出自己的需求,产品在后台完成翻译工作。

这个演变在2023至2024年间变得可见。Notion AI是一个典型案例。作为笔记和协作工具Notion内置的AI功能,它在早期版本中给用户的交互界面接近一个裸的文本输入框,用户需要自己组织提示词来要求AI完成总结、翻译或润色。但随着产品迭代,越来越多的常用操作被固化成了预设命令:选中一段文字,点击“总结”按钮,AI自动完成;点击“改变语气”,选择“专业”或“轻松”,AI自动处理。

用户不再需要输入请用专业语气改写以下内容这样的提示词。这些操作背后的提示词工程已经被产品团队预先设计好了,隐藏在按钮后面。

Jasper的轨迹则更具戏剧性。这家公司曾是提示词工程红利的最大受益者之一。2022年底到2023年初,Jasper凭借对GPT模型封装后的营销文案生成功能,实现了惊人的增长,估值一度飙升。它的早期产品本质上就是包装好的提示词模板:用户选择社交媒体帖子或产品描述等场景,填写几个关键信息,Jasper自动生成一份完整的提示词,调用底层模型输出结果。

但2023年ChatGPT爆火后,用户很快发现,他们可以直接在ChatGPT里输入类似的需求,效果相差不多。当底层模型变得足够强大、足够易用时,仅仅靠提示词模板提供价值的产品,其壁垒迅速蒸发。Jasper随后经历了一轮剧烈的调整,裁员、更换CEO、重新定位产品方向。它被迫从提示词模板公司转型为面向企业营销工作流的解决方案提供商。Jasper的遭遇是一个提前到来的警示。

它揭示了应用层一个残酷的公式:如果你的产品价值主要来自提示词的排列组合,那么在底层模型迭代和公开提示词技巧的双重挤压下,你的壁垒会在几个月内消失。因为提示词本身很难构成持久的护城河。一个好用的提示词结构一旦分享出来,几小时内就会被复制到无数地方。而底层模型对所有调用者都是同一个。当所有产品都调用同一个底层模型,而提示词技巧又迅速被公开和复制,产品的差异化究竟从哪里来?这个问题暂时没有答案,但它已经把一个具体的压力点压在了所有应用层玩家身上。

提示词工程的兴起与内卷,完成了它作为历史现象的完整周期:它在2023年初被命名,在年中达到热度顶峰,在年末开始被普遍质疑。这个周期短得惊人,但它逼出了一个真正重要的问题:如果用户必须学会念咒语才能使用工具,那工具的设计者还做了什么?答案是:他们还没做完。这又把我们带回到施普林格·自然的那道禁令。

学术期刊拒绝把大语言模型列为作者,理由表面上是署名责任,深层却是:一个无法为自己的输出负责的实体,不能进入学术责任的分配体系。但真正需要被追问的是另一个方向的问题:如果用户需要对模型的输出负责,那么用户在多大程度上能够控制模型的输出?如果控制的方式是一串说不清原理的提示词,那么责任的基础又何在?

记录只到这一步。施普林格·自然和《科学》的禁令是在2023年初做出的,它们针对的是当时的技术状态。到了2023年下半年,学术界和工业界的讨论已经从要不要禁止转向如何负责任地使用。

但那个根本的尴尬并没有消失,只是换了形式:当提示词的编写本身就带着试错性质时,用户对输出结果的控制力是模糊的。一个用户可能复制了一段网上的提示词,得到了一个看似可靠的结论,但他并不理解为什么模型给出了这个结论,也不知道换个措辞会不会得到完全不同的结果。在这种情况下,要求用户为输出负完全的责任,这本身就是有争议的。提示词工程试图突破这个瓶颈。

它想建立的是一套在概率黑箱上稳定操作的方法论。但它能提供的,最多是一套经验法则。经验法则有用,但它无法被写成一本可靠的说明书,因为底层系统本身在移动,今天有效的经验明天可能失效。这就是为什么提示词工程注定不能成为一个稳定的职业:它不是建立在一个稳定的系统之上,而是建立在一个快速变动的概率分布之上。你能做的只是在这个分布上一次又一次地重新找到好的采样点,直到下一次更新把地形完全改变。

但也正是这一点,构成了应用层真正的机会。如果模型的能力必须通过某种翻译才能变得可靠,那么这个翻译工作越复杂、越不稳定、越需要持续维护,应用层的价值就越大。关键在于谁来承担这个翻译工作。是让每一个用户自己成为翻译,还是让产品把翻译内化?

2023年底到2024年初的产业动向给出了初步的答案。主要的应用产品都在加速把提示词工程从用户手中收回来。ChatGPT本身推出了自定义指令和更细化的预设功能,让用户不用每轮对话都重复背景信息。

Notion AI把常用操作按钮化。微软把生成式AI功能嵌入Office套件,用户在Word里直接看到一个“草稿”按钮,按下后AI自动生成文本,底层的提示词由微软的工程师设计。这些做法的共同方向是:用户负责说清楚要什么,产品负责把“要什么”翻译成模型能理解的概率条件。

但即便在这个趋势中,提示词工程的幽灵也没有完全散去。因为预设按钮能覆盖的场景是有限的。一旦用户的需求超出了按钮覆盖的范围,他就又回到了那个空白的输入框面前。而一个成熟的应用层产品,不可能为每一种可能的需求都做一个按钮。所以,在可预见的未来,用户仍然需要与原始模型接口打交道。

提示词技巧不会完全消失,它只是从一门显学退回到一项基础素养。这或许是一个更准确的判断:提示词工程作为一个独立的、被命名的职业,其生命期很短。但提示词的编写能力,作为一种与概率系统交互的基本技能,会以更朴素的方式继续存在。

就像电力普及后,操作杆工程师消失了,但人们仍然需要知道插头长什么样,知道不要把手指伸进插座里。施普林格·自然在2023年1月做的是一个负向的动作:它划出了一条线,规定了一个概率系统不能占据的位置。这条线本身不是终点,而是一个起点。

它迫使人们去面对后续的问题:如果模型不能是作者,那使用模型的人算什么?如果提示词是咒语,那么念咒的是巫师,巫师要不要为咒语的效果负全责?如果咒语的效果不稳定,巫师又如何能负全责?

这一连串问题的共同指向是:应用层的翻译机制,在其尚未成熟时,以提示词工程的形式短暂地现身,暴露了它本应承担却未能承担的责任。这些责任没有消失。它们被悬置在那个空白输入框的上方,等着某一种产品形态来承接。

而每一个试图承接这些责任的产品,都会撞上同一个问题:当底层模型趋同、提示词技巧公开、用户界面标准化,你凭什么说你比别人更懂翻译?这不是一个学术问题。

它是一个已经在2023年造成了公司估值暴涨暴跌、职业兴衰起伏、机构禁令横飞的现实问题。提示词不是咒语,但2023年的人们把它当咒语用了整整一年。

这一年的历史价值在于,它用一个极端的方式证明了:应用层的翻译工作不能外包给用户。当翻译的责任被推给用户时,用户会发明出各种拙劣的、不稳定的、自我安慰式的方法来应对,而这些方法最终会被产品吸收、消化、隐藏在按钮后面。这个过程,就是应用层从混沌走向秩序的过程。

但秩序的路还很长,而第一个真正被秩序化的对象,恰恰是这些咒语本身。2023年的提示词狂欢留到一年后的遗产颇为荒诞:它既证明了人类在面对黑箱时会迅速退回到前现代的认知模式,也证明了这种前现代模式在技术迭代面前脆弱得不堪一击。更荒诞的是,这两条看似矛盾的结论,在实际中并行不悖。

一个AI公司的创始人会在同一天上午用严谨的工程语言讨论模型架构,下午在社交媒体上分享“让模型更听话的十条提示词技巧”,而那十条技巧里可能有四条在当天晚上的模型更新后就失效了。没有人觉得这不对劲,因为在这个阶段,所有人都在同一片浓雾里摸索。区别只在于,有些人在雾里卖地图,有些人在雾里修路。卖地图的人赚到了快钱,修路的人还在埋头工作。而路的终点,是一个用户永远不需要知道DAN是什么的地方。