第 16 章

循证医学对临床经验的重塑

医学权威的结构性转移很少以宣言的方式发生。二十世纪最后二十年里,当一场被后世称为“循证医学”的运动从学术期刊的版面走向医学院的课程表、临床指南的编纂现场和卫生政策的决策程序时,它并未公开宣布废除医生的个人判断——但它确实改变了这种判断在知识体系中的位置。

在此前漫长的医学传统中,临床经验的权威来自个体医生的观察积累与师徒传承。在此之后,真正的知识来源被界定为随机对照试验和荟萃分析所生产的统计共识。这一转变的幅度如此之大,以至于医学界在相当长的时间里几乎没有意识到自己正在经历一场权威结构的重组。

前文已经谈到,慢性病时代的到来将医学的合法性基础从临床经验推向了统计概率与风险模型。血压的正常值、胆固醇的危险阈值、血糖的控制目标——这些数字在1950年代到1960年代经历了漫长而激烈的争论,最终以流行病学研究的权威裁定告终。医生和患者都开始习惯一个基本事实:身体的健康与否不再完全取决于感觉,而取决于测量数字是否落在群体分布的安全区间内。

这种转变本身已经孕育了一种新的焦虑——人们每天通过测量自己的数字与医学指南对照,而不是通过身体感受来判断自己是否健康。但问题在于:当干预选项繁多且相互矛盾时,医生和患者该如何选择?高血压有七八类降压药可供选用;糖尿病有多种口服药加胰岛素方案;高血脂有他汀类药物的不同剂量组合;再加上抗凝、抗血小板、β受体阻滞剂、ACE抑制剂——每一种都有一堆临床试验支持其有效性。面对这样一个琳琅满目的治疗菜单,单靠个人经验已经无法胜任筛选工作。循证医学正是在这个压力点上登场的。

然而,要理解循证医学为何以如此彻底的方式重塑了临床决策的权威结构,我们需要先回到它的反面:那些曾经被认为理所当然、后来被证明无效甚至有害的治疗。

在二十世纪中叶以前,心肌梗死患者的标准护理方案之一是严格的长期卧床休息。这一做法源于一个看似无可辩驳的逻辑:心脏受损了,需要减少负荷以利修复。于是患者被要求绝对卧床四周、六周甚至更久,吃喝拉撒都在床上完成。这个建议被写进教科书,被一代代医生当作金科玉律执行。

直到二十世纪中叶,才有研究者开始质疑:卧床真的有益吗?当随机对照试验最终实施后,结果令人尴尬——早期活动对大多数患者不仅无害,反而显著减少了血栓形成和肺部并发症的风险。严格的长期卧床被彻底推翻。那些年被迫在床上躺了数周的患者,承受了本可避免的肌肉萎缩和深静脉血栓风险。

另一个更触目惊心的案例是儿童扁桃体切除术。在二十世纪上半叶,扁桃体切除成为美国最常见的外科手术之一,每年有超过一百万儿童接受这一操作。它不仅是针对反复咽喉感染的治疗,更被广泛用作预防风湿热和肾炎的保健措施——有些学区甚至组织集体筛查,将扁桃体偏大的儿童批量送进手术室。一些医生开始怀疑这种过度手术是否合理。当严格的研究最终完成时,结论是:对大多数儿童而言,扁桃体切除术的益处极为有限,而手术风险、麻醉并发症和术后出血却不容忽视。这一操作从常规预防转变为有严格证据支撑的慎重选择,用了整整一代人的时间。

这些案例揭示了经验医学的一个结构性缺陷:单个医生的临床观察天然缺乏足够的样本量和对照条件。一位医生可能在一生中处理过几百例心梗患者,但他无法知道如果采取另一种方案这些患者会怎样;他无法排除安慰剂效应;他无法区分疾病的自然进程与治疗的真正效果。个人经验的积累是缓慢的、碎片化的、容易受到记忆偏差和权威暗示影响的。当这种经验被代代相传时,错误也会被一并传递。

正是对这些无效治疗的集体反思,催生了循证医学运动的种子。英国流行病学家阿奇·科克伦在1972年出版的著作中尖锐地指出:医学界大量使用的方法从未经过严格检验。他特别提到产科病房里有大量干预措施从未被任何可靠的试验验证过其有效性——这并非个别现象,而是整个医学领域的普遍状况。科克伦的批判在当时引发了广泛的讨论,但尚未形成一套可操作的方法论体系。将批判转化为制度的,是加拿大临床流行病学家戴维·萨克特及其同事在二十世纪九十年代的工作。

1992年,萨克特等人发表了一篇标志性文章,首次系统阐述了“循证医学”的概念框架。他们提出,临床决策应当基于当前最佳的研究证据——而所谓“最佳证据”,被明确地定义为来自随机对照试验的系统评价和荟萃分析。这一主张看似温和,实则暗含一场权威革命:它意味着医生的个人经验不再被承认为知识的独立来源,而只能作为解读统计结果的辅助工具。

这套证据分级体系的革命性意义怎么强调都不为过。在过去两千多年的医学史中——从希波克拉底时代到二十世纪中叶——医生的权威恰恰建立在个人经验和直觉判断之上。古希腊医学虽然建立了基于体液学说的理论框架,但真正驱动临床决策的始终是医生对个别病人的具体观察。希波克拉底文集中充满了对个体症状细致入微的描述和对预后判断的强调。正如《格言》一书所指出的,“医生只做必要的事情是不够的,患者和护理人员也必须尽到自己的职责”——这种对患者合作的强调,本身就建立在医生对个体情境的直接把握之上。

这种传统延续了两千多年:医生的眼睛、耳朵、手指和临床直觉构成了医学认识论的核心工具。而现在,循证医学宣称:这些感官经验和主观判断在证据等级中处于最低位置——它们甚至不被视为“证据”,而只是“经验”。

这一转变并非没有代价。当随机对照试验成为知识的唯一合法来源后,一个根本性的问题浮出水面:随机对照试验生产的知识是关于“平均患者”的知识。它告诉我们某种治疗在某个特定人群中平均产生了怎样的效果——但平均效果掩盖了个体差异的巨大鸿沟。一种药物可能对60%的患者有效、对20%的患者无效、对10%的患者有害、对10%的患者产生严重不良反应——随机对照试验报告的平均效应量无法区分这些亚组。而当临床试验为了追求内部效度而严格筛选受试者时——排除老年人、排除孕妇、排除儿童、排除合并多种疾病的患者——其结论能否外推到真实世界中的复杂个体就成了一个悬而未决的问题。

这个矛盾在合并症患者身上表现得最为尖锐。一位75岁的患者可能同时患有高血压、2型糖尿病、冠心病、慢性阻塞性肺病和轻度肾功能不全。他服用的药物可能有七八种之多。而绝大多数临床试验恰恰排除了这类复杂病例——因为它们会干扰试验结果的“纯净性”。当医生翻开临床指南寻找建议时,他面对的往往是一份基于单一疾病人群的证据汇总,而眼前的患者是一个多重疾病交织的复杂个案。“证据不足”——这个在指南中反复出现的标注——成了循证医学最诚实的自我暴露。

这种困境不仅仅是技术性的。它触及了医学认识论的核心裂缝:医学知识的生产方式(随机对照试验)与医学实践的应用场景(个别患者的独特处境)之间存在结构性错位。循证医学试图通过“证据金字塔”来解决这一问题——把知识来源排出等级秩序——但金字塔无法回答一个更根本的问题:当统计共识与个体经验发生冲突时,谁拥有最终的裁决权?

这个问题在医学院的教学内容中得到了最直观的体现。在二十世纪九十年代之前,医学院课程的核心是解剖学、生理学、病理学、药理学和临床见习——学生通过观察资深医生的诊疗过程来学习如何做出判断。到了九十年代末,一门新课程——“循证医学”——出现在越来越多的医学院课程表上。学生被教导如何检索文献、如何评估试验质量、如何计算NNT(需要治疗的人数)和NNH(需要伤害的人数)、如何解读荟萃分析中的森林图。这些技能本身并不坏——它们确实让未来的医生具备了辨别真伪的能力——但它们也潜移默化地传递了一个信息:真正的知识存在于文献数据库中,而不是存在于临床经验的积累中。

这种信息传递产生了一个微妙但深远的文化后果:年轻医生被训练成更信任统计数字而非自己的感官判断。一位住院医师面对一位主诉胸痛的患者时,他的第一反应不再是叩诊、听诊和追问病史细节来形成初步判断——而是先打开手机上的临床决策支持应用,输入症状关键词,查看指南推荐的风险分层工具和诊断流程。这种转变在效率上可能是有益的——它减少了漏诊的风险——但它也在悄然改变医患关系的性质:医生的权威不再来自他本人的经验和判断力,而是来自他身后那套庞大的统计机器。

临床指南的制定方式也发生了根本性的变化。在过去,指南往往由少数资深专家根据个人经验和文献回顾撰写;而现在,指南由循证医学方法学家主导制定,严格遵循证据分级体系——每一条推荐意见都必须标注证据等级和推荐强度。这一转变提高了指南的客观性和可重复性,但也带来了新的问题:指南越来越厚、越来越复杂——一份常见疾病的管理指南可能长达数百页——而指南之间的矛盾也时有发生(不同专业委员会基于同一批证据可能得出不同的推荐意见)。当指南变得过于庞大而复杂时,它反而失去了指导临床决策的功能——医生在信息过载中变得更加焦虑和不确定。

卫生政策的制定同样被循证医学重塑。从二十世纪九十年代开始,各国卫生部门逐渐将“循证”作为政策制定的核心原则:新的治疗技术必须经过严格的临床试验验证才能纳入医保报销范围;已有的治疗措施必须接受系统评价的检验以确定其是否值得继续资助。这一转变无疑提高了卫生资源的配置效率——它阻止了无数无效治疗继续消耗公共资金——但它也制造了一种新的紧张关系:当政策制定者依据人群水平的统计结果决定某种治疗不值得报销时,那些确实从中获益的患者个体被置于了统计共识的对立面。

这种紧张关系在2000年前后的一系列争议中达到了顶点。以激素替代疗法为例:在二十世纪九十年代,基于观察性研究的证据显示激素替代疗法可以降低绝经后女性的心血管疾病风险——这项治疗被广泛推荐给更年期女性。然而2002年,一项大型随机对照试验的结果公布:激素替代疗法不仅没有降低心血管风险,反而增加了乳腺癌和血栓的风险。这一结果导致该疗法的使用率急剧下降。

从循证医学的角度看,这是一个教科书式的胜利——随机对照试验纠正了观察性研究的误导;但从患者的视角看,数百万女性在十多年间被推荐了一种实际上有害的治疗——她们成了统计共识尚未成熟时的代价。类似的案例还有不少。它们共同指向一个更深层的问题:当医学决策的依据从个人经验转向统计共识时,知识的生产速度与知识的可靠性之间出现了一个时间差——在这个时间差里,患者成了不确定性的承受者。

这种不确定性在慢性病管理中尤为突出。前章已经谈到慢性病时代的到来如何将医学合法性基础从临床经验推向统计概率与风险模型。循证医学正是在这个基础上建立起来的工具——它试图为繁多且相互矛盾的慢性病干预选项提供一个筛选机制。但它也将医学判断的重心从对眼前个体的直接把握转向对群体证据的服从。当一位患者询问是否应该服用某种药物时,医生的回答不再基于他对这位患者身体状况的直接把握——而是基于一项临床试验的平均结果:某种药物可以将某类患者的心血管事件风险降低若干个百分点。

这个回答是诚实的、是科学的——但它忽略了一个关键问题:这位患者不是“平均”——他是具体的、独特的、无法被统计模型完全捕捉的个体。

于是我们看到了一个奇特的悖论:循证医学越是成功地消除了“拍脑袋”治疗的旧痛苦——那些基于个人偏见、传统惯例或商业利益驱动的无效治疗——就越是制造了一种新的痛苦:当统计共识与个体经验发生冲突时,医生和患者都陷入了一种基于数字而非身体感受的持续焦虑与不确定性之中。

这种焦虑并非抽象的理论思辨——它在临床实践中表现为一种具体的困境。一位经验丰富的老医生面对一位患有多种慢性疾病的老年患者时发现:按照指南推荐的每一种单一疾病的治疗标准来组合用药,这位患者的药物清单将达到十余种之多;而这些药物之间的相互作用可能产生新的问题——低血压、跌倒风险、肾功能恶化、认知障碍。指南没有告诉他如何处理这种多重疾病叠加的情况——因为没有临床试验曾经覆盖过这种复杂性。

如果他严格按照指南行事,他可能在治疗每一种单一疾病的同时制造了新的整体损害;如果他凭自己的临床判断精简药物组合——他违背了指南的推荐。这位老医生面临的选择正是本章讨论的核心张力:是遵循统计共识还是相信自己的临床直觉?

这个选择没有简单的答案。循证医学的支持者会指出:个人经验容易受到系统性的认知偏差影响——我们倾向于记住成功的案例而遗忘失败的案例;我们容易被近期的病例所左右;我们难以在没有对照组的情况下判断因果关系。这些批评是正确的。

但循证医学的批评者也会指出:随机对照试验同样有其局限性——它的人工设定环境与真实世界的复杂性存在差距;它的平均化处理掩盖了个体差异;它的证据等级体系在赋予统计学方法以权威的同时,也在无意中贬低了临床智慧的价值。

这场争论至今没有定论——而且可能永远不会有定论。因为这个问题本质上不是一个技术问题(如何获得更好的证据),而是一个认识论问题(什么构成可靠的医学知识?)和一个伦理问题(谁有权决定治疗方案的合理性?)。

循证医学在二十世纪最后二十年的兴起完成了“证据位移”的最终形态:统计显著性正式压倒临床经验成为医学判断的黄金标准;个体医生的目视与判断被系统性地置于怀疑之下——它们不再被视为知识的来源,而只是知识应用过程中的辅助工具。

这种位移的影响超越了医学实践本身——它改变了我们对“知道”这个词的理解。在过去,“知道某种治疗有效”意味着个人实践经验的积累;而现在,“知道某种治疗有效”意味着群体数据的统计显著性。两种知识各有其优势和局限——前者更贴近个别情境但容易受偏见影响;后者更客观可靠但难以捕捉个体差异——但它们在权威结构中的地位却是不平等的。

这种不平等产生了一个具体的后果:当一位患者的身体反应与指南推荐不符时——当药物产生了说明书上未列出的副作用时;当一位患者的病情好转却无法用现有证据解释时——医生往往倾向于质疑自己的观察而非质疑指南的正确性。“也许是我判断错了”“也许应该再做一次检查”“也许需要咨询专科意见”——这些想法反映了统计共识对个体经验的系统性压制。

这种压制并非来自任何人的恶意设计——它是循证医学运动为纠正历史错误而采取的必要步骤的自然延伸。当医学界意识到个人经验导致了太多无效甚至有害的治疗时——从心梗患者的长期卧床到儿童扁桃体的大规模切除——它必须找到一种更可靠的知识来源来替代个人判断。随机对照试验提供了这种可靠性——但它也带来了新的代价:个体被统计学所吞没。

深夜十一点半的办公室里,灯光昏黄。老医生把眼镜摘下来放在桌面上揉了揉眼角——他已经连续看了四十多年的病人了。面前的病历摊开着:七十四岁的老太太,高血压二十年、糖尿病十五年、冠心病做过两次支架、慢性肾功能不全三期、还有骨质疏松和轻度认知障碍。药物清单列了十一种药——这是按照现行指南逐条对照出来的结果。

他翻开了那本厚达三百多页的《老年多病共存管理指南》,找到了关于多重用药的那一章。“证据等级:低”“推荐强度:弱”——又是这两个词。指南建议尽量减少不必要的药物——“但哪些是不必要的?”没有哪项研究能告诉他这个具体的老太太应该停掉哪几种药。

他想起三十年前自己刚开始行医的时候:面对这样的患者他会怎么做?他会仔细询问她的症状感受、检查她的身体体征、根据自己对她的了解来调整用药方案。那时候没有这么多指南可查——但那时候也没有这么多药物可用。现在的处境完全不同了:药物越来越多、指南越来越厚、证据越来越充足——但面对这个具体的病人时,“该怎么做”这个问题却变得越来越模糊。

他把眼镜重新戴上,拿起笔在病历上写下了自己的判断:停掉两种降压药中的一种、将降糖药剂量减半、取消他汀类药物的处方——“理由:患者年事已高且肾功能不全;获益不确定而风险明确。”他在医嘱下方签上自己的名字——这个动作他做了四十年了——然后合上了那本厚厚的指南。窗外夜色沉沉。办公室墙上的时钟指向午夜十二点零七分。

这个场景中发生的一切——老医生的犹豫、他的决定、他与指南之间无声的博弈——正是本章所讨论的核心张力的日常体现。

循证医学解决了旧问题:它阻止了无数无效治疗的滥用;它建立了可靠的知识生产机制;它让医学决策变得更加透明和可审查。但它也制造了新问题:当统计共识遭遇个体差异时;当指南无法覆盖复杂病例时;当医生的临床直觉与平均数据发生冲突时——谁拥有最终的裁决权?

这个问题没有简单的答案。循证医学的支持者会说:证据等级体系本身就是答案——随机对照试验代表最高级别的知识来源;个人经验必须服从于它。批评者会说:这种回答回避了问题的实质——因为当面临一个确实不在试验覆盖范围内的复杂个体时,“服从统计共识”可能意味着错误地治疗这位患者。

两种立场各有其合理性——但它们共同指向了一个更深层的事实:现代医学已经进入了一个永远无法完全消除不确定性的时代。随着慢性病取代急性传染病成为主要的健康负担;随着多重疾病共存成为常态而非例外;随着治疗选择爆炸式增长而每一项选择都有其利弊权衡——医生和患者都必须学会在一个没有确定答案的世界中做出决策。

循证医学是这个时代最诚实的产物之一:它承认了人类认知能力的局限性;它试图用系统性的方法减少错误;它让不可靠的个人意见暴露在批判性的审视之下。但它也有一个盲区:它倾向于相信统计学方法能够解决所有认识论问题——而事实上统计学方法本身也是不完美的工具:它的结论取决于研究设计、样本选择、分析方法和解读框架;它的结果是概率性的而非确定性的;它的应用边界受到真实世界复杂性的限制。

这种盲区造成的后果是双重的。一方面它让医生和患者都陷入了一种基于数字而非身体感受的持续焦虑之中——“我的血压达标了吗?”“我的血糖在安全范围内吗?”“我的风险评分是多少?”这些问题取代了更基本的追问:“我感觉怎么样?”“我的生活质量如何?”“我是否愿意为了延长寿命而承受这些治疗的副作用?”

另一方面它也创造了一种新的依赖关系:当医学判断的标准越来越依赖统计数据时——医生和患者都越来越难以脱离那套庞大的指南体系来做出决策——即使他们清楚地知道这套体系无法完全覆盖他们的具体情况。

这种依赖关系在资源有限的医疗环境中尤为突出:当卫生政策制定者依据人群水平的证据来决定哪些治疗值得报销时——那些确实需要特殊治疗的个体可能被排除在外;当医院管理者依据临床路径来规范诊疗流程时——那些不符合标准路径的患者可能被边缘化;当医生依据指南来规避医疗诉讼风险时——那些需要个体化治疗的患者可能得不到最适合他们的方案。

这些问题的根源不在于任何个人的选择或制度的缺陷——而在于现代医学本身的结构性矛盾:它既要处理人群层面的健康问题(通过公共卫生措施和标准化治疗),又要处理个体层面的疾病问题(通过个性化的诊断和治疗方案)——这两种目标之间的张力永远无法完全消除。

循证医学在这场张力中扮演了一个独特的角色:它既是解决旧问题的手段(减少无效治疗),又是制造新问题的根源(标准化掩盖个体差异)。它让医学决策变得更加理性、更加透明、更加可审查——但它也让医学决策变得更加抽象、更加远离具体的身体感受、更加难以回应个体的独特需求。

这种矛盾没有简单的解决方案。也许我们所能做的只是保持警惕:警惕统计共识变成新的教条;警惕证据等级变成新的等级制度;警惕“平均”变成新的“标准”——而忘记每一个真实的患者都是不平均的个体。

那位老医生的深夜举动或许可以被视为一种微小的抵抗:他知道自己违背了某些指南推荐;他知道自己的决定缺乏强有力的随机对照试验支持;他知道如果出现不良后果他可能难以辩护自己的选择。但他仍然做出了那个决定——因为他看到了面前这位具体的患者;因为他相信自己对这位患者的了解比任何统计数据都更丰富;因为他知道如果完全按照统计共识行事他可能会伤害这位患者。

这不是反对循证医学的理由而是它的补充:统计数据告诉我们关于群体的真相但只有临床判断才能告诉我们关于个体的真相;两者缺一不可两者互相制衡两者永远处于一种动态的张力之中。

这种张力构成了现代医学最深刻的困境之一也是《疗愈的代价》这本书试图讲述的核心故事的一部分:每一次技术进步都伴随着新的代价每一次知识增长都伴随着新的不确定性每一次权威重构都伴随着新的失落感。

故事还在继续而真正的问题还悬在空中:当我们拥有了越来越强大的统计工具越来越精确的风险模型越来越完善的临床指南我们是否还能保留足够的空间去看见那个具体的病人?当我们越来越擅长计算平均效应我们是否还能敏锐地感知个体差异?当我们越来越依赖群体数据来做决策我们是否还能信任自己的感官判断?

这些问题没有最终的答案但它们值得被反复追问因为正是通过这种追问我们才能在获得技术力量的同时保持对人性的敏感才能在管理人群的同时看见个体才能在追求效率的同时保留同情才能在治愈身体的同时不忽视灵魂。

那间深夜办公室里的灯光已经熄灭老医生已经拖着疲惫的身体回家休息明天他还会继续面对类似的困境做出类似的权衡写下类似的处方每一份处方都是统计共识与个人判断之间的一次协商每一次协商都在重新定义着“循证”这个词的含义以及现代医学中谁拥有最终的话语权这个问题本身的意义所在。

这盏灯熄灭了还会有另一盏灯亮起来在无数个深夜无数间办公室里无数位医生面前都放着同样的问题同样的困扰同样的两难选择这就是循证医学留给我们的遗产也是我们必须继续面对的挑战,因为在获得力量的,同时保持谦卑在延长寿命的,同时丰富生命在控制疾病的,同时尊重患者的主体性在追求确定性的,同时容忍不确定性这些选择构成了现代医学的真正挑战也构成了我们作为患者作为医生作为公民的最深刻的道德责任。

那位登记官的目光穿透了十九世纪的界限,化作贯穿所有时代的不朽叩问:这一切到底是为谁而设?