第 19 章
病毒圈的最后边疆
你面前摊开着两份文献。左边这一份,是1971年出版的《普通病毒学》教科书。翻到病毒分类与多样性那一章,你能看到一张在当时被视为权威的表格:已知动物病毒约五百种,植物病毒约三百种,细菌病毒——也就是噬菌体——约四百种。加起来,一千二百种上下。编者在表格下方加了一条注释,认为随着电镜技术与培养方法的完善,病毒世界的基本面貌已大致探明。
右边这一份,是2002年8月《科学》杂志上的一篇论文。研究团队从百慕大群岛附近的马尾藻海取了两百升海水,用一种叫“鸟枪法测序”的技术,直接读取了水中所有生物的基因片段。他们原本想看看海洋细菌的多样性。但当计算机开始拼接这些基因碎片时,一个意外的图景浮现出来:样本中超过百分之六十五的序列,与人类已知的任何基因都不匹配。其中相当一部分携带的,是病毒特有的标记基因。仅仅这两百升海水,就藏着数千种——甚至可能是数万种——全新的病毒。两份文献,相隔三十一年。
它们之间横亘的,不是一千二百种到数千种的数字鸿沟,而是一整个认知框架的断裂。你如果把左边那本教科书拿给1971年的病毒学家看,他不会觉得有什么不妥。他会告诉你,发现一种新病毒的标准流程是这样的:取一份样本——比如病人的咽拭子,或者污水厂的出水——接种到实验室培养的细胞或细菌上,然后等待。等什么呢?等病毒在宿主身上留下可见的痕迹。细胞病变、菌斑、动物发病。如果什么痕迹都没有,那就等于什么都没有。这套流程在逻辑上无懈可击:病毒必须在活细胞里复制,所以你必须提供一个活的宿主,才能看到它。
问题是,这个逻辑里藏着一个沉默的筛选器。你只能看到那些愿意在你提供的特定宿主身上繁殖的病毒。你只能看到那些在实验室条件下肯开口说话的病毒。而对于那些宿主不明、培养条件苛刻、或者干脆不感染任何已知生物的病毒——它们不是不存在,它们只是在你眼前隐身。
这就是二十世纪病毒学的窄门。这个比喻并非修辞上的夸张。噬菌体研究的经典实验,是最诚实的注脚。
你取一管浑浊的细菌培养液,加入几滴过滤后的污水,然后把混合液涂在琼脂平板上,放进培养箱过夜。第二天早上,你会看到平板上出现了一个个透明的圆圈——那是噬菌体裂解了细菌之后留下的空白地带。每一个圆圈,都代表一种能够在你的实验条件下存活并繁殖的病毒。这是一个优雅而强大的方法,整个分子生物学的奠基——从DNA是遗传物质的证明,到基因调控的破译——都离不开这扇窄门里走出来的噬菌体。
但它的优雅,恰恰也是它的局限。你只能看见那些能在你选定的那株细菌上形成圆圈的东西。换一株细菌,圆圈可能就不出现。不出现,你就不知道那里有什么。
1970年代的病毒学家并非不知道这个局限。他们只是没有工具绕过它。于是,一种无意识的认知惯性悄然形成:既然我们只能看见这些,那么病毒世界大概也就只有这些。教科书上那一千二百种病毒,不是当时已知的全部病毒,而是当时能够被培养的全部病毒。这两个概念之间的差异,在当时没有人能够丈量。然后,宏基因组学来了。
这个词听起来像是一个技术术语,但它所代表的,其实是一种视角的彻底翻转。在此之前,研究病毒的方式是先培养,后识别——你得先把病毒养出来,才能知道它是什么。宏基因组学的做法是先读取,后追问——你直接从环境样本中提取所有的DNA或RNA,不管它来自什么生物,全部测序,然后在计算机里分析这些序列到底属于谁。这就像你过去研究一座城市的人口,只能通过挨家挨户敲门,问谁住在这里,只有开门的人才会被记录。而现在,你从空中拍了一张整个城市的热成像图,每一扇窗户后面的人影都同时显形——不管他们愿不愿意开门,不管他们会不会说你的语言。
2002年马尾藻海的研究,就是第一张这样的热成像图。当数据从测序仪里涌出来的时候,研究人员面对的不是几十条或几百条新序列,而是几十万条从未见过的基因片段。它们携带的病毒特征明确无误——编码衣壳蛋白的基因、编码复制酶的基因——但这些基因的组合方式、它们的序列相似度、它们所暗示的演化关系,全都与已知病毒格格不入。
科学家们不得不临时创造了一个词来描述这些东西:病毒暗物质。暗物质这个词借得精准。宇宙学中,暗物质指的是那些不发光、不吸收光、只能通过引力效应间接推断其存在的物质。它构成了宇宙质量的绝大部分,但人类至今无法直接探测到它。病毒暗物质也是如此:它们不形成菌斑,不导致细胞病变,不在任何培养系统中留下可见的痕迹,但它们的基因序列就在那里,数量大到无法忽视。
马尾藻海的研究只是一个开始。在随后的几年里,同样的方法被应用到全球各地的环境样本中。从北冰洋的冰芯到深海热泉口的沉积物,从撒哈拉沙漠的沙粒到城市地铁站的空气过滤器,从南极干谷的土壤到健康人体的肠道——每一个样本都在讲述同一个故事:病毒无处不在,而且它们的多样性远超所有细胞生命的总和。
这里有必要停下来,让你真切地感受一下“远超”这个词的分量。你大概知道,地球上的物种数量是一个以百万为单位的数字。
目前已描述的动物约一百五十万种,植物约四十万种,真菌约十五万种,细菌和古菌的已知种类在数万到数十万之间。但病毒呢?在宏基因组学革命之前,国际病毒分类委员会正式承认的病毒物种不到三千。今天,这个数字仍然只有大约一万。
然而,仅从全球海洋表层水样中估算的病毒种群类型——科学家们甚至不敢用“物种”这个词,因为病毒的演化方式让传统物种概念几乎失效——就高达数十万到数百万。一公斤海洋沉积物中的病毒基因多样性,可能超过整个动物界的基因多样性。如果把地球上所有病毒的基因组首尾相连,这条基因链的长度,足以从银河系的一端延伸到另一端,然后再折返回来,来回好几趟。
你呼吸的每一口空气,大约含有数百个病毒颗粒,它们来自土壤、海洋飞沫、植物的叶面。你喝下的每一口海水——如果你恰好在海边游泳——含有大约一百亿个病毒颗粒。一百亿是什么概念?银河系中的恒星总数,估计在一千亿到四千亿颗之间。也就是说,你捧起的那一捧海水里,装着大约百分之一个银河系的病毒。
而这样的海水,覆盖了地球表面的百分之七十。这些数字不是为了让你的大脑在尺度面前眩晕——尽管眩晕是合情合理的反应。
这些数字是为了让你理解一个更本质的东西:病毒不是生命之树上可有可无的附生物,不是偶尔闯入宿主世界的寄生虫。在基因多样性的意义上,病毒是地球上最丰富的基因库。它们构成了一个巨大的、流动的、持续交换基因的隐形网络——病毒圈。
“病毒圈”这个词,是本章真正的主角。它不是某个科学家灵光一现的发明,而是一个逐渐凝聚的认知框架。在宏基因组学革命之前,病毒被看作是一系列离散的个体:这个病毒,那个病毒。它们之间的联系,主要通过宿主来定义:这是感染人的病毒,那是感染烟草的病毒。
但当你从环境样本中一次性读取到成千上万种病毒的序列时,这种离散的个体观就开始崩塌了。你看到的不是一个个孤立的病毒,而是一个连续的基因空间。
在这个空间里,病毒之间频繁地交换基因模块——今天这个病毒从宿主那里捡了一个基因,明天那个病毒把衣壳蛋白的基因借给了另一个完全不相关的病毒。病毒与病毒之间的界限,比你想象的要模糊得多。
病毒与宿主之间的界限,同样比你想象的要模糊得多——你已经在前面章节中看到了内源性逆转录病毒如何成为哺乳动物基因组的一部分,但那只是冰山一角。在病毒圈的全景图里,基因从病毒流向宿主、从宿主流向病毒、从病毒流向病毒,是每时每刻都在发生的常态。
这种流动性,给病毒分类学带来了前所未有的挑战。传统的生物分类学,建立在“物种”这个概念之上。物种是什么?对于有性生殖的真核生物,一个被广泛接受的定义是:能够自然交配并产生可育后代的个体群体。对于细菌和古菌,这个定义不适用,因为它们不进行有性生殖,但至少还可以通过基因组的整体相似度来划分。
但对于病毒,这两个路径都走不通。病毒不交配。它们复制自己的方式,是劫持宿主的分子机器。
在这个过程中,不同病毒之间可以发生重组——当两个病毒同时感染同一个细胞时,它们的基因组片段可能被错误地拼接到一起,产生一个新的嵌合体。这种重组可以发生在亲缘关系很近的病毒之间,也可以发生在亲缘关系很远的病毒之间。
更麻烦的是,病毒还经常从宿主那里获取基因。你前面读到过,某些病毒携带了光合作用的基因,它们把这些基因从一个宿主搬运到另一个宿主。这意味着,如果单看某一个基因,这个基因可能告诉你的是它最近一次从哪个宿主那里被转移的故事,而不是这个病毒本身的演化史。
于是,当全球病毒组计划在2018年正式提出时,它所面临的第一个问题,甚至不是技术上的,而是概念上的:我们要测绘的这张病毒圈地图,到底应该用什么坐标系?全球病毒组计划是一个雄心勃勃的倡议。它的目标是,在十年内,投入约十二亿美元,系统性地发现和描述地球上大部分未知的病毒——尤其是那些具有潜在跨物种传播风险的病毒。
这个计划的前提假设是:与其在每一次新发传染病出现时被动应对,不如提前把病毒圈的底摸清楚。知道哪里有什么病毒,知道它们在哪些宿主之间流动,知道它们的基因序列特征——这样,当下一次一种未知病毒从野生动物跳到人类身上时,我们至少不会从零开始。这个逻辑在公共卫生层面是成立的。
但当计划进入具体实施阶段时,科学家们发现,他们需要的不只是更多的测序仪和更快的计算机。他们需要一种全新的分类语言。国际病毒分类委员会在过去几十年里建立的那套分类体系——目、科、属、种——是基于病毒的可观察性状的:病毒的形态,是球形还是杆状;病毒的宿主范围;病毒的基因组类型,是DNA还是RNA,单链还是双链。这套体系处理几百种或几千种病毒时运转良好。
但当宏基因组学把数十万种新病毒的序列一股脑倒进数据库时,这套体系就卡住了。你无法观察这些病毒的形态,因为你从来没有在电镜下看到过它们——你只有它们的一串序列。
你不知道它们的宿主是谁,因为它们是从海水里直接捞出来的,没有跟任何宿主绑定。你甚至不能确定它们的基因组类型,因为有些序列太短、太碎,连完整的基因都凑不齐。
面对这种局面,分类学家们不得不退回到最原始的问题上:当我们说两种病毒是同一种或不同种时,我们到底在说什么?如果病毒之间的基因流动如此频繁,以至于“物种”这个概念本身都值得怀疑,那么我们是不是应该换一个思路——不再把病毒圈看作一棵可以逐级分类的树,而是把它看作一张网?这个争论到今天也没有结束。
它之所以无法结束,不是因为它不重要,而是因为它触及了一个更深层的事实:病毒圈的无界性。你用“物种”去框它,它会从框的两侧漏出去。你用“宿主”去定义它,它会告诉你它昨天还在鸟类身上、今天已经在蚊子唾液腺里、明天可能进入一株水稻。你用“基因组”去描述它,它会在复制的时候出错、重组、插入、删除,让你的描述在几代之后就部分失效。病毒圈不是一座可以测绘完就归档的山脉,它是一条正在奔涌的基因洪流。
你每一次取样,都只是截取了这条洪流的一个瞬间切片。这就是为什么,当你凝视那些数据可视化屏幕上密密麻麻的病毒序列网络图时,你会感受到一种奇特的张力。那些图上,每一个节点代表一种病毒,每一条连线代表它们之间的基因相似性。
这些网络图比你见过的任何生物分类图都要复杂——复杂到需要专门开发的算法才能从中辨认出可识别的聚类。而即便是这些聚类,其边界也是模糊的、动态的。有些病毒同时出现在多个聚类中,因为它们携带的基因来自不同来源。有些聚类之间没有明确的界限,只有渐变的过渡带。
你盯得越久,就越觉得这张图不像一张分类表,而像一张天气预报图——上面标注的不是物种,而是基因流动的概率、重组的热点、跨宿主传播的路径。
这正是病毒圈最本质的面貌。它不是一座博物馆,收藏着一件件独立的病毒标本。它是一个全球性的基因交换网络,连接着所有的生命分支。
在这个网络里,基因从深海热泉口的古菌流向表层海水的蓝细菌噬菌体,再从噬菌体流向真核藻类,然后通过昆虫媒介进入陆地植物,最终可能以某种迂回的方式,出现在哺乳动物的基因组里。这个过程不是偶尔发生的意外,而是持续运转了四十亿年的常态。你前面读到的海洋碳泵、胎盘演化、宿主军备竞赛——所有这些故事,都是这张网络在不同尺度上的投影。
病毒圈不是一个与生物圈平行的领域,它就是生物圈的一个维度,一个基因在其中流动、重组、创新的维度。只不过,在过去的一百多年里,我们只看到了这个维度中那些偶尔刺入人类世界的尖刺——流感、艾滋、新冠——而误以为那就是病毒的全部。现在,你站在这张刚刚开始被测绘的网络图面前。
你看到的,是一个比任何单一宿主故事都更宏大的结构。在这个结构里,人类不是中心,甚至不是特别重要的节点。病毒圈在人类出现之前已经运转了数十亿年,它塑造了我们祖先的基因组,调节着我们赖以呼吸的大气成分,驱动着我们赖以生存的海洋生产力。
而我们,作为这个星球上唯一能够理解这些机制的物种,直到本世纪初才勉强睁开了一只眼睛。测绘才刚刚开始。每一个新测序项目都在往数据库里增加数以万计的未知序列,每一个新算法都在揭示出此前无法想象的基因连接,每一个新发现都在提醒我们:病毒圈的边界,远比我们以为的要遥远。
而那个最根本的问题——病毒到底是不是生命——在病毒圈的图景中,正在悄然转化为一个更深刻的问题:当基因可以在生命与非生命之间如此自由地流动时,“生命”这个概念的边界,又在哪里?你合上那两份文献。1971年的教科书,2002年的论文。它们之间的三十一年,是人类从窄门走向广袤的三十一年。
而此刻你面对的,是广袤之中最前沿的那道边界。在那里,已知与未知的比例,不是一半对一半,而是一比一百万。在那里,每一个答案都同时打开十个新的问题。在那里,病毒圈的地图正在被以难以想象的速度绘制,但绘制者们在每一个转角都撞上同一个事实:这张地图的疆域,每推进一寸,未知的疆域就扩大一里。