第 8 章
以沃尔玛、摩根大通等传统巨头在2022至2024
把时钟拨回2017年夏天,沃尔玛总部的一间会议室里,技术采购部门的负责人正在审阅一份供应商名单。名单上的公司为沃尔玛提供电商平台优化、库存管理、客户数据分析服务——这些系统支撑着沃尔玛与亚马逊零售业务正面竞争的数字前线。采购负责人逐行扫过每个供应商的技术架构说明,一个模式逐渐浮现:几乎每一家都把应用跑在亚马逊AWS上。
这不是技术事故。从任何一个软件工程师的角度看,选择AWS是完全合理的决定。2017年的AWS是全球最大、最成熟的公有云,市场份额超过30%,可用区遍布全球,服务目录厚得像一本电话簿。选择AWS意味着更低的运维成本、更快的部署速度、更少的硬件采购麻烦。任何一个追求效率的技术团队都会做同样的选择。
但沃尔玛的采购部门看到的不是架构图,而是竞争格局。2017年6月,亚马逊宣布以137亿美元收购全食超市,这个消息像一块石头砸进零售业的池塘,涟漪至今未平。
亚马逊不再只是一家电商公司,它正在用线下门店、物流网络、定价算法全方位侵入沃尔玛的领地。两家公司在每一个维度上都是对手:争夺顾客、争夺供应商、争夺仓储位置、争夺最后一公里的配送效率。而沃尔玛的销售数据、库存周转率、用户购买行为——这些构成零售业核心竞争力的信息——正存储在对手控制的服务器集群上,通过对手管理的网络设备传输,运行在对手制定的计费规则之下。
一份流出的备忘录内容被当时的媒体解读为:沃尔玛要求部分技术供应商将其服务从AWS迁移出去。公开报道没有引用具体的合同条款或内部会议记录——记录只到这一步。但传递的信息足够清晰:我们不希望任何核心业务数据驻留在竞争对手的平台上。
这不是一个技术漏洞。AWS的加密协议、访问控制、物理安全在当时已经是行业标杆。这是一个产业结构性的荒诞:你的数据没有泄露,但它住在对手的房子里。你无法用服务水平协议来约束一个与你争夺同一批顾客的公司,因为协议的履约方正是那个竞争对手。
信任在这里不是安全加密的问题,而是商业逻辑的问题——当云服务商同时是你的直接商业对手时,你如何能确信它的服务是非歧视性的?沃尔玛的回应不是协商,不是谈判,不是要求AWS提供额外的数据隔离承诺。它的回应是迁移。
迁移的方向是微软Azure和谷歌云。这两家公司在零售业都没有与沃尔玛直接竞争的业务。微软的对手是亚马逊在云计算领域,不是在全食超市的货架前。谷歌的对手是亚马逊在广告和搜索领域,不是在沃尔玛门店的收银台旁。选择它们,沃尔玛买回了一样东西:选择的权力。
这笔投入的规模从未被官方完整披露。但考虑到沃尔玛当时的IT基础设施体量——它运营着全球最大的零售供应链系统,管理着超过11000家门店的实时库存,每天处理数百万笔交易——迁移成本注定是亿美元级别。
沃尔玛花这笔钱,买的不是更快的服务器或更便宜的存储单元。它买的东西更抽象,也更根本:不被单一供应商锁定的自由。这个自由在2017年之前几乎不被视为一种需要付费购买的商品。
在云服务最早的叙事里,上云本身就是获得自由——从自建数据中心的重资产中解放出来,从硬件采购周期的僵化中解放出来,从运维团队深夜被叫醒的恐惧中解放出来。但沃尔玛的处境揭示了这个叙事的背面:当你把全部系统部署在一家云上时,你获得的是运维自由,失去的是谈判自由。
这个逻辑并不复杂。想象一家大型航空公司采购飞机。波音和空客是全球仅有的两家宽体客机制造商,这个双寡头格局已经维持了三十年。现在假设波音在某个机型上的燃油效率明显优于空客——更省油、航程更长、维护间隔更久。从纯技术角度看,航空公司应该把全部订单都给波音。但现实中,没有任何一家航空公司的CEO会做这个决定。
不是波音的飞机不够好。是因为一旦成为波音的独家客户,公司的命运就不再掌握在自己手里。波音可以随时调整交付时间——你的机队扩张计划从此绑在另一家公司的生产排期上。波音可以提高备件价格——你已经买的飞机需要持续更换零部件,而零部件的唯一来源就是波音。
波音可以在下一代机型的谈判中占据绝对优势——你没有任何替代选项,你只能接受波音的条件。航空公司采购空客飞机的本质,不是否定波音的技术,而是维持一种结构性的制衡。多花的每一分钱,都是在为选择权付费。
多云策略的逻辑与此完全相同。当沃尔玛把自己的工作负载同时部署在Azure和谷歌云上时,它不是在追求技术最优解——单一云平台在集成度、网络延迟、管理复杂度上几乎总是优于多云环境。它是在建立一种制度性防御:如果微软明天把某项关键服务的价格提高三成,沃尔玛可以把更多负载迁往谷歌云;如果谷歌云在某个地区的服务等级协议出现滑坡,Azure就是现成的替代选项。这种防御的成本很高,但它防范的风险更高:被一家供应商锁定之后的系统性脆弱。
这个脆弱不是理论推演,它有具体的历史教训。在IT产业史上,每一代基础技术平台的更迭都重复过同一个模式:早期采用者获得效率红利,晚期依赖者支付垄断租金。
从大型机时代的IBM,到客户端-服务器时代的微软和英特尔,到移动互联网时代的苹果应用商店——平台提供商在初期用开放和低门槛吸引用户,在锁定后用封闭和高抽成收割价值。云服务正在重复这个模式,而沃尔玛2017年的决定,是对这个模式的一次提前突围。
突围的效应在随后几年里迅速扩散。2022年,摩根大通在其技术博客上发布了一张架构图。这张图用不同颜色的方框标出了工作负载的分布:核心银行系统跑在一个环境里,风险模型计算在另一个环境里,客户数据分析又在第三个环境里。环境之间用虚线连接,标注着数据同步的频率和方向。这张图不是技术炫耀——摩根大通的工程师不会把生产环境的拓扑结构当成行为艺术。它是一份制度性声明:我们的算力供应链,不会只绑在一家供应商身上。
到2024年,多云已经从零售业和金融业的先锋实践扩散为大型企业的标准配置。市场研究机构的调查数据显示,全球年收入超过10亿美元的企业中,超过八成采用了多云架构。
这个数字背后是一个产业认知的根本转变:云服务商从“基础设施”被重新归类为“零件供应商”。但这个重新归类的过程远没有听起来那么顺利。
航空公司的类比在这个节点上开始失效,而且失效的方式恰好暴露了云服务的本质。飞机引擎是一个物理实体。它的接口标准是国际航空运输协会参与制定的,它的备件供应链是多家供应商竞争的,它的维修手册是公开可查的,它的性能参数是可以在风洞里独立验证的。当一家航空公司从波音切换为空客时,它面对的是已知的转换成本:飞行员需要重新培训,维修团队需要新工具,备件库存需要更新。这些成本很高,但是可计算的。航空公司可以在做出采购决定之前,把切换成本精确地写进财务模型里。
云服务不是这样。云服务是一个包含计算、存储、网络、数据库、中间件、安全协议、监控工具、计费规则的复杂生态。每一家云厂商的生态都是独特的——不是刻意制造的差异化,而是深度整合的必然结果。
AWS的DynamoDB数据库和Azure的Cosmos DB虽然都被归类为NoSQL数据库,但它们的API接口、查询语法、性能优化策略、故障恢复机制完全不同。在AWS上写的应用程序,不会自动在Azure上运行。你买的不是通用的算力单元,而是一个专属的操作系统。容器化技术Kubernetes的出现,曾被寄望于解决这个问题。它的设计理念简洁而有力:把应用程序和它所需的一切依赖——代码、运行时、系统工具、系统库——打包进一个标准化的容器里。这个容器可以在任何支持Kubernetes的云平台上运行,无论底层是AWS、Azure还是谷歌云。从理论上讲,这让“换云”变得像换手机运营商一样简单——只要你的应用是容器化的,底层跑的是哪家的服务器就不重要。这个类比在技术社区的宣传材料里反复出现。
Kubernetes的架构图通常画得干净利落:一群方框代表应用容器,它们漂浮在一个标着“Kubernetes”的抽象层之上,这个抽象层用整齐的线条连接到底层的“云基础设施”——AWS、Azure、谷歌云被画成完全相同的方块,可以任意替换。这幅图景在2019年前后激发了大量的多云乐观主义:如果所有企业都采用Kubernetes,云厂商就会变成无差别的算力批发商,锁定效应将自然瓦解。
但现实远没有架构图那么干净。第一个障碍是数据出口费。每一家云厂商都对数据离开其平台收取费用。以AWS的定价表为例,从S3存储服务向互联网传出数据,每GB收费0.09美元起,根据用量阶梯有所调整。这个价格用肉眼扫过去并不惊人——一毛钱不到,能贵到哪里去?但如果你是一家像沃尔玛那样的企业,每天产生的交易数据、日志数据、库存快照、用户行为记录以TB计,把全部历史数据从AWS迁移到Azure的出口费可以轻松达到数百万美元。
这数百万美元不是购买新服务的投资,而是放弃旧服务的罚金。云厂商在设计计费体系时,已经把迁移成本内嵌进去了。数据出口费不是技术必需的成本——数据在网络上传送的实际带宽成本远低于这个定价——它是一种制度性锁定的定价工具。
第二个障碍是API差异。Kubernetes可以标准化容器编排——它规定了一个容器应该如何被启动、停止、重启、扩展。但它无法标准化云服务商提供的所有附加服务。当你的应用在AWS上使用了Lambda无服务器计算、SQS消息队列、RDS关系型数据库、ElastiCache缓存服务时,这些服务在Azure上对应的是不同的产品,有不同的调用方式、不同的性能特征、不同的故障模式。容器化确实让你的应用代码可以跨云运行——你的Python代码、Java代码、Go代码在任何地方都能执行。但应用所依赖的云服务生态系统无法跨云移植。这就好比你可以把一辆车的引擎标准化,但引擎需要的燃油、润滑油、冷却液仍然是各家车厂专有的配方。
你可以换引擎,但你不能换配方。第三个障碍是服务等级协议的灰色地带。每一家云厂商都承诺一定的可用性——通常用“几个9”来衡量,比如99.99%的可用性意味着每年停机时间不超过52分钟。这个承诺写在合同里,有明确的赔偿条款。
但当你的系统同时跑在两家云上时,谁来为跨云的协调故障负责?如果AWS的网络延迟突然增加,导致它与Azure之间的数据同步出现延迟,你该找谁索赔?AWS会指出它的网络设备运行正常,问题出在Azure的接收端。Azure会指出它的接收端配置无误,问题出在AWS的发送端。多云环境创造了一个责任真空区,而这个真空区恰好落在客户自己头上。
你为两家云厂商支付了账单,但在它们之间的缝隙里,你只能自己承担协调成本。这些障碍加在一起,让真正的无缝多云变成了一场昂贵的幻觉。企业不是在两家云之间自由切换,而是在两套不同的技术栈之间艰难协调。
它们为多云支付了两笔费用:一笔是给两家云厂商的账单,另一笔是给自己的工程团队维护跨云兼容性的人力成本。这笔额外的成本,就是制度性防御的价格。
那么为什么要支付这个价格?答案藏在上一章留下的那个问题里。当企业发现自己的命脉数据和核心算力都掌握在云厂商手里时,它们开始感到不安。这种不安不是技术性的——AWS的服务器没有宕机,Azure的数据库没有崩溃,谷歌云的网络没有中断。这种不安是结构性的:你所有的增长依赖、成本结构、技术路线图,都绑在另一家公司的战略决策上。如果那家公司决定进入你的行业——就像亚马逊进入零售业、谷歌进入金融科技——你不仅是它的客户,你还是它的猎物。你的IT基础设施的月账单,同时是你最大竞争对手的利润来源。这个利润可以用来补贴它对你的市场的进一步渗透。
多云策略是对这种不安的制度性回应。它不追求效率最优,它追求的是权力制衡。
当摩根大通把风险模型计算放在一家云上、客户数据分析放在另一家云上时,它在发出一个信号:我的业务连续性不依赖于任何单一供应商的善意。这个信号的接收方不只是云厂商,也包括摩根大通自己的董事会、监管机构、客户——它在证明自己管理着技术依赖,而不是被技术依赖所管理。
但这场博弈并没有到此结束。云厂商看到了多云的威胁,它们的回应迅速而精准。AWS在2021年推出了ECS Anywhere和EKS Anywhere,允许客户在自己的数据中心里运行AWS的容器服务。Azure推出了Azure Arc,让客户用Azure的管理工具来管理跑在AWS和谷歌云上的资源。谷歌云推出了Anthos,承诺让客户“一次构建,随处运行”。这些产品的共同逻辑是:既然客户想要多云,那就给他们多云——但让他们继续用我的管理界面、我的计费系统、我的安全策略。
云厂商的回应不是阻止多云,而是驯化多云。它们把多云从一个对抗策略,变成一个托管服务。更深层的回应藏在折扣体系里。
我们在上一章看到,云厂商的计费表已经复杂到需要专门的分析工具来解读。当客户开始把负载分散到多家云上时,它们立即失去了在单一平台上的消费规模,从而失去了拿到最高折扣的资格。预留实例的价格优惠、承诺使用量的折扣、长期合同的特权——所有这些定价工具都被精确地设计成:集中消费的客户获得指数级优惠,分散消费的客户支付更高的单价。
这个设计的经济学原理很简单——批量折扣在任何行业都存在——但它在云服务中的效果是独特的:它让多云的制度性防御成本变得更高。你在用更高的单价,购买对抗同一个供应商的权力。客户的反制也在继续。
2023年前后,一批大型企业开始推动FinOps实践——这个词是Finance和DevOps的合成,核心理念是把云成本从技术团队的运维问题,提升为财务部门的战略管理问题。FinOps团队的任务不是优化代码以降低计算消耗,而是分析不同云厂商的计费规则、折扣周期、预留实例的购买时机,在多云环境中动态分配工作负载以最小化总成本。
这不再是技术选择,这是财务工程。FinOps工程师的工作描述里,可能同时包含对AWS Savings Plans折扣曲线的分析和对Azure混合权益条款的解读。他们不是在写代码,他们是在做套利。
到2024年,多云已经演变成一场持续的消耗战。客户用多云争取议价权,云厂商用折扣和独家服务把客户拉回单一平台。客户用FinOps优化成本,云厂商用更复杂的计费规则重新夺回定价主导权。这场博弈没有终局,因为双方的力量对比在不断变化:当经济上行、IT预算充裕时,客户更愿意支付多云的防御成本;当经济下行、成本压力增大时,单一平台的折扣诱惑就变得难以抗拒。
但这场消耗战本身,已经暴露了云服务层一个根本性的信任危机。云厂商在十年前推销的愿景——算力像水电一样无差别、按需使用、按量付费——正在被它们自己的行为瓦解。水电不会因为你用得多就给你折扣,也不会因为你想接另一家水厂的水就收你出口费。水电没有API差异,没有锁定效应,不需要FinOps团队。
云服务不是水电,它从来都不是。这个判断把我们带回到航空公司类比的那个断裂点。飞机引擎是物理实体,更换虽难但有明确规程。而云服务是包含数据、API、计费规则和独家服务的复杂生态,更换成本深不可测。你不能像订购空客引擎那样订购一批“标准算力单元”,因为算力从来不是标准的——它总是带着某家云厂商的操作系统、数据库方言、安全模型和定价公式。
这种“不可测”本身,就是锁定效应最深的根基。2017年沃尔玛的那份通知,最终成为了这种不可测风险的产业范本。它证明了一件事:当你的核心业务数据跑在竞争对手的服务器上时,技术安全的幻觉会瞬间破灭,剩下的只有赤裸裸的商业逻辑。沃尔玛的选择不是技术判断,而是生存判断。而生存判断一旦做出,就不可逆转地改变了整个产业对云服务的认知框架。
从那之后,每一家大型企业在规划云战略时,都必须回答一个没有标准答案的问题:如果我们的云服务商明天成为我们的直接竞争对手,我们的数据、我们的应用、我们的业务连续性,还有多少掌握在自己手里?这个问题悬在所有云账单的上方,像一笔无法精确计算但必须持续支付的保险费。而支付这笔保险费的动机——那种不可测的恐惧——正在把越来越多的人推向同一个追问:如果连最有钱的巨头都无法完全信任这个算力交易所,那么,是否存在一条可以绕过它的旁路?