第 7 章
云服务的计费表:按秒租赁超级计算机
2006年夏天,亚马逊的一位技术布道者坐在西雅图总部,面对一篇难产的博客文章。他叫杰夫·巴尔,任务是向外界解释一个名叫“弹性计算云”的东西——缩写EC2。这个产品让用户通过互联网访问亚马逊数据中心里的虚拟服务器,按小时付费。巴尔在键盘上反复敲打了两天,问题不在于技术描述本身,而在于你得让读者理解,为什么这件事和过去所有的计算机租赁方式都不一样。
在那之前,租一台服务器意味着签合同、付月费、提前预订配置。服务器有固定的IP地址,有机柜编号,你甚至可以跑到数据中心摸到那台机器。但EC2提供的是虚拟机——它没有固定物理形态,今天运行在第三排机架的某台服务器上,明天可能迁移到第七排。你租的不是一台电脑,你租的是一个“计算小时”。
巴尔最终找到了一个说法。他在博客里写道:这就像把电器插进墙上的插座,按用电量付费,而不是自己买一台发电机放在地下室。这个类比后来被重复了无数次,以至于人们几乎忘了它在2006年听起来有多奇怪。
电是看不见的——灯亮了,你知道电在流动,但你不去想电站和电网。计算能力呢?那东西一直是有形的。你买一台戴尔电脑,它装在纸箱里送到家门口,拆开包装,按下开机键,风扇转起来,这就是计算。把计算变成看不见的服务,这个想法激进到连亚马逊自己的工程师都不确定市场会不会接受。
但他们还是发布了。2006年8月25日,EC2正式上线,基础配置的单核虚拟机每小时10美分。换算下来,租一个月大约72美元。如果你自己去买一台同等配置的服务器,硬件成本大约1500美元,加上机房租用、带宽和运维人工,总持有成本远超租金。
但重点不是便宜——重点是你不需要买。你可以在接下来一小时内启动一百台这样的虚拟机,用完就关掉,只付一百个小时的费用,然后永远不再碰它们。这个“用完就扔”的能力,才是EC2真正的发明。
上一章我们看到了芯片层的权力格局:英伟达制造GPU,定价权握在它手里,一块H100显卡卖几万美元,想买还得排队。
这是物理世界的逻辑——稀缺资源被少数供应商控制,价格由制造成本和供需关系决定。
但走进云服务层,一件奇怪的事情发生了。云厂商买下那些昂贵的GPU,装进数据中心,然后以每小时几块钱的价格租给你。一块价值三万美元的H100,按三年折旧计算,每小时硬件成本大约1.14美元。AWS租给你一个搭载八块H100的实例,每小时收费在30到40美元之间。差价从哪儿来?
不是简单的硬件转租——云厂商做了一件事:他们把一台物理服务器切碎了。物理服务器是一整块铁疙瘩,但虚拟化技术可以把它切成几十个相互隔离的小块,每一块表现得像一台独立电脑。这就像一栋公寓楼——建造成本是整栋楼的成本,房东把它拆成二十个单元分别出租,每个租户有自己的门锁、水电表和信箱,彼此不知道对方的存在。云厂商就是那个房东。他们买下整栋楼,装修好,然后按天、按小时甚至按秒收租。
当算力变成像水电一样按用量付费的东西,那个电表到底怎么转?要理解这个电表,我们先看一份真实的账单。
打开AWS管理控制台,进入成本管理器页面,你会看到一个账单仪表板。它不像家里的电费单那样简单——上面只有本月用电度数和应缴金额。AWS的账单是一个多层嵌套结构,顶部显示总费用,下面按服务拆分为EC2、S3存储、RDS数据库、Lambda函数计算等几十个细项。点进EC2,更细的维度展开:按区域、按实例类型、按计费模式分别列出。再往下点,每一个实例ID后面跟着精确到秒的使用时长和单价。
这套账单系统的设计本身就是一个权力工具。它让客户感觉自己拥有控制权——你可以看到每一分钱花在哪里,可以设置预算警报,当费用超过阈值时自动发邮件通知。但它也制造了一种精妙的依赖关系。客户越是精细地管理云成本,就越深陷在这个系统里。财务部门学会了看这些报表,采购流程围绕预留实例的折扣周期设计,工程师在写代码时就开始考虑哪种实例类型最省钱。
一旦把自己的成本结构嫁接到云厂商的计费体系上,迁移出去的成本就不再只是技术上的,而是财务上的——你得重新设计整个内部核算流程。这就是云服务层权力运作的第一条法则:不是通过锁死技术出口,而是通过渗透进客户的经营方式。
回到2006年那个10美分一小时的价格。这个价格怎么定出来的?亚马逊从未公开过定价公式,但从后来的市场行为可以反推。EC2最初的价格远高于硬件成本分摊——如果只是简单转租,每小时10美分意味着客户租一年要付876美元,而同等物理服务器的年折旧成本大约只有300到400美元。但亚马逊赌的是另一件事:客户不会全年无休地使用这些虚拟机。他们可能在高峰期需要一百台,低谷期只需要十台。如果客户自己买服务器,必须按峰值配置,浪费闲置容量。EC2的弹性让客户只为实际使用付费,所以即使单价更高,总成本反而更低。
这个逻辑成立的前提是,亚马逊自己承担闲置风险。它必须建造足够大的服务器集群,确保任何时候都有空闲容量供客户弹性扩展。
这意味着亚马逊手里永远有大量浪费的算力——那些开着机但没人租用的虚拟机。如何消化这些闲置算力,成了云厂商商业模式的核心难题。
答案在2009年浮出水面。那一年,AWS推出了一项叫竞价实例的新功能。规则是这样的:AWS把闲置的服务器容量放到一个市场上,客户可以出价竞拍。你设定一个愿意支付的最高小时单价,当市场价格低于你的出价时,你获得使用权;当市场价格上涨超过你的出价时,你的虚拟机被强制终止,正在运行的任务中断。价格每时每刻都在波动,取决于供需关系。在需求低谷期——比如美国时间的深夜——价格可能低至按需价格的十分之一。在高峰期,价格可能飙升至按需价格的好几倍。
这个设计的天才之处在于,它把闲置算力变成了一种金融产品。你不再是在租一台电脑,你是在一个实时市场上交易计算时间这种商品。价格信号引导消费行为:对价格敏感的客户会把非紧急任务挪到低价时段运行;对稳定性要求高的客户则继续使用按需或预留实例,支付溢价换取不被中断的保障。
市场自动完成了客户分层,云厂商不需要亲自判断谁该付多少钱——价格机制替它做了这个决定。
2017年3月,这个市场经历了一次著名的波动。AWS美东地区的某款GPU竞价实例价格在几个小时内从每小时约0.45美元飙升至接近2美元,涨幅超过四倍。原因很简单:一家大型机器学习公司在训练一个紧急模型,大量买入GPU时间,吸干了市场上的闲置容量。
那些出价较低的客户收到通知:你的实例将在两分钟后被终止。两分钟,这是你能得到的全部预警时间。如果你的训练任务已经跑了三天,进度条走到百分之九十,这两分钟不足以让你保存检查点并优雅退出。你只能眼看着三天的心血蒸发,然后重新出价、重新排队、重新开始。
这个事件暴露了算力交易所的一个根本矛盾。它确实把闲置资源利用起来了,也确实给了预算有限的用户一个低价选项。但它同时制造了一种新的不平等:有钱的公司可以永远出高价,确保自己的任务不被中断;没钱的初创公司只能在价格波动的缝隙里生存,随时面临被驱逐的风险。
这不是技术上的限制——GPU本身完全有能力完成那些被中断的任务——这是计费规则人为制造的门槛。
让我们把这个算力交易所的类比彻底展开。一个传统交易所,比如纽约证券交易所,本身不拥有任何股票。它只是提供一个平台,让买卖双方在上面出价和成交。交易所的收入来自交易费,它的权力来自对交易规则的控制——谁能入场、订单怎么匹配、信息披露有什么要求。
云厂商的计费引擎扮演着完全相同的角色。它不创造算力——算力来自英伟达的芯片——但它控制着算力的交易规则。它决定哪些客户可以预订长期容量、哪些客户只能在现货市场上抢购、价格以什么频率更新、中断通知提前几秒发出。
更关键的是,云厂商同时是交易所的运营方和最大的做市商。做市商在金融市场上的角色是不断报出买入价和卖出价,为市场提供流动性。云厂商也在做同样的事——它用自己的服务器集群制造出源源不断的算力供应,然后把这些供应放到自己运营的市场上交易。它既设定游戏规则,又是游戏里最大的玩家。
这种双重身份意味着,当市场波动对它不利时,它可以调整规则。AWS可以随时改变竞价实例的价格更新频率,可以调整中断通知的提前时间,可以修改预留实例的折扣结构。这些规则调整对客户来说就是成本环境的变化,而客户完全没有投票权。
2018年,AWS推出节省计划,进一步收紧了这套体系。节省计划要求客户承诺未来一年或三年内每小时的最低消费金额——比如每小时10美元——无论实际用不用,这笔钱都要付。作为交换,AWS给这个承诺消费打一个折扣,大约是按需价格的百分之三十到四十。这听起来像是一个省钱的好办法,而且确实如此——只要你对自己的用量预测足够准确。
但它的深层效果是,把客户锁进了一个长期财务承诺里。一旦签了三年的节省计划,你未来三年在AWS上的最低支出就被锁定了。即使市场上出现了更便宜的替代方案,你已经被自己的承诺绑住了手脚。预留实例和节省计划合在一起,构成了云服务层权力运作的第二条法则:不是通过技术锁定,而是通过金融合约锁定。
现在我们可以回答那个贯穿本章的问题了:当算力变成按用量付费的东西,那个电表到底怎么转?答案分三层。
第一层是技术性的计量。云厂商的虚拟化平台实时监控每一个虚拟机的CPU使用时间、GPU占用率、内存消耗、网络流量和磁盘读写次数。这些数据以秒为单位汇总,乘以对应的单价,生成账单。这一层看起来最像传统的电表——你用了多少,付多少钱,天经地义。
第二层是定价策略的分层。按需实例、预留实例、竞价实例、节省计划——这四种模式不是简单的不同价格,而是针对不同客户心理的精密设计。按需实例卖给那些先用再说、需要灵活性的新客户,单价最高但零承诺,把进入门槛压到最低。预留实例卖给那些已经算清楚账的成熟客户,单价中等但需要一年以上承诺,锁定长期预算。竞价实例卖给那些预算紧张、愿意承担中断风险的客户,单价最低但不稳定,把闲置资源变现。节省计划卖给那些愿意被锁定的大客户,折扣最深但承诺最硬,把客户变成固定收入流。
四种模式覆盖了从尝鲜到依赖的全部阶段,每一个阶段都有对应的价格锚点,引导客户沿着这条阶梯一步步走向更深的锁定。
第三层是金融化。竞价实例市场把算力交易变成了一个实时波动的拍卖场。价格不再只反映硬件成本加合理利润,而是纳入了供需预期、时间价值和风险溢价。
这就像电力市场——居民用电是固定价格,但批发市场上的电力价格每五分钟变一次,发电厂和电力公司在那个市场上博弈。云厂商把同样的机制搬到了算力上,只不过那个批发市场的参与者不只是云厂商自己,还包括所有客户。当一个AI初创公司在竞价市场上出价竞拍GPU时间时,它实际上是在和不知道是谁的对手方交易一种叫计算时间的商品。这个商品看不见摸不着,但价格像股票一样跳动。
这三层叠在一起,产生了一个反直觉的结果:控制算力定价权的不再是制造GPU的人,而是设计计费规则的人。英伟达决定一块H100卖多少钱,但云厂商决定租用这块H100一小时多少钱。
前者是一个固定价格,后者是一个包含了几十种变量的价格矩阵——实例类型、区域、承诺期限、市场供需。云厂商在这个矩阵里拥有巨大的自由裁量空间。它可以调整竞价实例的基准价格来影响市场情绪,可以修改预留实例的折扣幅度来吸引特定行业的客户,可以通过免费层策略让初创公司先用起来再慢慢收费。这些操作和芯片层的物理稀缺性完全不在同一个维度上——它们是在抽象层上的权力运作。
这个抽象层才是云厂商真正的技术发明。数据中心本身不是什么新鲜事物——银行、电信公司和大学从大型机时代就在建数据中心。虚拟化技术也不是亚马逊原创——VMware在1998年就成立了,比EC2早了整整八年。
亚马逊做对的事情是,把数据中心、虚拟化和网络服务打包成一个完整的抽象层,在这个层面上,物理硬件被完全隐藏,客户看到的只有API接口、计费仪表板和资源配置页面。你不需要知道你的虚拟机跑在哪个机柜的哪台服务器上,你只需要知道它的实例ID和每小时单价。
这种隐藏不是技术上的偷懒,而是一种刻意的设计选择。一旦物理层被隐藏,客户就失去了对硬件的直接控制权,而云厂商获得了重新定义什么是计算的权力。
一个例子明这种权力的实际效果。当你在AWS上启动一个GPU实例时,你看到的配置选项不是一块H100显卡,而是一个AWS定义的实例型号,配备八块H100 GPU。这个命名把英伟达的产品放进了一个AWS定义的分类框架里。你想用H100?可以,但你必须通过AWS的实例类型来访问它。你没办法绕开AWS直接和那块H100对话——它被封装在AWS的虚拟化层里,驱动、网络配置、安全策略全部由AWS控制。
英伟达制造了芯片,但AWS制造了使用芯片的方式。这种方式的控制权,在某些情况下比芯片本身的控制权更有价值。
2023年,当美国政府收紧对中国的GPU出口管制时,云厂商的反应很有意思。AWS和Azure并没有停止向中国客户提供云服务——它们只是把受管制的GPU实例从中国区域下架了。
但中国客户仍然可以通过在海外区域租用GPU实例来获得算力,只不过延迟更高、合规风险更大。这个缝隙的存在说明,云服务层可以绕过芯片层的物理限制。只要数据中心不在中国境内,美国政府就无法直接阻止中国客户访问那些GPU——至少在法律上存在灰色地带。云厂商在这个灰色地带里的操作空间,就是它们相对于芯片厂商的独立权力来源。
但这套体系并非没有裂缝。回到竞价实例那个两分钟中断通知。对于训练一个需要跑几周的大模型来说,两分钟意味着你几乎不可能在竞价实例上完成任何严肃的工作。你可以设置检查点——每隔几小时保存一次模型权重——但检查点本身需要时间写入存储,两分钟未必够用。如果任务被中断,从最近的检查点恢复,损失的是检查点之后的所有计算。如果中断频繁发生,实际完成的有效计算可能只有按需实例的一半,而节省下来的钱远不足以弥补时间损失。
这就导致了一个尴尬的局面:尽管竞价实例在纸面上便宜得多,但任何对稳定性有要求的任务都不敢用。
训练大模型的公司只能老老实实买按需或预留实例,支付全额溢价。那些真正需要低成本算力的初创公司和学术机构,反而被挡在门外——不是因为买不起GPU时间,而是因为买不起不被中断的GPU时间。
算力交易所的理想是让闲置资源流动起来,惠及更多人;但现实是,闲置资源的质量太差,以至于只有那些最不重要的任务才敢用。这个落差是本章必须诚实面对的问题。
云厂商的计费引擎确实是一个精巧的发明,它把昂贵的硬件切割成了可负担的碎片,让AI创业的门槛从买得起几百万美元的服务器降低到付得起几百美元的云账单。但它制造了一个新的门槛——理解并驾驭这套计费规则本身变成了一个专业技能。大公司可以雇佣专门的云成本优化工程师,他们的全职工作就是在预留实例、节省计划和竞价实例之间寻找最优组合,每年为公司节省数百万美元。小公司雇不起这样的人,只能在默认的按需实例上多付三到五成的冤枉钱。这不是一个技术问题。GPU的算力没有变少,数据中心的电费没有变贵。
这只是计费规则的设计——那些规则在帮助一部分客户省钱的同时,必然让另一部分客户多付钱。就像航空公司的收益管理系统,同一个航班上的乘客付的价格可能相差五倍,区别只在于他们什么时候买票、退改签的灵活性如何、是否愿意接受中转。航空公司不是在卖运输服务,而是在卖座位这个商品的不同版本——靠窗的、过道的、可退改的、不可退改的。云厂商也不是在卖算力,而是在卖GPU时间的不同版本——稳定的、不稳定的、长期的、按秒的。
当算力被这样版本化之后,一个根本性的问题浮现出来:有没有办法绕过这个算力交易所?但我们可以在这里看到一个伏笔正在埋下。
当开源模型社区在2023年初意外获得Meta的LLaMA模型权重后,他们做的第一件事不是去AWS上租GPU来运行它,而是想尽办法让这个模型能在消费级显卡上跑起来。为什么?因为消费级显卡是你自己的硬件,插在你自己的机箱里,不需要看云厂商的计费仪表板。一旦模型能被本地运行,算力交易所的定价权就被绕过去了。
但在那之前,我们得先面对云服务层留给产业链的下一个问题。当最有钱的企业客户——那些每年在云服务上花费数亿美元的公司——发现自己的命脉数据和核心算力都掌握在云厂商手里时,他们开始感到不安。这种不安不是因为云服务不好用,恰恰相反,因为它太好用了,好用到了无法摆脱的地步。2019年,沃尔玛的云计算支出超过12亿美元。摩根大通在同一年宣布投入数十亿美元用于云迁移。这些数字的背后是一个令人不安的计算:如果有一天AWS决定涨价,或者如果亚马逊的零售业务和你成了竞争对手,你怎么办?
记录只到这一步。这个不安已经浮出水面,但还没有变成大规模的行动。那些每年签下数亿美元云服务合同的企业,正在意识到一个尴尬的事实——他们引以为傲的成本优化策略,不过是在别人设计的棋盘上走棋。棋盘本身属于那个设计计费规则的人。