矿工的云 书架

第 01 章 / 共 14 章

第一章 · 算力荒是怎么烧起来的

先讲一个很具体的场景,这是这两年真实发生在成百上千家公司身上的事。

假设你在一家 AI 创业公司,手里有一个不错的想法:训练一个自己的大模型。你算了算,需要大概一千张最新的 GPU,连续跑上两三个月。你打开亚马逊的云、微软的云、谷歌的云,准备像过去十年租服务器那样——填张信用卡,点几下,机器就到手。

然后你撞墙了。页面上写着"该机型当前不可用"。你打电话给销售,对方很客气,告诉你排队吧。排多久?"目前的交付周期大概……十一个月。"你以为听错了。你要的不是明年的算力,是现在就要训的模型,竞争对手可能下个月就发布了。

这不是段子。2023 年,最抢手的那款卡H100——英伟达当时最强的 AI 训练芯片,一张卡官方定价三四万美元——从下单到拿货,等待时间一度长达十一个月,也就是五十多周。就算你不买、只想按小时租,市场上的租金从早期约每小时 4.7 美元一路被抢到 8 美元以上,还经常无货。整个行业进入了一种奇怪的状态:钱不是问题,卡才是问题。

说人话:过去你缺的是钱,有钱就能买到算力。现在反过来了——你有钱,甚至有很多钱,却买不到、租不到、排不上队。算力从"随时能买的日用品"变成了"要托关系、要排长队的稀缺品"。

为什么会突然缺成这样

要理解这场"算力荒",得先弄清一件事:GPU 这东西,需求不是慢慢涨上来的,是在两年里像按了指数键一样炸上来的。

先解释一下这里的两个词。GPU本来叫"图形处理器",是显卡里那块芯片,最早是给游戏画面做渲染用的。它的特点是:不擅长一件一件按顺序办复杂的事,但极其擅长同时办成千上万件简单的事——比如同时算屏幕上几百万个像素点的颜色。后来人们发现,训练神经网络恰好也是这种活:本质上就是海量的乘法和加法一起做。于是这块"游戏芯片"被拉来当了 AI 的主力。

训练大模型是什么意思?粗糙地说,就是拿一大堆文本(比如大半个互联网),让一个有几千亿个参数的数学模型反复读、反复猜下一个词、猜错了就微调参数,重复几万亿次,直到它能像模像样地说话。这个"反复调"的过程,就是天文数字级别的乘加运算,正好喂给 GPU。参数越多、数据越多,需要的算力就越大——而且不是线性变大,是成倍成倍地翻。

导火索:ChatGPT

2022 年 11 月,OpenAI 放出了 ChatGPT。这件事的意义不在技术本身有多惊天,而在于它第一次让普通人、也让每一个企业老板亲眼看到:原来大模型能干这么多活。于是几乎所有科技公司在同一时间做了同一个决定——我也要有一个。

问题在于"同一时间"这四个字。如果需求是错峰的,供应链还能慢慢跟上。但当谷歌、Meta、微软、还有几百家创业公司在同一个季度、抢同一款芯片时,供给方英伟达就算火力全开也来不及。芯片不是软件,不能复制粘贴——它要经过晶圆厂排产、封装、测试,一整条链条上任何一环都不是几周能扩出来的。需求瞬间跳了一个数量级,产能却只能按年爬坡,中间的缺口就是那十一个月的排队。

这个跳跃有多大,看供货方的账本最清楚。英伟达数据中心业务(就是卖这些 AI 芯片的部门)的收入,2023 财年大约 150 亿美元,到 2024 财年跳到 475 亿美元,一年涨了两倍多。更夸张的是把这一年拆到季度看:2024 财年第四季度(也就是 2023 年底那个季度),光这一个季度的数据中心收入就有 184 亿美元,同比涨了 409%——去年同期还只是它的五分之一。前面那个"一年翻两倍多"的年度数字,正是被这样一个个像坐火箭的季度拱起来的。一家几百亿美元体量的成熟公司,收入能在一年里翻两倍还多,这在商业史上极其罕见——它不是被"用户慢慢变多"推起来的,是被一场集体性的、突然爆发的抢购推起来的。

打个比方:这就像全城的人在同一个周末决定都要装空调。空调厂再拼命也造不出这么多,于是价格飞涨、排队几个月、黄牛出现。GPU 荒就是这么个逻辑,只不过"空调"是几万美元一张、还得几千张连一起用的顶级芯片。

为什么需求还在往上翻

更麻烦的是,这场抢购不是一波性的,它自己会往上叠。有几股力量在同时推:

三股力量叠在一起,需求曲线就变成了一条陡峭的、几乎立起来的线。而芯片产能是一条平缓向上的斜线。两条线之间那块越裂越大的空白,就是"算力荒"这三个字的全部含义。

荒里裂开的那道缝

现在回到开头那家 AI 公司。它排不上队,不只是因为芯片总量不够,还有一个更微妙的原因:老牌云手里就算有卡,也未必愿意、未必能痛快地整块租给它。

这里先埋个引子,具体的原因留到后面几章展开。你可以先记住一个反直觉的事实:亚马逊、微软、谷歌这些云巨头,是过去二十年为"千千万万个小租户跑网站"这件事精心设计出来的。它们的整套架构——把一台大机器切成很多小份、同一台机器上塞很多客户、按虚拟机计费——在服务无数个小客户时无比高效。但当你要的是几千张卡紧密连成一台超级计算机、连续几个月独占着跑一个训练任务时,这套为"切碎"而生的架构反而变得慢、变得贵、变得别扭。

再打个比方:老牌云像一栋精装修的公寓楼,一间间隔好、水电齐全,适合成千上万个租客各住一间。可你现在要办的是一场需要整栋楼打通、还得在楼里拉满高速传送带的大型工厂生产。你去租公寓,房东要么没有这么大的连片空间,要么给你的报价贵到离谱、交付慢到离谱。

于是市场上同时出现了两个缺口:一边是芯片本身不够,另一边是就算有芯片,把它们高效地组织成一台大机器、按整块租出去的这门生意,老牌云没准备好做

凡是有又大又急的需求、而现有玩家填不满的地方,就一定会有新玩家闻着味冲进来。这本书要讲的主角——那批被叫作新云(也叫 GPU 专用云,英文 neocloud)的公司,专门只干"把成千上万张 GPU 组装成超级计算机、整块租给你训模型"这一件事——正是从这道缝里冒出来的。而其中最出名的一家,出身居然是加密货币矿工。

它们凭什么接得住这波?为什么偏偏是矿工?借来的卡和电,又能不能撑过芯片飞快贬值的那几年?这些,是后面章节要一层层拆开的问题。但故事的起点,就是本章这道越裂越大的缺口:需求在两年里指数式炸开,供给却只能按年慢慢爬——中间那块空白,等着被人填。

矿工的云 · sissi
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校