收租之王,负债上牌桌 书架

第 06 章 / 共 16 章

第六章 · AI 把赌注放大十倍

把上一章的画面接过来:甲骨文花了十年,赌了一件当时看起来有点固执的事——它不去租别人的机房,而是自己盖,还盖成一种别人不太理解的样子:机器与机器之间用超高带宽的网络扁平地连在一起,任意两台之间几乎是「直线距离」。在 2019 年那会儿,你要问这有什么用,答案有点尴尬:绝大多数生意其实用不上。跑个网站、开个数据库、算算报表,机器之间根本不需要那么快地互相说话。甲骨文像是修了一条八车道的高速公路,通往一个只有几辆车的小镇。

然后 AI 来了。突然之间,小镇变成了要疏散的百万人口城市,而全世界只有几条八车道公路。这一章讲的就是:为什么训练大模型这件事,恰好是那种「机器必须疯狂地互相说话」的活儿,为什么它把甲骨文原本冷门的长处变成了稀缺资源,以及为什么赌注会因此从「百亿」这个量级,一脚踩到「千亿」。

为什么训练大模型,是一件「机器必须互相说话」的事

先说清楚训练一个大模型到底在干嘛。你可以把它想成:有一个上万亿个数字组成的巨大参数表(就是模型的「大脑」),你不断喂给它文本,让它猜下一个词,猜错了就把这上万亿个数字往「猜得更对」的方向轻轻推一下。这个「推一下」要重复几百万、几千万次。

问题是,这个大脑太大了,装不进一块 GPU(图形处理器,本来是给游戏算画面的芯片,因为特别擅长同时做海量简单乘加,被拿来算神经网络)。一块顶级 GPU 的高速显存也就几十到一两百 GB,而一个前沿模型的参数、加上训练时要临时存的中间结果,动辄需要几百上千块 GPU 的显存加起来才装得下。

于是你被迫把一个大脑拆开,摊在成千上万块 GPU 上。麻烦就在这:这些 GPU 不是各干各的,它们算的是同一个大脑的不同部分。每走完一步,它们必须把各自算出来的梯度(那个「往哪个方向推」的信息)互相同步一遍,凑成一个完整的更新,然后才能走下一步。

打个比方。一万个人合抄一本上万亿字的账本,每人负责一小段。抄完一页,所有人必须停下来,把这一页每个数字的修改互相通报、对齐,确认大家改的是同一个版本,才能翻到下一页。如果通报环节慢,那一万个人抄字的手速再快也没用——大家都在干等着对账。训练大模型就是这样:算得快不算本事,对账(GPU 之间的通信)不能慢,才是本事。

这就是关键的因果:GPU 越多,算力越强,但「对账」的负担也越重。如果 GPU 之间的网络不够快,你多插的那些 GPU 大部分时间都在空等通信,白白烧电。业内管这个叫 GPU 被网络「饿死」。所以训练集群不是 GPU 越多越好,而是 GPU 加上把它们连起来的网络,共同决定了你能不能真的组成一台「超级计算机」

把上万块 GPU 连成「一台机器」,难在哪

让 GPU 互相说话,有两个层次。

第一层是一台服务器机箱内部的几块(通常八块)GPU,靠一种叫 NVLink 的专用高速通道直连——这个 Nvidia 已经帮你解决了,箱子内部的八块 GPU 之间快得像一块。

第二层才是难点:机箱和机箱之间、机架和机架之间,成百上千个箱子怎么连。这里用的是 RDMA(远程直接内存访问)——它的意思是,一台机器可以直接读写另一台机器的内存,不用惊动对方的 CPU 和操作系统去中转。普通网络传数据像寄快递:打包、贴单、进分拣中心、CPU 一层层拆封;RDMA 像在两台机器的内存之间打通一根直达管道,数据自己流过去,延迟低、还不占用 CPU。承载它的物理网络,通常是 InfiniBand(一种专为高性能计算设计的超高速网络,带宽和延迟都远好于普通以太网),或者是特意调校过、能跑 RDMA 的高端以太网。

但光有好网卡不够。真正决定成败的是整个机房的网络拓扑——也就是这几万个端口是按什么结构连起来的。这里有个残酷的物理事实:距离和层级都要收费。两台 GPU 如果只隔一个交换机,通信快;如果信号要往上爬三四层交换机、横穿半个机房再下来,延迟和拥塞就上来了。当一万块 GPU 每一步都要全体对账时,那个最慢的、绕最远的路径,会拖累所有人——木桶效应,短板是那根最长的网线。

所以「把一万块 GPU 连成一台超级计算机」,真正的工程活儿不是买 GPU,而是:设计一种网络结构,让任意两块 GPU 之间都尽量「近」、都有足够宽的路、还不会在全体同时对账时堵成一锅粥。这活儿必须在盖机房、拉线、排机架的时候就想好——事后是改不动的。

现在回头看第五章讲的甲骨文那套「off-box 虚拟化、扁平高带宽网络、RDMA 集群」的第二代 OCI,你会发现一件事:它当年为「高性能计算」这个冷门小众市场设计的东西,几乎就是照着 AI 训练的需求提前长出来的。扁平、高带宽、任意两点都近、原生支持 RDMA——这不是甲骨文预见了 AI,而是它为了别的原因修的八车道公路,恰好通向了这座突然爆发的城市。这在商业史上有个朴素的名字:运气,但是修在了实力之上的运气。你得先真的把公路修好,运气来了才接得住。

为什么赌注从「百亿」跳到「千亿」

理解了上面这些,赌注的量级跳变就顺理成章了。

过去甲骨文(和别的云)扩容,是「需求涨一点,加一点机器」——线性的、可控的,一年资本开支在百亿美元量级。但 AI 训练客户的胃口不是这么涨的。一个前沿实验室来谈,开口就是「我要几万块、甚至十几万块最新 GPU 连成的集群,而且我要签好几年」。这不是加几台机器,这是要你专门为它盖一整片、甚至好几片数据中心园区。

这里要引入这几年最能代表这种量级的名字。Stargate(星际之门)是 OpenAI 牵头、联合软银、甲骨文等方推动的超大规模 AI 基础设施计划,公开口径是要在数年内投入数千亿美元、在美国多地建设专供 AI 的巨型数据中心园区。而甲骨文与 OpenAI(做出 ChatGPT 的那家 AI 公司)之间,据多方报道签下了量级达数千亿美元、跨越数年的算力合同——具体数字随报道口径浮动,但公认在「数千亿美元级」这个量级,是软件行业闻所未闻的单笔体量。

翻译成人话:以前甲骨文接的是「租几千台机器」的订单,现在接的是「请你从零盖一座发电厂规模的算力工厂,专门供我一家用几年」的订单。订单的单位从「机架」变成了「园区」,从「季度」变成了「数年」,钱的量级自然从百亿跳到千亿。不是甲骨文突然变激进,是客户的需求本身跳了一个数量级,逼着供给方也跳一个数量级。

为什么偏偏轮到甲骨文接这种单?把因果串起来就清楚了:训练前沿模型需要「几万块 GPU 用 RDMA 连成一台超级计算机」这种极端形态的算力;能把这种集群盖得又快又扁平又不「饿死」GPU 的供给方,本来就没几家;甲骨文恰好有一套为高带宽负载而生的自建机房设计,还有一支敢在资产负债表上压重注、执行力凶悍的班子。于是那些天量算力合同,有很大一部分落到了它头上。OCI 就这样从第四章里那个「起步太晚的追赶者」,被 AI 浪潮一把推到了「AI 算力主要供应方之一」的位置。

把这一章钉住:主角是怎么换的

我们从头捋一遍这条因果链,因为它是理解后面所有财务争议的地基:

但请记住,这一章讲的全是「机会」这一面:需求为什么爆、长处为什么值钱、订单为什么这么大。它把甲骨文推上了牌桌,也把赌注推到了一个前所未有的高度。而牌桌的另一面——为了盖这些千亿级园区,钱要从哪里借、资产负债表要承受什么、这些天量订单里有多少是真金白银、又有多少只是「已签未交付」的一串数字——那才是这本书真正要拆的账。

下一章,我们就从那个突然冲上约 4550 亿美元、让埃里森短暂登顶世界首富的数字开始:RPO 到底是什么,为什么一夜暴涨,它离你口袋里的现金又有多远。

收租之王,负债上牌桌 · sissi
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校