两头都想把你挤下桌
前面十一章,我们看着一批新公司——CoreWeave、Lambda、Crusoe、Nebius——从矿工的废墟里爬出来,靠"便宜的电、快盖的机房、会伺候发烫的卡"这三样肌肉,接住了 AI 算力荒这波大水。它们卖的东西很清楚:按集群包断的裸金属超算——不是像老牌云那样把一台大机器切成一堆小虚拟机分租给很多人,而是把成千上万张卡用高速网络连成一台大机器,整台租给你一家用。
这门生意有个前提,是"别人干不了或不愿干"。这一章要问的就是:这个前提还成立多久?因为到 2024、2025 年,压力从上下两个方向同时压过来了。上面是被它们抢了生意的老牌云开始反扑,下面是它们最大的客户自己动手造芯片,想把中间商——既包括英伟达,也包括新云——一起绕开。新云被夹在中间,缝隙还剩多宽?
反扑(上):老牌云把"短板"补上了
回忆一下第二章说的:老牌云当初为什么"不够用"。不是它们没有卡,是它们的架构是为"很多人各租一小块"设计的——超卖、多租户、按虚拟机切。训一个大模型需要几千张卡像一个人的左右手一样毫秒级协同,这种"一台巨型超算"的活儿,老牌云的网络接不住。新云钻的就是这个空子。
但空子是可以补的。补的关键,是网络。
为什么网络是关键?训练大模型时,几千张卡每算一小步就要互相"对答案"(同步梯度)。卡再快,如果卡与卡之间传数据慢、还得绕一圈经过操作系统,整台超算就被这段"堵车"拖垮。谁跑得快,很大程度上取决于卡之间那根"线"有多粗、有多直。
新云用的那根"线",标配是英伟达的 InfiniBand——一种专门为超算设计的高速网络,能让一张卡直接把数据写进另一台机器的卡里,不用惊动操作系统(这叫 RDMA,远程直接内存访问,好比两个人不用打电话找总机转接,直接对讲)。老牌云过去用的是普通以太网,快,但没这么"直"。
现在老牌云做了两件事把短板补上:
- 要么买英伟达的方案。微软就大量采购英伟达的卡和 InfiniBand,直接搭出跟新云一样规格的集群。它自己是全球最大买家之一,供应链上未必比 CoreWeave 差——事实上 CoreWeave 六成多的收入来自微软,某种程度上微软是"用别人的手先建,自己再补建"。
- 要么自研一套等效的网络。AWS 做的是 EFA(Elastic Fabric Adapter,弹性网络适配器)——它不用英伟达的 InfiniBand,而是在普通以太网上自研了一套底层协议(叫 SRD),同样能做到"绕过操作系统直接传",还能同时走多条路径。把 EFA 堆起来,就是 AWS 的 UltraCluster——一坨几万张卡连成一台超算。它诚实地说:纯性能上 EFA 还略逊于英伟达原生 InfiniBand。但对很多客户,"够用 + 就在我已经在用的 AWS 里 + 数据不用搬"这三条加起来,比"快那么一点点"更值钱。
这一步一旦走完,新云最锋利的那个卖点——"只有我们能组超算"——就钝了一半。老牌云还带着新云没有的两样东西:一是全套配菜(存储、数据库、安全、结算,客户的数据本来就躺在这里),二是不缺钱、不用拿卡去抵押借债。
反扑(下):大客户自己造芯片,把中间商全绕开
如果说老牌云是从侧面抢生意,那大客户自研芯片,是从下面把整张桌子掀了。
逻辑很简单,是笔算术。英伟达的卡毛利极高——一张顶级卡的售价里,很大一块是英伟达的利润。对一年要花几百亿美元买卡的巨头来说,这块利润就是"英伟达税"。你既然每年要烧这么多,为什么不自己设计一款只干你这一件事的芯片,把这笔税省下来?
于是每个巨头都在造自己的 ASIC(专用集成电路,就是"只为一种活儿定制、不通用但更省"的芯片,跟英伟达那种什么都能算的通用 GPU 相对):
- 谷歌 TPU——起步最早,2015 年就有第一代,如今已到第七代(Ironwood)。谷歌自家的模型很多就跑在 TPU 上,等于自己给自己供卡。
- 亚马逊 Trainium / Inferentia——一个管训练、一个管推理(就是"用模型")。到 2025 年底,AWS 说自己已经部署了超过一百万颗 Trainium。
- 微软 Maia——2024 年出 Maia 100,之后有 Maia 200。不过微软自己也承认,到 2025 年底大约七成的 Azure AI 负载还跑在英伟达卡上,自研是在"逐步替换",不是一夜换血。
- OpenAI 联手博通自研芯片——连最大的模型公司,都想有一条不完全依赖英伟达的后路。博通(Broadcom)是这波"帮大厂设计定制芯片"的隐形赢家。
这里对新云的杀伤在哪?新云的全部生意,是站在"英伟达的卡"和"要用卡的大客户"中间,替客户把卡组好、养好、租出去。可如果大客户改用自己造的芯片,那这条链上,英伟达和新云一起被跳过了——芯片是我自己设计的,机房是我自己建的(第十章说过,电和机房本来就是巨头在抢),我为什么还要向你租?
换句话说:老牌云的反扑,是在"抢新云现有客户的续约";大客户自研芯片,是在"从源头上让这类租赁需求变少"。前者动的是市场份额,后者动的是市场本身。
那么,缝隙还剩多宽?
被上下同时挤,新云是不是就没活路了?没那么快。缝隙确实在变窄,但还有几条真实的、短期内堵不上的缝。
第一条缝:速度。 从"决定要建"到"卡能开机跑训练",新云往往比老牌云快好几个月。原因就是它们的矿工基因——盖机房、通电、装机、让发烫的卡稳定跑,这套体力活它们干了很多年。在算力荒里,早三个月拿到几千张卡,可能就是一个模型抢不抢得到发布窗口的差别。老牌云补网络能补,但它内部流程重、要排队,"快"这件事最难学。
第二条缝:专注。 新云只干一件事——把 GPU 集群租好。它不会像老牌云那样,把最好的卡优先留给自己的战略客户或自家 AI 部门。对一个"我只要卡、别的都不要、也不想跟一个可能变成对手的平台绑死"的客户来说,一个纯粹的中立卖家反而更让人放心。谷歌的 TPU 你只能在谷歌云用;英伟达的卡,新云谁都卖。
第三条缝,也是最微妙的一条:新云愿意背老牌云不愿背的债和折旧风险。
这话要拆开讲。买卡要先掏一大笔现金,而卡会飞快贬值(第八章那颗折旧炸弹:A100→H100→H200→B200,一两年一代,旧卡迅速不值钱)。谁来承担"先垫钱、再赌它两三年内还租得出去"的风险?
老牌云上市公司,被华尔街盯着利润率,不愿把资产负债表塞满这种快贬值、还得靠单一大客户长约撑着的资产。新云愿意——它拿卡去抵押借债(第六章的 GPU 抵押贷款),用 take-or-pay 长约(客户不用也得付钱)去对冲,把这份"脏活、险活"接下来。
说白了,新云在这条食物链上扮演的,越来越像一个专门替大厂承接算力风险的金融+运营外包商。微软自己也在建集群、也在造 Maia,但它同时还大手笔向 CoreWeave 采购——因为让别人先背着债、背着折旧、背着"万一租不出去"的风险替它扩产能,比什么都装进自己账上更划算。这恰恰说明,即便有能力自建的巨头,短期内也还需要有人来干这份脏活。
但这三条缝,没有一条是护城河,只是暂时的时间差。速度优势会随着老牌云流程成熟而缩小;中立性在客户越来越少、越来越大之后价值下降;而"愿意背债背折旧"——这既是新云的活路,也是它的命门。它接得住风险,是因为算力还在涨、卡还租得出去;一旦推理时代把规则改了(第十一章),或者大客户自研芯片真的替下一大块需求,那些抵押着卡借来的债、那些押注"六年折旧"的资产,就会从"聪明的杠杆"变成"塌方的第一块砖"。
所以这一章的结论不是"新云要死了",也不是"新云高枕无忧",而是:新云的生存空间,正好等于老牌云的官僚迟缓、加上大客户的耐心不足、再加上它自己愿意扛的那份风险。 这三样都在变。谁能在缝隙合拢之前,把自己从"赌卡的二房东"变成"别人离不开的基础设施",谁才有资格进入下一章——我们要开始拆解:到底谁能活下来,活好的条件是什么。