矿工的云 书架

第 12 章 / 共 14 章

第十二章 · 老牌云反扑,大客户自建芯片

两头都想把你挤下桌

前面十一章,我们看着一批新公司——CoreWeave、Lambda、Crusoe、Nebius——从矿工的废墟里爬出来,靠"便宜的电、快盖的机房、会伺候发烫的卡"这三样肌肉,接住了 AI 算力荒这波大水。它们卖的东西很清楚:按集群包断的裸金属超算——不是像老牌云那样把一台大机器切成一堆小虚拟机分租给很多人,而是把成千上万张卡用高速网络连成一台大机器,整台租给你一家用。

这门生意有个前提,是"别人干不了或不愿干"。这一章要问的就是:这个前提还成立多久?因为到 2024、2025 年,压力从上下两个方向同时压过来了。上面是被它们抢了生意的老牌云开始反扑,下面是它们最大的客户自己动手造芯片,想把中间商——既包括英伟达,也包括新云——一起绕开。新云被夹在中间,缝隙还剩多宽?

反扑(上):老牌云把"短板"补上了

回忆一下第二章说的:老牌云当初为什么"不够用"。不是它们没有卡,是它们的架构是为"很多人各租一小块"设计的——超卖、多租户、按虚拟机切。训一个大模型需要几千张卡像一个人的左右手一样毫秒级协同,这种"一台巨型超算"的活儿,老牌云的网络接不住。新云钻的就是这个空子。

但空子是可以补的。补的关键,是网络。

为什么网络是关键?训练大模型时,几千张卡每算一小步就要互相"对答案"(同步梯度)。卡再快,如果卡与卡之间传数据慢、还得绕一圈经过操作系统,整台超算就被这段"堵车"拖垮。谁跑得快,很大程度上取决于卡之间那根"线"有多粗、有多直。

新云用的那根"线",标配是英伟达的 InfiniBand——一种专门为超算设计的高速网络,能让一张卡直接把数据写进另一台机器的卡里,不用惊动操作系统(这叫 RDMA,远程直接内存访问,好比两个人不用打电话找总机转接,直接对讲)。老牌云过去用的是普通以太网,快,但没这么"直"。

现在老牌云做了两件事把短板补上:

这一步一旦走完,新云最锋利的那个卖点——"只有我们能组超算"——就钝了一半。老牌云还带着新云没有的两样东西:一是全套配菜(存储、数据库、安全、结算,客户的数据本来就躺在这里),二是不缺钱、不用拿卡去抵押借债。

反扑(下):大客户自己造芯片,把中间商全绕开

如果说老牌云是从侧面抢生意,那大客户自研芯片,是从下面把整张桌子掀了。

逻辑很简单,是笔算术。英伟达的卡毛利极高——一张顶级卡的售价里,很大一块是英伟达的利润。对一年要花几百亿美元买卡的巨头来说,这块利润就是"英伟达税"。你既然每年要烧这么多,为什么不自己设计一款只干你这一件事的芯片,把这笔税省下来?

于是每个巨头都在造自己的 ASIC(专用集成电路,就是"只为一种活儿定制、不通用但更省"的芯片,跟英伟达那种什么都能算的通用 GPU 相对):

这里对新云的杀伤在哪?新云的全部生意,是站在"英伟达的卡"和"要用卡的大客户"中间,替客户把卡组好、养好、租出去。可如果大客户改用自己造的芯片,那这条链上,英伟达和新云一起被跳过了——芯片是我自己设计的,机房是我自己建的(第十章说过,电和机房本来就是巨头在抢),我为什么还要向你租?

换句话说:老牌云的反扑,是在"抢新云现有客户的续约";大客户自研芯片,是在"从源头上让这类租赁需求变少"。前者动的是市场份额,后者动的是市场本身。

那么,缝隙还剩多宽?

被上下同时挤,新云是不是就没活路了?没那么快。缝隙确实在变窄,但还有几条真实的、短期内堵不上的缝。

第一条缝:速度。 从"决定要建"到"卡能开机跑训练",新云往往比老牌云快好几个月。原因就是它们的矿工基因——盖机房、通电、装机、让发烫的卡稳定跑,这套体力活它们干了很多年。在算力荒里,早三个月拿到几千张卡,可能就是一个模型抢不抢得到发布窗口的差别。老牌云补网络能补,但它内部流程重、要排队,"快"这件事最难学。

第二条缝:专注。 新云只干一件事——把 GPU 集群租好。它不会像老牌云那样,把最好的卡优先留给自己的战略客户或自家 AI 部门。对一个"我只要卡、别的都不要、也不想跟一个可能变成对手的平台绑死"的客户来说,一个纯粹的中立卖家反而更让人放心。谷歌的 TPU 你只能在谷歌云用;英伟达的卡,新云谁都卖。

第三条缝,也是最微妙的一条:新云愿意背老牌云不愿背的债和折旧风险。

这话要拆开讲。买卡要先掏一大笔现金,而卡会飞快贬值(第八章那颗折旧炸弹:A100→H100→H200→B200,一两年一代,旧卡迅速不值钱)。谁来承担"先垫钱、再赌它两三年内还租得出去"的风险?
老牌云上市公司,被华尔街盯着利润率,不愿把资产负债表塞满这种快贬值、还得靠单一大客户长约撑着的资产。新云愿意——它拿卡去抵押借债(第六章的 GPU 抵押贷款),用 take-or-pay 长约(客户不用也得付钱)去对冲,把这份"脏活、险活"接下来。

说白了,新云在这条食物链上扮演的,越来越像一个专门替大厂承接算力风险的金融+运营外包商。微软自己也在建集群、也在造 Maia,但它同时还大手笔向 CoreWeave 采购——因为让别人先背着债、背着折旧、背着"万一租不出去"的风险替它扩产能,比什么都装进自己账上更划算。这恰恰说明,即便有能力自建的巨头,短期内也还需要有人来干这份脏活。

但这三条缝,没有一条是护城河,只是暂时的时间差。速度优势会随着老牌云流程成熟而缩小;中立性在客户越来越少、越来越大之后价值下降;而"愿意背债背折旧"——这既是新云的活路,也是它的命门。它接得住风险,是因为算力还在涨、卡还租得出去;一旦推理时代把规则改了(第十一章),或者大客户自研芯片真的替下一大块需求,那些抵押着卡借来的债、那些押注"六年折旧"的资产,就会从"聪明的杠杆"变成"塌方的第一块砖"。

所以这一章的结论不是"新云要死了",也不是"新云高枕无忧",而是:新云的生存空间,正好等于老牌云的官僚迟缓、加上大客户的耐心不足、再加上它自己愿意扛的那份风险。 这三样都在变。谁能在缝隙合拢之前,把自己从"赌卡的二房东"变成"别人离不开的基础设施",谁才有资格进入下一章——我们要开始拆解:到底谁能活下来,活好的条件是什么。

矿工的云 · sissi
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校