前面十章讲的新云,几乎全是围着一件事转:训练。把几千张卡用高速网线捆成一台超级计算机,连续跑上几周甚至几个月,把一个大模型从零"喂"出来。这活儿有个特点——它是脉冲式的。像放烟花:憋很久,猛地一炸,炸完就熄火。GPT 这种级别的模型,一次训练可能占满上万张卡跑三四个月,训完了,这批卡的这个任务就结束了。
但模型训出来只是开始。真正每天在用它的,是另一件事——推理,也就是"用模型":你打字问它一句话、它吐一段回答,这个"读进来、算一遍、给结果"的过程就是推理。训练是把知识灌进模型这颗大脑,推理是让这颗大脑真的去回答问题。
打个比方:训练像盖一座图书馆——工程浩大,一次性,盖完就完事;推理像图书馆开门营业——每天有人进来借书、查资料,源源不断,只要还有人用,就永远不能关门。前者是脉冲,后者是心跳。
这一章要讲的,就是当整个行业的重心从"盖图书馆"慢慢挪到"图书馆天天营业",新云那套按大集群包断的卖法,会被逼着改成什么样。
为什么推理会盖过训练
逻辑其实很朴素。一个模型只训练一次(或者隔一阵子重训一次),但它一旦上线,可能被几亿人、每天几十亿次地调用。训练的账是"总共花多少卡时",推理的账是"每天要伺候多少次请求乘以永远"。时间一拉长,后者的总量必然远远压过前者。
行业里的普遍判断是:推理需求会在 2026 年前后超过训练需求,到 2030 年,推理可能要占掉新云这块市场的八成左右。这不是说训练不重要了,而是说钱和卡的大头正在从"炸烟花"那一侧,慢慢倒向"心跳"这一侧。
2025 年还冒出一个把这件事踩了油门的东西:推理模型(reasoning model,指会先在心里"想一长串草稿"再给答案的模型,比如做数学、写代码时一步步推演)。老式模型问一句答一句,吐几十个字就完;推理模型为了想清楚,会在内部生成成百上千个中间 token(模型处理文字的最小单位,约等于一个词或半个词)——用户看不到这些草稿,但每一个草稿字都实打实地烧了算力。同样一个问题,推理模型消耗的算力可能是老模型的十倍甚至几十倍。于是"用模型"这件事本身,从一件轻活变成了重活。
推理看重的东西,和训练完全不一样
训练关心的是"总吞吐"——几千张卡能不能协同一致地、不掉链子地连跑几个月,网络够不够快、别让某张卡拖后腿。推理换了一套完全不同的三条标准:
一、单位算力成本,要抠到每一个 token
训练是一锤子买卖,贵点也就那一下。推理是永远在跑的成本,哪怕每次便宜一分钱,乘以每天几十亿次,就是天文数字。所以推理场里大家死磕的是每百万 token 成本(跑一百万个字大概要花多少钱)。这里有个反直觉的地方:省钱主要不是靠换更贵的卡,而是靠连续批处理(continuous batching,把很多用户的请求塞进同一批一起算,别让 GPU 空等)。一张卡如果一次只伺候一个人,利用率可能不到两成;把请求攒起来一起喂,利用率能拉到七成以上,等于同样的硬件、同样的电,每个 token 的成本直接砍掉三到四倍。
就像开长途大巴:只拉一个乘客也得烧一整箱油,坐满 50 个人也是烧那一箱油。推理的省钱之道,就是想尽办法"把车坐满"再发车——但又不能让先上车的乘客等太久。这就引出了第二条。
二、延迟,要低,要稳
训练没人催——反正跑几个月,早一小时晚一小时无所谓。推理是人在屏幕前等着的。这里有个关键指标叫 TTFT(time to first token,从你按下回车到第一个字蹦出来的时间)。人对"卡顿"极其敏感:几十毫秒感觉是"秒回",几百毫秒就开始觉得"这玩意儿有点笨"。
而延迟里有很大一块是物理定律决定的,钱买不动:光信号在光纤里跑一个来回,隔着一个大陆就是几十毫秒的硬底,再快的卡也压不下去。所以想让用户觉得"快",机房就得离用户近。这跟训练的逻辑正好拧着来——训练巴不得把上万张卡塞进同一个大厂房好让网线短、协同快;推理却想把卡撒开,撒到离用户近的一个个城市边上去。
三、弹性伸缩,跟着人潮走
推理的负载是随人走的:白天忙、深夜闲,某个 App 一上热搜请求量能瞬间翻十倍。训练是一条平稳的直线跑到底,推理是一条起起伏伏的心电图。这意味着新云不能再只会"把一整个集群整块租给你三年",还得会"你要几张就给几张,用完就还,忙起来两分钟给你扩出来"。
这对新云是机会,也是一记正拳
先说机会,而且是天大的机会。训练是脉冲,客户就那么几家巨头,训完这一轮下一轮不知在何时——这正是前面几章讲的需求不稳、客户集中的病根。推理不一样:它是心跳,只要模型还在被用,收入就日复一日地进来,需求更大、更持久、更分散到成千上万家企业。对一家背着几十亿美元 GPU 贷款、天天担心卡闲置的新云来说,一条稳定的心跳线,比一次性的大烟花值钱得多。
CoreWeave 这类公司也确实在往这边转,喊出"全面押注推理"。它财报里有个衡量"生意储备"的数字叫 revenue backlog(合同总储备,指客户已经签了约、但还没兑现的未来收入总额,其中一部分记作 RPO——remaining performance obligations,剩余履约义务,也就是明确写进合同、还没确认的收入),到 2025 年底累计冲到了约 668 亿美元,而一年前(2024 年底)这个数才约 151 亿美元——一年里多了五百多亿。这里面越来越多是长期的、跟着"用模型"走的持续合约,而不只是"训一把模型"的一次性大单。
换个更严格的口径也一样吓人:光算 RPO(写死进合同、还没确认的那部分收入),2025 年底约 607 亿美元,一年前约 151 亿美元,一年涨了四百多亿。不管用哪个口径,方向都一个——储备在暴涨,而且越来越偏向"持续在用"的合约。
但同一件事,反过来看就是一记正拳打在脸上。
第一,推理逼着新云把机房撒开。训练时代它们的看家本事是"在一个有几百兆瓦电的地方,盖一座超大机房,塞满卡"——就是前一章说的,拼电、拼盖楼速度。可推理要的是"在几十个城市边上各放一小片卡",这是一套完全不同的活儿:要更多、更小、更分散的据点,运维复杂度、网络协调、库存管理全部上一个台阶。矿工的老本行(便宜电、快速盖大厂房)在这里未必再是绝对优势。
第二,也是更要命的——推理是老牌云的主场,新云要正面撞上去了。回想第二章:AWS、Azure、GCP 那套按虚拟机切、多租户、遍布全球几十个区域的架构,训练时嫌它别扭,但拿来做推理简直是天造地设:机房本来就离用户近,弹性伸缩本来就是它们几十年的看家功夫,一个客户忽然要多要少,它们眼都不眨。新云靠着"能把上万张卡捆成超算"这个独门绝技,在训练这块开辟了根据地;可一旦战场移到推理,它们冲进的是巨头经营了二十年的城墙内侧。
一句话总结这一章的紧张感:新云是靠"训练"这场脉冲战成名的——大集群、包断、拼电拼卡。可未来更大、更持久的钱在"推理"这场持久战里,而推理要的是分散、低延迟、弹性伸缩,恰恰是老牌云最熟、新云最生的地形。能不能把自己从"卖超级计算机的"改造成"卖永远在跑的心跳的",是决定它们能不能活过折旧的又一道关口。
这里还埋着一个和第八章折旧那颗定时炸弹相扣的伏笔:推理对卡的要求,往往没训练那么极致。训练非要最新、最快、显存最大的旗舰卡不可;而推理,一张上一代的卡,配合"把车坐满"的连续批处理,单位成本反而可能更划算。这意味着那些被新一代碾压、按训练标准该"退役"的老卡,也许能在推理这条心跳线上找到第二份工作——这既是给折旧焦虑的一剂缓药,也让人重新去想:一张 GPU 的"一生",到底该怎么算折旧、怎么榨干最后一点价值。这个问题,会在后面几章里继续追下去。