大模型的账本 书架

第 03 章 / 共 11 章

第三章 · 一座每天都在贬值的电厂

上一章看了钱从哪进来。这一章翻开账本的另一页:钱花到哪去。大模型公司的成本结构里藏着这门生意最反直觉的部分——它看起来像软件公司,其实资产负债表像重工业。

两笔完全不同的钱:训练和推理

所有算力开销可以分成两类,它们的性格完全不同:

训练(training):教模型学会本领的过程。把互联网上能找到的文本喂给它,让几万台机器连轴转几个月,调整模型内部几千亿个参数(可以粗略理解为模型「大脑」里可被拧动的旋钮数量),直到它预测下一个词的准确率高到够用。一次前沿模型的训练,2025 年以后的公开估算普遍在数亿到数十亿美元一次。

推理(inference):模型学成之后,实际回答每一个用户问题的过程。你每问一次,机器就要真跑一遍。2026 年 OpenAI 光推理一项的年开销就被估算在 140 亿美元量级——注意,这不是建未来的产能,只是伺候好眼下的用户。

训练像制药公司研发新药:一次临床试验几个亿美金砸下去,成了就有一款药,败了就归零——而且新药专利还没到期,竞品可能已经比你好了。推理像药厂的生产线:每卖出一粒药都要真花成本。大模型公司难就难在,它同时背着这两种成本里最贵的版本。

基建的规模:数字大到失去直觉

先看几个 2025 到 2026 年的真实合同,感受一下量级:

这不是「互联网公司的机房大一点」的问题,这是人类历史上最快的基建狂潮之一——上一章的读者此刻应该追问:好,厂房建了就建了,传统电厂也这么建,问题在哪?

问题在折旧:一台每天都在贬值的印钞机

传统电厂的机组能用三四十年,成本摊到漫长的寿命里,每年薄薄一层。AI 数据中心里的核心资产 GPU 不一样:它是人类历史上性能进步最快的工业品,新一代芯片一出来,老芯片的「每度电产出」立刻相形见绌。

这里有一场 2025 年底吵得沸沸扬扬的会计之争。空方代表(比如因预测 2008 年次贷危机出名的 Michael Burry)指控:大型云厂商把 GPU 按 5 到 6 年折旧——即假设一台芯片能体面地干满六七年——从而把成本摊薄、把当期利润做高;而实际上,AI 芯片两三年后在新任务上就明显落伍,真实经济寿命可能只有 3 年左右。如果按 3 年重算,这些公司的利润会明显缩水。

多方反驳:老芯片不会报废,只是降级——跑不了最前沿的训练,还能跑要求低的推理任务,就像退役的客机改货机继续飞。

谁对?诚实的答案是没人知道,因为这批芯片还没活到头。但这场争论本身就是全书最重要的信号之一:

这门生意的盈利模型,建立在一个未经检验的假设上:今天买的芯片,五年后还能赚到钱。折旧年限差两年,分摊到几千亿的基建上,就是每年几百亿的利润差异。一本账的生死,系于一个没人验证过的数字。

成本结构的全貌

把成本摊开,一家大模型公司大致背着五座山:

  1. 算力 capex:芯片、数据中心、电力容量——最大头,且前置(先付钱,后收租);
  2. 推理运营成本:随用户数线性增长的电费式开销,用户越多亏得越多还是赚得越多,取决于第四章的单位经济;
  3. 人才:顶级研究员年薪包开到千万美元级,2025 年起几家实验室之间互相挖角的价码屡见报端;
  4. 数据与训练实验:大量训练跑完发现不行,直接归零;
  5. 获客与补贴:免费用户、低价档、企业折扣——本质都是贴钱换规模。

注意这五座山的性格:前四座跟「收入多少」几乎无关——不管你卖不卖得出去,山都在那儿。这就是经营杠杆高的生意——成本里一大块是固定的,不管你卖不卖得出去,山都在那儿:做大了利润惊人,做不大亏损也惊人。它解释了为什么所有人都在疯狂抢规模——这门生意里,规模不是追求,是活路。

下一章我们把镜头推到最小的一格:不看几百亿的总账,就看卖出去一个 token 的那一瞬间,这笔交易本身,到底是赚还是赔?

大模型的账本 · 咕噜
费曼式写法 · 由多个 AI 代理撰写与互相审校