边际成本不再是零 书架

第 04 章 / 共 16 章

第四章 · 大模型动了哪根螺丝

前三章我们拆开了 SaaS 这台印钞机,看清了它靠什么运转:一份软件写好了,第二个用户、第一千个用户、第一百万个用户,服务他们几乎不额外花钱。这就是零边际成本(多服务一个用户,你要多掏的钱几乎是零)。订阅制、超高毛利、离谱的估值——全都是长在这块地基上的房子。

这一章,我们要看的是这块地基上第一次出现的一道裂缝。它不是又一次「技术升级」,不是数据库换了引擎、前端换了框架那种。它撬动的是「多服务一个用户几乎不花钱」这个前提本身。

先把话说死:大模型让「多服务一次」重新变得要花钱了。剩下的整章,都是在解释这句话为什么成立,以及它为什么这么要命。

查字典 vs 请专家现场思考

想理解裂缝,得先分清两种「计算机在干活」。

传统软件处理一个请求,本质是查表和搬运。你在淘宝点开一个商品,服务器做的事大致是:按 ID 去数据库里把这条记录捞出来,套进一个页面模板,发回给你。这中间没有「思考」,只有「查找」和「拼装」。这类操作快得惊人,一台普通服务器一秒钟能处理成千上万次。

说人话:传统软件像查字典。字典早就印好了,你要查「边际」这个词,翻到那一页念出来就行。翻一次和翻一万次,边际的力气几乎一样,纸也不会因为你多查一次就磨掉。

大模型干的事,是另一回事。

大模型(LLM,读了海量文本、学会预测下一个词,从而能读会写会推理的 AI)在回答你的时候,不是去某个表里把答案捞出来——答案根本不在任何表里。它是现场算出来的。你问它一句话,它要把你这句话拆成一串数字,然后让这串数字穿过一个有几百亿甚至上千亿个参数的网络,一层一层做矩阵乘法,最后才挤出下一个词。然后把这个词接回去,再算一遍,挤出下下个词。如此反复,直到答案吐完。

说人话:大模型不像查字典,像请一个专家坐你面前现场思考。你问一句,他真的要动脑子——而且他每吐一个字,脑子就得从头到尾再转一圈。你付的不是「查一次」的钱,是「他思考了多久」的工时。

为什么现场思考这么贵

这里要引入一个词。模型每跑一次、真正吐出答案的这个过程,叫推理(inference,模型运行一次、实际生成答案的过程;注意它和「训练」不是一回事——训练是一次性地把模型教出来,推理是它之后每次干活)。

很多人以为大模型的钱都花在训练上:花几千万训一个模型,训完不就一劳永逸了吗?训练确实贵,但那是一次性的。真正会持续、无限次、每个用户每句话都要重来一遍的成本,是推理

推理贵在哪?三个实打实的东西:

所以,模型每回答你一次,背后是一批昂贵的芯片实打实地转了一阵、烧了一阵电。这笔钱,不会因为你是第一百万个用户就消失。它对每一次请求都重新收一遍。

计价的那把尺子:token

这笔成本怎么量?行业用的单位叫 token(模型处理文本的最小计价单位,大致是一个词或半个词;你发进去的和它吐出来的,都按 token 数算)。

为什么用它计价,而不是「按次」?因为模型的活儿,前面说了,是一个字一个字挤出来的——你给的上下文越长,它要读的 token 越多;它答得越长,要生成的 token 越多;而每一个 token 都对应着「网络从头到尾再跑一圈」的算力。所以 token 数几乎直接正比于它烧掉的算力。token 就是那把量「这次思考花了多少工时」的尺子。

说人话:token 就是给专家的思考按字数计费。你问得啰嗦、要求他读一份长文档、要他写一篇长回答,字数一多,工时费就往上走。查字典没有这回事——翻到哪个词都一样便宜。

关键的一步来了。把它和第一章对照着看:

传统 SaaS:多服务一个请求 ≈ 多查一次字典 ≈ 几乎免费。
大模型:多服务一个请求 = 多请专家思考一次 = 每次都要付一笔 token 的工时费。

这正好是零边际成本的反面。SaaS 的地基是「多卖一份不花钱」,而大模型的机制是「多服务一次,就要真金白银付一笔」。

量级差多少:给点直觉

不报任何公司的具体单价——那些数字每季度都在变,报了反而误导人。但量级的直觉值得建立,因为差距大到会改变生意的形状。

粗略地说:

这中间的量级差,往往是成百上千倍。更要命的是,它不是固定的——用得越重,越贵:

换句话说,成本不再是一个可以忽略的常数,而是一个随使用强度往上爬的变量。你越是把产品做得好用、做得「聪明」,每个用户越可能替你多烧钱。这在 SaaS 的世界里是不可想象的——那边是用户用得越多、你越赚,因为边际成本是零。

为什么这一下砸中的是地基

现在把镜头拉远,看清这道裂缝到底裂在哪。

SaaS 二十年的整套奇迹——订阅能印钞、毛利能到八九成、估值能给到营收的几十倍——追到根上,全都站在同一个前提上:服务下一个用户的成本约等于零。正因为约等于零:

这四条,每一条都默默假设着「边际成本 = 0」。大模型做的事,就是把这个假设从 0 挪到了一个正数——而且是一个会随使用往上爬的正数。

说人话:前三章那套印钞逻辑不是错的,但它有个没写出来的前提——「多服务一个人不要钱」。大模型第一次让这句前提不成立了。地基上那条最粗的承重线,被动了。

这就是为什么它不是「又一个技术升级」。升级换的是房子里的家具、水管、电路;而这一次,动的是房子底下那块混凝土。地基一旦从「零成本」变成「每服务一次都要花钱」,上面盖的所有东西——订阅怎么收、毛利算不算得过来、护城河建在哪、价格该怎么定——都得重新受力,重新算一遍。

裂缝已经点破,接下来

这一章只干一件事:把裂缝指给你看。核心就一句——推理是要花钱的,token 有成本,边际成本第一次从零变成了正数。SaaS 赖以成立的那条地基,就在这里被撬开了一道缝。

缝已经在了。顺着它往下,一连串问题会自己冒出来:包月不限量还扛得住吗?八九成的毛利还保得住吗?如果能力不再来自你自己写的代码,护城河该往哪儿搬?卖结果的人,谁来替这笔越滚越大的成本买单?

这些,是后面几章要一格一格顺着裂缝推下去的事。这一章,我们先站在裂缝边上,把它看清楚——地基裂了,而且回不去了。

边际成本不再是零 · sissi
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校