前三章我们拆开了 SaaS 这台印钞机,看清了它靠什么运转:一份软件写好了,第二个用户、第一千个用户、第一百万个用户,服务他们几乎不额外花钱。这就是零边际成本(多服务一个用户,你要多掏的钱几乎是零)。订阅制、超高毛利、离谱的估值——全都是长在这块地基上的房子。
这一章,我们要看的是这块地基上第一次出现的一道裂缝。它不是又一次「技术升级」,不是数据库换了引擎、前端换了框架那种。它撬动的是「多服务一个用户几乎不花钱」这个前提本身。
先把话说死:大模型让「多服务一次」重新变得要花钱了。剩下的整章,都是在解释这句话为什么成立,以及它为什么这么要命。
查字典 vs 请专家现场思考
想理解裂缝,得先分清两种「计算机在干活」。
传统软件处理一个请求,本质是查表和搬运。你在淘宝点开一个商品,服务器做的事大致是:按 ID 去数据库里把这条记录捞出来,套进一个页面模板,发回给你。这中间没有「思考」,只有「查找」和「拼装」。这类操作快得惊人,一台普通服务器一秒钟能处理成千上万次。
说人话:传统软件像查字典。字典早就印好了,你要查「边际」这个词,翻到那一页念出来就行。翻一次和翻一万次,边际的力气几乎一样,纸也不会因为你多查一次就磨掉。
大模型干的事,是另一回事。
大模型(LLM,读了海量文本、学会预测下一个词,从而能读会写会推理的 AI)在回答你的时候,不是去某个表里把答案捞出来——答案根本不在任何表里。它是现场算出来的。你问它一句话,它要把你这句话拆成一串数字,然后让这串数字穿过一个有几百亿甚至上千亿个参数的网络,一层一层做矩阵乘法,最后才挤出下一个词。然后把这个词接回去,再算一遍,挤出下下个词。如此反复,直到答案吐完。
说人话:大模型不像查字典,像请一个专家坐你面前现场思考。你问一句,他真的要动脑子——而且他每吐一个字,脑子就得从头到尾再转一圈。你付的不是「查一次」的钱,是「他思考了多久」的工时。
为什么现场思考这么贵
这里要引入一个词。模型每跑一次、真正吐出答案的这个过程,叫推理(inference,模型运行一次、实际生成答案的过程;注意它和「训练」不是一回事——训练是一次性地把模型教出来,推理是它之后每次干活)。
很多人以为大模型的钱都花在训练上:花几千万训一个模型,训完不就一劳永逸了吗?训练确实贵,但那是一次性的。真正会持续、无限次、每个用户每句话都要重来一遍的成本,是推理。
推理贵在哪?三个实打实的东西:
- 算力:那几百上千亿个参数的矩阵乘法,跑在一种叫 GPU(专门做大规模并行数学运算的芯片)的昂贵硬件上。一张这样的卡本身就是天价,而且一次对话往往要占用不止一张。
- 电:矩阵乘法是实打实地烧电、发热。数据中心为此要供电、要散热,这些都是每小时都在跳的电表。
- 时间占用:专家在给你思考的时候,就没法同时给别人思考。这张昂贵的卡被你这次请求占住了,占的每一毫秒都是钱。
所以,模型每回答你一次,背后是一批昂贵的芯片实打实地转了一阵、烧了一阵电。这笔钱,不会因为你是第一百万个用户就消失。它对每一次请求都重新收一遍。
计价的那把尺子:token
这笔成本怎么量?行业用的单位叫 token(模型处理文本的最小计价单位,大致是一个词或半个词;你发进去的和它吐出来的,都按 token 数算)。
为什么用它计价,而不是「按次」?因为模型的活儿,前面说了,是一个字一个字挤出来的——你给的上下文越长,它要读的 token 越多;它答得越长,要生成的 token 越多;而每一个 token 都对应着「网络从头到尾再跑一圈」的算力。所以 token 数几乎直接正比于它烧掉的算力。token 就是那把量「这次思考花了多少工时」的尺子。
说人话:token 就是给专家的思考按字数计费。你问得啰嗦、要求他读一份长文档、要他写一篇长回答,字数一多,工时费就往上走。查字典没有这回事——翻到哪个词都一样便宜。
关键的一步来了。把它和第一章对照着看:
传统 SaaS:多服务一个请求 ≈ 多查一次字典 ≈ 几乎免费。
大模型:多服务一个请求 = 多请专家思考一次 = 每次都要付一笔 token 的工时费。
这正好是零边际成本的反面。SaaS 的地基是「多卖一份不花钱」,而大模型的机制是「多服务一次,就要真金白银付一笔」。
量级差多少:给点直觉
不报任何公司的具体单价——那些数字每季度都在变,报了反而误导人。但量级的直觉值得建立,因为差距大到会改变生意的形状。
粗略地说:
- 一次普通的 SaaS 请求(查条记录、渲染个页面),摊到的服务器成本可能是几分之一分钱,甚至更低。小到你根本不会去想它。
- 一次像样的大模型交互(一段对话、读一份长文档、生成一篇东西),成本可能是几分、几毛,甚至更多。
这中间的量级差,往往是成百上千倍。更要命的是,它不是固定的——用得越重,越贵:
- 上下文越长越贵:让模型读整份合同、整个代码库,输入 token 就翻着番涨。
- 多轮对话越贵:每问一轮,前面的对话往往要重新喂一遍当上下文,越聊越长,越长越贵。
- agent 最贵:让模型自己规划、自己反复调用工具、自己检查再重试(这类会自主多步行动的用法叫 agent),一个任务背后可能是它自己跟自己来回跑了几十上百次推理。用户按一个按钮,账单在后台翻了几十倍。
换句话说,成本不再是一个可以忽略的常数,而是一个随使用强度往上爬的变量。你越是把产品做得好用、做得「聪明」,每个用户越可能替你多烧钱。这在 SaaS 的世界里是不可想象的——那边是用户用得越多、你越赚,因为边际成本是零。
为什么这一下砸中的是地基
现在把镜头拉远,看清这道裂缝到底裂在哪。
SaaS 二十年的整套奇迹——订阅能印钞、毛利能到八九成、估值能给到营收的几十倍——追到根上,全都站在同一个前提上:服务下一个用户的成本约等于零。正因为约等于零:
- 收上来的订阅费几乎全是毛利,所以印钞;
- 用户用得再狠,成本也不涨,所以敢包月不限量;
- 规模越大越便宜,所以先烧钱换增长、后收割是理性的;
- 护城河可以建在网络效应、切换成本上,而不必操心「每一单还赚不赚钱」。
这四条,每一条都默默假设着「边际成本 = 0」。大模型做的事,就是把这个假设从 0 挪到了一个正数——而且是一个会随使用往上爬的正数。
说人话:前三章那套印钞逻辑不是错的,但它有个没写出来的前提——「多服务一个人不要钱」。大模型第一次让这句前提不成立了。地基上那条最粗的承重线,被动了。
这就是为什么它不是「又一个技术升级」。升级换的是房子里的家具、水管、电路;而这一次,动的是房子底下那块混凝土。地基一旦从「零成本」变成「每服务一次都要花钱」,上面盖的所有东西——订阅怎么收、毛利算不算得过来、护城河建在哪、价格该怎么定——都得重新受力,重新算一遍。
裂缝已经点破,接下来
这一章只干一件事:把裂缝指给你看。核心就一句——推理是要花钱的,token 有成本,边际成本第一次从零变成了正数。SaaS 赖以成立的那条地基,就在这里被撬开了一道缝。
缝已经在了。顺着它往下,一连串问题会自己冒出来:包月不限量还扛得住吗?八九成的毛利还保得住吗?如果能力不再来自你自己写的代码,护城河该往哪儿搬?卖结果的人,谁来替这笔越滚越大的成本买单?
这些,是后面几章要一格一格顺着裂缝推下去的事。这一章,我们先站在裂缝边上,把它看清楚——地基裂了,而且回不去了。