第 11 章 卖结果的人要扛成本
上一章我们看着定价从「按人头」松动开,长出了三种新收法:按用量收、按结果收、按 agent 工时收。那一章讲的是钱怎么进来。这一章讲的是它的背面——钱怎么出去。因为你一旦不再按人头收,而是按「干了多少活」收,那么第 4 章讲的那笔 token 成本,就不再是账本角落里可以忽略的小数点,它变成了你每做一单都要真金白银掏出去的料钱。
换个画面。过去开软件公司,像开一家「复印店,但纸和墨水都不要钱」。你印一份和印一万份,成本几乎一样,客户给的钱几乎原封不动落进兜里。现在不一样了:每印一份,纸和墨水都要花钱——这个纸墨,就是 token。你重新变回了一家要算料的普通店。这一章,就是教你像个开店的人那样,把料钱算清楚。
先把「毛利」这把尺子立起来
要看清成本怎么啃利润,得先有一把尺。这把尺叫毛利率。
毛利率(gross margin):你收进来一块钱,先扣掉「为了多服务这一单而直接多花的钱」,剩下的占多大比例。注意,扣的只是「多服务一单的直接成本」,不含你办公室房租、研发工资这些不管卖几单都要花的固定开销。
说人话:一杯奶茶卖 20 块,这一杯的茶叶、牛奶、杯子成本 6 块,那这杯的毛利就是 14 块,毛利率 70%。毛利率量的是「每多卖一单,能净落下多少」,不管你的门店租金和店长工资。
现在把第 1、2 章接回来。传统 SaaS 为什么是印钞机?因为它「多服务一单的直接成本≈0」——多一个用户,多花的服务器钱小到可以忽略。于是收进来的那块钱几乎全是毛利。这就是为什么软件公司的毛利常年在 75%–85%,高得不像实体生意。这不是它们特别会做生意,是它们的料本来就不要钱。
token 成本,是直接从毛利里扣的
关键的一步来了。token 成本是什么性质的成本?它是每多服务一单就要多花一次的成本——用户多问一句,你就多付一次;这单任务更重,你就付更多。按定义,它正好落在「多服务一单的直接成本」这一格里。也就是说,它不是从固定开销里出,而是直接从毛利里扣。
于是同样收进来一块钱:
- 传统 SaaS:料钱≈0,一块钱里八九毛是毛利。
- 大模型应用:料钱是实打实的 token,一块钱里可能只剩五毛、四毛,甚至更薄——取决于这单用得多重。
用得越重,扣得越狠。一个轻活儿(分个类、改句话),token 花不了几个钱,毛利还能保住七八成;一个重活儿(读整个代码库、让 agent 自己反复调工具跑几十轮,见第 4 章),token 能把毛利啃到四五成甚至更低。软件公司第一次,毛利要看「这一单具体干了什么」才知道。
说人话:SaaS 的一块钱收入,含金量八九成;大模型应用的一块钱收入,含金量可能只剩四五成。同样是一块钱,一个几乎是纯金,一个掺了不少料钱进去。
这会反噬估值——收入的形状变了
现在把第 2 章那条估值逻辑拽回来。资本为什么肯给 SaaS 那么高的估值(营收的几十倍)?我们当时拆过,就三样叠在一起:经常性收入(可预测)+ 极高毛利(一块钱几乎全是利润)+ 可复利(多服务不花钱,客户留得越久越赚)。
大模型应用动的,正是中间那样——毛利。当一块钱收入的含金量从八九成掉到四五成,这块钱在资本眼里就「变便宜」了。因为估值本质上是给「未来能落下多少利润」定价,而不是给「未来能收上来多少收入」定价。毛利薄一半,同样一块钱收入背后能落下的利润就薄一半,市场愿意为它付的倍数自然往下走。
往哪走?往服务业、外包业那边走。一家人力外包公司、一家咨询公司,为什么市销率(市值是营收的几倍)远低于软件公司?因为它们每收一块钱,背后都压着实打实的人力成本,毛利本来就薄。大模型应用按结果收费、每单压着 token 成本,收入的形状越来越像它们,而不像纯软件。
收入的形状变了,市场给收入的价格也会变。同样一块钱营收,长在零边际成本上,值几十倍;压着料钱,可能只值几倍。
成本转嫁:这笔料钱,到底谁扛
薄毛利不是命中注定的,它取决于一个选择:成本转嫁——token 这笔料钱,是你自己吞,还是转手让客户付。上一章那三种收法,其实就是在回答这个问题。
- 按用量收 = 转嫁给客户。客户用多少 token、你就收多少(加个加价)。模型涨价、用户滥用,账单最终落在客户头上。你的毛利稳如老狗——因为你根本没扛成本。代价是:客户拿到一张不可控的账单,月底才知道花了多少,用起来提心吊胆,砍需求、装限额,甚至干脆不敢放开用。
- 按结果 / 固定价收 = 你自己扛。「修好一个 bug 收 50 块」「一篇稿 10 块」,客户省心,账单可预测。但料钱这头是敞开的:模型一涨价、某个用户的任务比预期难十倍、失败重试了五轮、还得拉个人来兜底——这些成本全砸在你身上。极端情况下,你会亏钱做单:收了 50 块,这单烧了 60 块的 token。
说人话:这就像装修。按实报实销(按用量),师傅不亏,但业主看着账单心惊肉跳;包工包料(按结果),业主省心,可万一料涨价、活儿比想的难,师傅自己吃这个亏,甚至倒贴。省心和稳赚,天平只能偏一头。
这就是「卖成果」的隐藏账单。你越是给客户「省心、可预测」的体验,就越是把成本的不确定性揽到自己身上。定价越性感,风险越靠你这边。
单位经济:软件公司第一次要像餐馆一样算账
把上面这些逼到最尖的一点,就是一个实体生意才熟悉、软件公司过去根本不用碰的概念。
单位经济(unit economics):做成「一单」,到底是赚还是亏,赚多少、亏多少。餐馆天天算这个——这道菜卖 38,食材成本 12,人工水电摊 8,一盘净赚 18;哪道菜是赔本赚吆喝,老板心里门儿清。
SaaS 时代,软件公司几乎不用算这个,因为「一单」的直接成本约等于零,做成一单基本等于纯赚,没什么可算的。大模型应用第一次把这道题摆回桌上:做成这一单,到底烧了多少 token?失败重试了几次?要不要人工兜底?算完才知道这单是赚是赔。
说人话:软件公司第一次要像餐馆算「每道菜的食材成本」一样,去算「每单活儿的 token 成本」。做成一单不再天然赚钱,得一单一单精算,才知道自己是在赚钱还是在给模型厂商打工。
这不是坏消息本身,而是一种成熟——它逼你把过去糊在「反正边际成本是零」里的糊涂账,一笔一笔摊开来算清楚。
另一面:料价每年在跌
讲到这里像在唱衰,但先别急着下结论。上面这幅画少了很重要的一笔:token 这个料,价格不是恒定的,它每年在大幅往下掉。同等能力的模型,单位成本逐年以肉眼可见的幅度下降——今天贵得肉疼的一单,一两年后可能便宜到零头。这跟餐馆不一样:餐馆的牛肉不会年年跌价,而 token 会。
而且,薄下去的毛利,是可以靠工程一分一分抠回来的:
- 模型路由:简单活儿不用请最贵的专家。分个类、判个是非,用又小又便宜的模型就够了,只有真正难的活儿才上顶级大模型。模型路由就是让系统按任务难度自动挑模型——把料钱按需分配,别拿五星大厨去切葱花。
- 缓存:一样的问题、重复的上下文,答过一次就存下来,下次直接取,不必让模型从头再算一遍。省下的每一次重算,都是省下的料钱。
- 用传统代码兜底:能用一行确定的代码算清楚的(比如加减法、查一条记录),就别丢给模型现场推理。把能确定的部分交还给零边际成本的老办法,只在真正需要「思考」的地方才烧 token。
这几招合起来,能把一单的 token 成本压下相当一截,毛利跟着回升。所以长期看,大模型应用的毛利未必会一直趴在四五成——它有机会靠模型降价和工程优化,慢慢往上爬。
白吃的午餐结束了,但生意没死
把这一章收一下。承接第 10 章的新定价,它的代价是:当你按结果、按用量收钱,token 成本就变成了你的成本,直接从毛利里扣。于是——
- 毛利从 SaaS 那种 75%–85%,可能被压到 50%、40%,看你用得多重;
- 毛利一薄,收入的含金量下降,估值倍数向服务业、外包业靠拢,而不是软件业(反噬第 2 章那套高估值逻辑);
- 谁扛 token 成本成了关键选择:转嫁给客户则毛利稳但账单吓人,自己扛则客户省心但你可能亏本做单;
- 单位经济第一次要像餐馆一样一单一单精算。
但结论不是「大模型应用是门烂生意」。真正准确的说法是:「零边际成本的白吃午餐」结束了,毛利不再是天上掉下来的,得靠工程一分一分抠出来。料价每年在跌,路由、缓存、代码兜底都能回收毛利——这门生意能不能算得过账,从此是个真问题,而不是像 SaaS 那样默认成立。
而这件事——「要精算单位成本、毛利更薄、每单都得算得过账」——会顺着一直往下渗,渗进一个更现实的地方:创业和融资的算术。当你不能再靠「边际成本是零」这句话糊过投资人,当每一单都压着料钱,一家公司该怎么起步、怎么烧钱、怎么讲估值故事,全都要重算。这是第 13 章的事。这一章先记住一句:你开的不再是那家纸墨免费的复印店了,你重新变回了一家要算料的普通店——只不过,你的料价每年都在往下掉。