上一章结尾,卖铲子的人低头发现:铲子挖了半天,脚底下堆起的这堆数据,可能比铲子还值钱。这一章我们就蹲下来,把这堆东西看清楚——它凭什么值钱,凭什么能变成一道护城河,以及它没被吹的那面:它也会失效。
先说一句让全章成立的话:云和移动,把「用户的一举一动」全搬到了线上。过去你在实体店买东西,店员记不住你摸过哪件没买;现在你在 App 里划一下、停三秒、加进购物车又删掉——每一个动作都是一条记录,自动落进服务器。数据不再靠人工填表攒出来,它是软件运转时顺手漏下来的。
数据本来是「废气」
早年间,做业务的人是这么看数据的:它是业务的副产品——你为了完成一笔交易,顺带产生的一堆记录(谁在几点买了什么、点了哪个按钮)。就像工厂开机器,主产品是零件,副产品是废气,没人冲着废气去开厂。这些记录躺在日志里,占着硬盘,定期还得删掉腾地方。
「数据是废气」不是个比喻上的贬低,是当时的经济账:存它要花钱,分析它要花钱,而它能换回的钱看不见。在存储和算力都贵的年代,把废气收集起来提纯,不划算。所以大家真的就把它放掉了。
让废气变成资产的,是第四章那件事:存储和算力,从「一次性买断的大件」变成了「按用量买的水电」。攒一年的点击记录,过去意味着先砸钱买一屋子服务器;上云之后,变成每月账单上多出的一小笔,用多少付多少。于是「先把数据都留着,回头再想怎么用」这个念头,第一次在经济上说得通了。地基一便宜,上面立刻长出新东西。
数据怎么就变成了钱
数据变钱,靠的不是「卖数据」——真正的高手很少直接卖。它变钱的方式是让产品变得更准,而更准的产品能赚更多钱、留住更多人。这里有个自我强化的循环,是这一章的核心,叫数据飞轮(也叫数据护城河):
- 用的人越多 → 你积累的数据越多;
- 数据越多 → 你的产品/推荐/判断越准;
- 越准 → 越多人愿意来用;
- 回到第一步,数据又更多。
轮子一旦转起来,它会自己越转越快,而且后来者很难追——因为对手缺的不是代码,是你已经攒下、他还没有的那堆样本。举三个转得最漂亮的例子:
- 搜索。越多人在搜索框里搜,越多人点了第几条、又退回来重搜,引擎就越知道「对这个词,什么才是好结果」。你的每一次点击都在替它打分。新来的搜索引擎代码可以照抄,但它没有「几十亿次真人点击」这本账,所以结果就是没那么准。
- 推荐。越多人看了什么、跳过了什么,系统越知道「看了 A 的人多半也想看 B」。你在电商、短视频、音乐里感到「它怎么这么懂我」,懂你的不是某段聪明算法,是它见过几亿人的观看轨迹。
- 反欺诈。见过的欺诈样本越多,越会认下一次欺诈长什么样。一家处理支付的公司,看过千万笔真实盗刷,它的风控就是比只看过几百笔的对手灵。这里数据的价值特别直白:多抓一笔骗子,就是省下一笔真钱。
它和另外两道护城河,别混
这本书到现在,讲过三种「别人抢不走你」的机制。它们能同时出现在一个产品上,但发动机完全不同,混着说就全糊了:
- 网络效应(第六章):价值在人头。用户之间互相吸引——你朋友都在这个社交网络上,所以你也来。去掉别的用户,产品对你就没意义了。
- 切换成本(第三章):价值在「搬家太麻烦」。不是产品多好,是换掉它要重新导数据、重新培训、重新接口,你嫌烦就不换了。
- 数据护城河(本章):价值在积累的样本。数据把产品磨得更准,而对手缺的是那堆样本。哪怕全世界只有你一个用户,只要你喂了它足够多数据,它也会更准——这一点,恰恰是它和网络效应最干净的分界:网络效应要的是「别人也在」,数据护城河只要「样本够多」。
一句话记法:网络效应是「人拉人」,切换成本是「拔出来会疼」,数据护城河是「练得比你久」。一个产品可以三样都占——比如一个社交 App 既有人拉人,又攒了你多年数据难搬走,又靠数据把推荐磨准。但你要拆一家公司凭什么活着,就得看清它到底靠哪台发动机。
别把它吹成万能
数据护城河听着无敌,其实有两个软肋,这也是费曼式的诚实:
一,边际收益会递减。数据不是越多越好,多到一定程度,再翻十倍也帮不上什么。教一个模型认猫,头一万张照片让它突飞猛进;到第一千万张,再加一百万张几乎看不出区别——好处早被前面吃光了。所以「数据多」本身不等于护城河深,得看多出来的数据还能不能换来看得见的更准。
二,数据会过时。世界一变,旧数据就成了误导。疫情来了,之前所有的出行、消费轨迹一夜之间失真;一个热点过去,围着它攒的偏好数据就是包袱。数据护城河不是护城河一旦挖好就永远在那,它更像一个需要新鲜水源不断补给的池塘,断了活水就会发臭。
撑起这一切的三样基础设施
数据大到一定量,老办法就装不下、算不动了,于是催生了一套新工具。三个名词,一次说白:
大数据:数据量大到一台机器根本装不下、算不完,只能叫来一大群普通机器分工干——把一份巨大的活切成小块,一人算一块,最后汇总。关键不在某台机器多强,而在「让几百台便宜机器像一台超级机器那样协作」。
数据仓库:把散落在各处的业务数据(订单系统一份、App 日志一份、客服记录一份)集中搬进一个大仓库,专门用来做分析。它和你天天用的数据库不一样——数据库是「账房」,负责快准狠地记一笔笔当下的账(这单成交了、这个用户改了密码);数据仓库是「档案馆+参谋部」,负责回答「为什么上个月华东掉单」「照这势头下季度会怎样」。一个管当下记账,一个管回头看和往前看。
数据湖:比仓库更随意的一种存法——先不管数据整不整齐,原样倒进一个大池子存着,等要用了再收拾。仓库要求你进门前把货码好,湖是先堆着、用时再挑。
为什么这些偏偏在云出现之后才真正跑得起来?因为它们全都吃「按需的海量存储 + 临时叫一大群机器」。搁在自建机房年代,你得为「万一要分析」提前买齐一屋子服务器,平时闲着也烧钱,多数公司算不过账。上云之后(呼应第四章):存海量数据按用量付,要分析时临时租五百台、算完就还,账一下子就平了。云不是让分析变强了,是让「攒海量数据、按需分析」这件事第一次变便宜、变得普通公司也玩得起。
把这一档收束一下
顺着全书那条暗线看:这一次变便宜的,是「存储和分析海量数据」的成本。成本一塌,废气变资产,资产又能磨出更准的产品,护城河于是在「人际网络」旁边,又长出一条新的——「数据积累」。谁先把数据攒起来、并且真把它转成了产品优势,谁就吃到这一波;只会囤数据不会用的,攒的还是废气。
为什么这为后面 Snowflake 那批公司铺了路,这里先埋一句:既然每家公司都突然明白「数据是金矿」,那「帮别人把金矿存好、挖好」本身,就成了一门能上市的大生意。这是后话。
结尾:地基下面还垫着一样东西
讲到这儿,软件公司看着简直无懈可击:它有订阅(第七章那种细水长流的现金流),有云(弹性又便宜的交付),现在又叠上了数据护城河。三样叠在一起,估值一飞冲天,投资人愿意为「未来还很远的收入」预支很高的价钱。
但你有没有想过:投资人凭什么愿意为「未来的收入」现在就掏这么多钱?这份繁荣的地基,其实还悄悄垫着一样和软件本身毫无关系的东西——钱的价格,也就是利率。钱便宜的时候,「以后才赚到的钱」在今天就显得很值;钱一贵,同样一份未来收入,今天就不值那么多了。
这只看不见的手,一直在幕后决定着所有软件公司值多少钱。它松一松,泡沫就吹起来;它一收紧,塌方就开始。它,是第十章的主角。