上一章我们看到,当你的整个生意都跑在别人的地基上——别人的商店、别人的分发、别人的规则——一次抽成调整、一次算法改版,就能把你几年攒下的价值一夜清零。那一章讲的是"你依附于谁"。这一章要问一个更狠的问题:如果护城河本身,正在从"你写的代码"迁移到"你手里攒的数据",那到底谁才真正握着开关?
先抛一个反直觉的现象。搜索引擎的算法,几乎全世界都知道大致原理;推荐系统的论文,公开发表得满地都是;连训练大模型的方法,也早就不是秘密。按理说,代码和方法一旦不再稀缺,护城河就该填平了——第七章我们不是刚讲过开源怎么把"代码所有权"这道墙推倒的吗?可现实是,Google 搜索、YouTube 推荐、头部大模型,反而越做越难被追上。方法人人都懂,为什么后来者还是打不过?
答案藏在一个词里:数据飞轮——不是"数据多所以厉害"这么简单,而是一个会自己转起来、越转越快的循环。
飞轮到底是个什么轮子
拆开看,它就四步,绕成一个圈:
- 你有更多用户在用你的产品;
- 他们的每一次点击、跳过、停留、纠错,都变成了数据;
- 这些数据喂回去,让你的产品变得更准、更好用;
- 产品更好,就吸引来更多用户——回到第一步,只是圈更大了。
关键在于:这个圈每转一圈,就把你和对手的差距又拉开一点。对手就算今天把你的代码一行不差抄走,他也拿不到你这几年里几十亿次点击攒出来的那份"经验"。代码是可以复制的,数据不是——尤其是那种"用户在真实场景里用你的产品才会产生"的数据。
换个说法:以前打软件仗,比的是"谁的产品做得好"。现在比的是"谁的产品被用得多"——因为被用得越多,产品就自动变得越好。这是一种复利。你不是在跟对手比一次考试的分数,你是在比谁的雪球已经滚了更久。
为什么这种护城河比前几章的都更硬
回头数一数前面讲过的护城河:代码所有权(第一章),被开源填平了;文件格式的绑定(第三章),标准一开放就松动;连网络效应(第四章),也可能被一个更好用的新平台掀翻。这些护城河都有个共同弱点——它们是静态的。你今天挖好一条壕沟,它就在那儿,对手迟早能想办法填、想办法绕。
数据飞轮不一样,它是动态的。它不是一条挖好的壕沟,而是一台一直在往外扩地盘的机器。对手追赶你的同时,你自己还在加速。这就是为什么后来者常常有种绝望感:不是差距大,而是差距在你追的时候还在扩大。
Google 是第一个把这台机器造出来的公司
第六章讲过 Google 靠广告赚钱,把"用户即货"这件事做成了。但那一章讲的是商业模式怎么转向广告。这一章要补上另一半:Google 真正的护城河,其实是那台在广告底下悄悄转动的数据飞轮。
想想它早年那个不起眼的功能——"你是不是想搜……"(Did you mean,就是你打错字时它猜你真正想搜什么)。它怎么知道你拼错了?因为在你之前,已经有数以百万计的人打错过同样的字,然后又改对重搜了一遍。Google 看着这几百万次"打错—改对",就学会了正确拼法。你每一次犯错并修正,都在替下一个人把答案调得更准。用的人越多,它就越聪明;越聪明,用的人就越多。这台飞轮,从二十多年前就开始转了。
后来 YouTube 的推荐、地图的实时路况,走的都是同一条路。推荐系统——就是那个决定"下一个自动播给你看什么"的东西——它的好坏,几乎全押在数据量上。你没法靠一个更聪明的算法凭空追上一个看过几十亿小时观看记录的系统,因为它见过的人类偏好,比你多太多了。算法是次要的,喂进去的东西才是主角。
到了大模型时代,飞轮换了个更大的轮子
轮到今天。大模型(就是 ChatGPT 那类能对话、能写东西的 AI)表面上看是"算法的胜利",好像谁的模型结构更巧谁就赢。但真相更接近前面那台老飞轮——只是喂料的方式变了几层。
这里要小心分清三种不同的"数据",因为很多人一锅炖,就看不清护城河到底在哪:
- 预训练用的海量文本:从公开互联网上扒来的。这部分其实不太构成独占护城河——大家能扒的地方大同小异,这也是为什么好几家公司能做出水平接近的模型。
- 人类反馈数据:RLHF,说人话就是"让人给 AI 的回答打分、挑毛病,再拿这些评价去调教它"。谁有更多真人在持续帮它纠偏,谁的模型就更好用、更不容易胡说。这份数据是花钱、花时间、花用户量才攒得出来的。
- 真实使用数据:几亿人每天拿它干什么、在哪句话上点了"重来"、哪个回答被复制走了——这一份,只有已经拥有大量用户的产品才拿得到。这才是新的锁。
所以大模型时代的竞争,第一步比的是谁能扒到、买到、算得动海量数据(这一步有钱就能追);但真正拉开长期差距的,是产品上线之后那台飞轮——谁的用户多,谁就拿到更多真实反馈,模型就更好用,于是用户更多。绕回来了,又是同一个圈。
这也解释了一个乍看奇怪的现象:为什么那些手里早就攥着海量用户和数据的巨头,在这一轮里既紧张又占便宜。紧张,是因为新玩家可能造出比他们更好的模型(这是下一章要正面撞的事);占便宜,是因为一旦模型接进他们那些几亿人天天在用的产品里,飞轮当场就能转起来——他们不缺喂料的入口。
飞轮不是永动机——它也会卡住、也会反噬
别把数据飞轮当成一劳永逸的护城河,那就又掉回"正确的废话"里了。它有几个真实的裂缝,值得记住:
一是数据会有天花板。当模型已经好到 99 分,用户反馈能带来的提升越来越小——飞轮转得动,但每圈推着雪球长大的那点雪,越来越薄。护城河还在,但不再加宽。
二是飞轮可能反着转。如果产品变差、用户流失,数据就变少、质量下降,产品继续变差——同一台机器,倒着转就是加速下坠。护城河可以蒸发,正是因为让它成立的那个循环,本身是脆弱的。这不就是全书开头那句话吗:软件走向垄断,却又天生脆弱。
三是数据的所有权正在被重新争夺。当"谁有数据谁赢"成了共识,那些生产数据的一方——写内容的人、被拿去训练的网站、贡献反馈的用户——开始追问:凭什么是你在攒这份复利?这场关于"数据到底归谁"的拉锯,才刚刚开始。
看清了这一层,你就摸到了这本书的一条暗线:护城河从没消失,它只是不停地换地方——从代码,到格式,到网络,再到今天的数据与规模。每换一个地方,上一批守着旧壕沟的公司就会突然发现,自己的墙不知何时已经不挡水了。
而现在,地基本身又要动了。数据是这一轮的锁,可锁装在门上,门装在墙上,墙立在地基上——如果整块地基被换成一种全新的东西呢?下一章,我们就去看这场几十年一遇的平台大更迭:AI 不只是又一个产品,它可能是把前面每一股力量——平台绑定、网络效应、创新者的窘境、模式的地心引力——同时重新洗一遍牌的那件事。