AI 是怎么学会说话的 书架

第 07 章 / 共 10 章

第七章 · 大力出奇迹

一个出乎意料的实验发现

时间回到 2020 年前后。研究者们本来在干一件很朴素的工程事:模型再做大一点、数据再多喂一点、训练再久一点,看看效果能好多少。大家的预期是「好一点、再好一点」,线性增长,一分投入一分收获。

结果出来的曲线让所有人坐直了。一些能力——比如「给一个没见过的任务,只给两三个例子就照着做」——在小模型身上基本为零,模型一路变大,这项能力一路趴在零附近,看上去毫无希望;可一旦规模跨过某个坎,这项能力突然之间就冒出来了,像烧开的水,99 度时还是液体,100 度就沸腾了。这种现象被叫做涌现——大白话说:量变积累到某个点,质变突然发生,新能力凭空登场。

这不是一次两次的巧合。翻译、多步算术、逻辑推理、读懂没见过的笑话……一批能力都呈现这种「趴窝很久,突然开窍」的曲线。

为什么会「突然」?一个说得通的解释

先泼一盆冷水:科学界对「涌现」的成因至今没有标准答案,它仍是活跃的研究课题,甚至有人争论其中一部分「突然」只是测量工具不够细的错觉。但有一个解释框架,接受度比较广,而且很好懂:

很多能力不是一个旋钮管的事,而是一整套「零件」凑齐了才工作。

拿「多步推理」举例。要做好它,模型内部至少得先学会:读懂题意、记住中间结果、按步骤推进、检查前后矛盾。这几样「零件」在训练中各自缓慢进步,但只要缺一样,整体表现就是零——就像一台收音机,电阻、电容、天线各自慢慢备齐,但在最后一件焊上之前,它一声不响;焊上的那一瞬间,它突然就响了。从外面看是「突变」,从里面看是「零件终于凑齐」。

大白话:涌现像组装,不像发酵。发酵是今天酸一点明天酸一点;组装是最后一颗螺丝拧上之前,机器一直都是一堆废铁。

这也解释了为什么「突然」总发生在大模型身上:模型越大、数据越多,能装下的「零件」就越多、越精细,凑齐一整套的概率就越大。小模型不是不学,是零件箱太小,永远差着几颗螺丝。

规模定律:AI 行业的「摩尔定律」

比涌现更基础、也更让投资人疯狂的,是另一条规律:研究者们发现,模型的表现(用一个叫「损失」的分数衡量,上一章讲过,就是「错得有多离谱」)跟三个东西呈现出非常稳定的数学关系——模型旋钮的数量、训练数据的量、投入的算力。三者按比例一起涨,表现就沿着一条平滑的曲线可预测地变好,而且这条曲线横跨了好几个数量级都没有失效的迹象。这就是规模定律(Scaling Laws)——大白话:「砸钱就能变强」不是玄学,是一条画得出曲线的经验规律。

这条定律改变了整个行业的玩法。在它被发现之前,AI 进步靠灵感——谁的算法巧谁赢;在它被发现之后,AI 进步在相当程度上变成了工程学加资本——既然曲线可预测,那就建厂、买卡、堆数据,把曲线往前走。过去几年 AI 军备竞赛的疯狂投入,底层逻辑就是这条曲线给的信心。

当然,天下没有白吃的午餐。这条路线也在撞上它自己的天花板:高质量文本快被「读」完了,电和芯片越来越贵,「再砸十倍钱」换来的进步在放缓。行业里 2024 年之后的一个明显转向——从「把模型练得更大」转向「让模型在回答时想得更多」(后训练、推理时计算)——正是对这条曲线增速放缓的回应。这属于前沿动态,但骨架没变:整个行业的节奏,仍然是被「投入—产出」的可预测曲线牵着走的。

这一章之后,我们该害怕还是该兴奋

「大力出奇迹」给人两种相反的情绪。兴奋的人说:曲线还在往前走,奇迹还会继续。警惕的人说:一个连建造者都只能事后观察、无法事先预言它「什么时候会突然会什么」的东西,本身就意味着风险——你不能对你造的东西的能力边界两眼一抹黑。

两种情绪都有道理。但作为读者,你现在至少拥有了一样大多数人没有的东西:你知道「奇迹」不是魔法,它是一台组装到临界点的收音机——突然响起的那一刻令人惊讶,但每一个零件的来路都清清楚楚。

不过,此时的模型还不是你手机里那个有问必答的助手。它是一台「世界的压缩机」,一个博学的「续写机器」——你给它「如何制作蛋糕」,它可能续写成一篇教程,也可能续写成「下回分解」,因为它只负责把话接得像话,不负责「帮你」。从「会说话」到「会听话」,还差最后一次调教。下一章讲这个过程——它花的钱不到预训练的零头,却决定了你拿到的 AI 是什么性格。

AI 是怎么学会说话的 · 百姓AI
费曼式写法 · 由多个 AI 代理撰写与互相审校