把黑箱拆开:手搓一个大语言模型 书架

第 09 章 / 共 16 章

第九章 · 为什么会'涌现':规模一大就变了

上一章结尾我们留了个疑问:喂给它半个互联网的文本,让它做的事情始终是那件最笨的——猜下一个词。可为什么猜词猜到一定规模,模型突然会做三位数乘法、会写能跑的代码、会跟着"让我们一步步想"的提示解应用题,而它的小号兄弟对同样的任务一脸茫然?就像你往锅里持续加热,水温从 20 度爬到 90 度,一直只是"变烫的水";可到了 100 度,它突然翻腾、气化,变成了另一种东西。本章就来拆这口锅:这种"规模一大就变了"到底是真的相变,还是我们的错觉。

先说规律:越大越好,而且好得很有规律

把模型做大,通常指三件事同时变大:参数量(模型里那些可调旋钮的个数)、训练数据量(喂进去多少字)、算力(花多少次运算去训)。研究者发现,当你把这三样一起往上推,模型在"猜词"这件事上的错误率下降得特别有规律——不是忽上忽下,而是像一条能提前画出来的下滑曲线。

规模法则(Scaling Laws),说的就是这件事:模型的预测误差(也就是第七章讲的"损失",衡量它猜得有多离谱)随着参数、数据、算力的增加而平滑、可预测地下降。神奇的地方在于"可预测"——你在小模型上测几个点,画到坐标纸上,就能相当准地外推出"我砸十倍算力下去,误差大概会掉到多少"。

翻译成人话:损失下降的曲线在特定的坐标纸上会拉成一条近乎笔直的斜线。这意味着"更大 = 更好"不是玄学,而是一门能拿来做预算的工程。正因为这条线,公司才敢在一个模型还没训出来之前,就砸下几千万美元——他们不是在赌运气,是在读一张已经画好的下坡图。

这里有个反直觉的点值得停一下:规模法则量的是损失,也就是"平均每个词猜得准不准"。损失是平滑下降的,没有任何台阶、没有任何突变。记住这个"平滑",它是后面拆穿魔法的关键。

涌现:平滑的损失,跳变的本事

问题来了。如果损失是平滑下降的,为什么我们会觉得某些能力是"突然"冒出来的?

这就是涌现能力(Emergent Abilities):某项具体本事——比如做多位数加法、解逻辑谜题、听懂某种绕弯的指令——在模型小的时候几乎是零,怎么练都是零,可当规模越过某个坎,成绩突然从趴在地上蹿到能用。你画一条"模型大小 vs 这项任务得分"的图,看到的不是斜坡,而是一个拐点:前面一马平川贴着零,某处猛地翘起来。

为什么平滑的损失会长出跳变的本事?关键在于很多任务是"全对才算对"的。拿三位数乘法举例:一道题要算对,模型得连续猜对好几个环节——进位、每一位、最后拼起来——错任何一步,整道题就判零分。

假设一道题内部要"连对 5 步"才算做对,每一步猜对的概率随规模平滑提升。小模型每步只有 20% 把握,整题成功率是 0.2 的五次方,约等于 0.03%——测一百道题几乎全错,看起来"完全不会"。规模上去,每步把握升到 80%,整题成功率变成 0.8 的五次方,约 33%——从"零分"跳到"三分之一能做对"。你看,底层能力(每步的把握)是平滑爬升的,但那个"连乘"把它折成了一道陡坎

这就是涌现的机制核心:不是模型内部发生了什么灵异的相变,而是"全有或全无"的评分方式,把连续的进步放大成了肉眼可见的突变。水到 100 度沸腾是真的分子层面相变;而 LLM 的很多"涌现",更像是你用一把只分"及格/不及格"的粗尺子去量一个正在缓慢长高的孩子——他每天长一点点,但直到某天跨过及格线,尺子才第一次告诉你"他行了"。

那到底是真突变,还是度量错觉?

这几年学界为这件事吵得很凶,我把两边的立场如实摆给你,因为这正是本书想教你的态度:别急着信"魔法",先问"是不是我量错了"。

"错觉派"的核心证据是:换一把尺子,坎就没了。如果你不再用"整题全对得 1 分、错一点得 0 分"这种非线性指标(意思是:得分对底层能力的反应是骤变的,比如全或无、精确匹配),而是改用"部分给分"的连续尺子——比如看模型猜对正确答案里多少个字符、给正确答案分配了多高的概率——那条陡坎往往就软化成一条平滑的斜坡,跟损失曲线一样温顺。换句话说,突变可能不在模型里,而在我们的记分卡里。

一个能让你在脑子里跑一遍的例子:考试只判"满分/零分",那学生从 59 分涨到 61 分,成绩单上是从"挂科"到"通过"的惊天突变;可要是按实际分数记,他不过是平稳地从 59 爬到 61。模型能力没变魔术,是"及格线"这把尺子制造了戏剧性。

但也别一竿子打死,把涌现全说成幻觉,那是另一种偷懒。有几点是"错觉派"没法轻易抹掉的:

所以,本质上是什么

把这章收成一句话:规模带来的进步是平滑、连续、可预算的;而"涌现"很大程度上是这份平滑进步,被"全对才算数"的评分放大出来的戏剧效果。它不是模型在某个夜里突然开了窍、有了灵魂,而是一个缓慢长高的孩子,终于跨过了一道我们亲手划下的及格线。

祛魅到这一步,你该同时握住两个看似矛盾的判断:涌现里确实有被夸大的水分(换把尺子,神迹就淡了),但"做得足够大,某些本事才真的可用"这条,是真的。魔法退场,工程登场——可工程里仍留着一块我们暂时预测不了的暗区。

而"预测不了"本身,会惹出更麻烦的事。当一个模型自信满满地给你一个规模足够大才敢说出口、听起来毫无破绽、却完全错误的答案时,你该怎么办?它为什么会一本正经地胡说八道?那是下一章的事。

把黑箱拆开:手搓一个大语言模型 · 王建硕
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校