上一章讲清了:机器咬走的是任务,不是人。可要知道它咬得动哪些、咬不动哪些,得先弄明白这把刀怎么造的——刀刃的形状,决定它天生能切什么。这一章就把这波 AI 的核心「大模型」拆开看:它到底在「学」什么。
它的看家本事,就是猜下一个词
大语言模型(英文缩写 LLM,你就理解成「一个吃了海量文字、专门猜下一个词的超大机器」),听着高深,干的活其实土得掉渣:给它前面一段字,让它猜下一个字最可能是啥。
你天天在用它的迷你版:手机输入法联想。你打「今天天气真」,它跳出「好」「不错」「热」。凭什么?因为它见过无数人打「今天天气真」,后面接「好」最多。它不懂天气,只记住了「这几个字后面通常跟哪个」。
大语言模型就是这个游戏玩到极致。把输入法那点见识,换成几乎整个互联网的文字——书、代码、论坛、维基、说明书——让它反复做同一道填空题,上千亿遍:
「水的沸点是一百___」——填「度」。「for i in ___」——填「range」。「床前明月___」——填「光」。就这一道题,换着花样,做到天荒地老。
训练它,说穿了就是拿一篇真文章遮住后面让它猜;猜错了就把内部的旋钮拧一拧,下次更可能对。几千亿次后越猜越准。没人教它语法、没人给它讲道理,它只是被逼着「把下一个词猜准」。
可猜词怎么就会写代码了?
一个只会填空的机器,怎么就能翻译、对话、写出能跑的代码?关键这句话:要把下一个词猜得足够准,它被逼着在肚子里塞进了大量世界的规律。
要接对「水的沸点是一百」后的「度」,它得「知道」这条物理常识;要接对 Python 下一行,它得摸清代码结构——哪个括号要闭合、变量定义过没;要把「猫」翻成「cat」,它得在无数中英对照里把两词的关系压进去。
换句话说:猜词准像绳子一样把它往「理解语言结构、掌握事实规律、熟悉代码套路」死死拽。它不是先学会世界再猜词,而是为了猜词顺手把世界的统计规律压进了肚子。会写代码、翻译、聊天,都是「猜词太好」溢出的副产品。
打个比方:你让一个人把一万部侦探小说的结尾都猜对,猜着猜着他就被迫学会了推理套路——哪怕从没上过逻辑课。目标逼出了能力。
它最擅长的事,叫「插值」
这是全章最要紧的一对词,理解了它,你就拿到判断 AI 的钥匙。第一个,插值——听着吓人,其实就是「在见过的点之间连线取中间」。你标两个点:「1 岁孩子平均多高」「10 岁孩子平均多高」,问「5 岁的呢」?两点连线取中间一读,八九不离十。这就是在已知范围里面填缝隙。
相对的是外推,就是「跳到没见过的范围外面去」。同样两个点,问「100 岁的人平均多高」?连线往外一延就荒唐——身高到某个岁数就不长甚至会缩,可直线不知道,没见过那片区。
大语言模型是史上最强的插值机器。它见过的文字铺成一片巨大空间,只要问题落在里面,哪怕这句话它没见过,也能在周围无数相似例子之间「连线取中间」给出漂亮答案。写请假邮件、把话改正式、用 Python 写个常见排序——都落在范围里,又快又好。
可一旦问题跑到范围外面——没人写过、没有先例、要凭空造出全新东西——它就被迫切换成「外推」,像那条冲向 100 岁的直线,越走越离谱还不自知。
记住这句,后面好几章都靠它:它在见过的世界里游刃有余,在没见过的世界里连蒙带猜。
诚实说局限:它不保证「懂」,还会一本正经胡说
讲到这得泼盆冷水。第一,它并不「理解」它说的话,至少不像你那样懂。它的目标只有一个:让下一个词看起来像真的——像一个懂行的人会接着说的话。注意,是「像不像真」,不是「是不是真」;两者多半一致,但不总是。
于是有了那个著名的毛病:幻觉——模型一本正经地编出一段看着合理、其实是错的内容:一个不存在的书名、一条查无此人的法条、一个编造的数据,语气还笃定得很。它不是骗你,它压根没有「真假」的概念,只是把下一个词接得顺口。顺口和正确,它分不清。
第二,它不会主动查证,也不为对错负责。你问它就答,哪怕心里一点底都没有,除非你给它接上查资料的工具。它给你的是「最像答案的一段话」,不是「负责的答案」。
更深一层:它学到的是相关性,不是因果。它知道「乌云」和「下雨」老一块出现,却不真懂「因为有乌云所以会下雨」。多数时候够用;可一旦要真正想清「谁导致了谁」,短板就露出来。
别神化,也别贬低
那该怎么给它一个公道的定位?收好这句话,这是全章的全部:
它是人类造出来的、有史以来最强的「模式匹配 + 插值」机器——仅此而已,但这已经惊人得不得了。
它惊人,是因为人类绝大多数工作本质上都在已有的模式之间插值,都落在它见过的范围里,接得又快又好,好到让人心慌。它有天花板,也正因为它是「插值机器」:凡是要跳到范围外、凭空定义新问题、为结果负责、弄清「谁导致了谁」的地方,它就打滑。这条边界不是谁故意设的,而是这套「猜词 + 插值」机制天生长成的。
收尾:它见过的世界越像你的问题,它越是神;越不像,越要你自己盯着。刀刃的形状,看清了。
接下来五章,我们一根根去画那些真正管用的分界线。第一条最贴本章:一件任务,能不能被数据说清楚?能被大量例子描述的,它插值得动;说不清、举不出例子的,就够不着。下一章见。