把黑箱拆开:手搓一个大语言模型 书架

导读

从零亲手造一个会说话的 LLM,破解它凭什么'像'有智能的迷

都说它是黑箱:喂它一句话,它就写代码、答问题、安慰你,流利得像藏着一个心灵,于是人们说它"快有意识了",说没人真懂它在想什么。这本书要做的事很简单——把盖子撬开,让你自己往里看。看进去你会有点扫兴:里面没有魔法,没有小人,只有一堆矩阵乘法(把数字排成表格,按固定规则相乘再相加)和一个笨到好笑的目标——猜下一个词

对,就这么个目标。给它半句话,它拼命猜下一个字该是什么,猜错了就挨罚、微调一下,猜上亿亿次。全书的悬念就是这句话:一个只会"猜下一个词"的程序,凭什么最后看起来像懂了?

这本书带你走的路

我们从最朴素的地方起步:怎么把"文字"变成程序能算的数字,怎么让相近的词在坐标里靠在一起;再看神经网络(一个能被数据反复捏形状、去逼近任意规律的大函数)怎么学,看它的心脏——注意力(读一个词时,自动决定该多看前文哪几个词)怎么让机器"抓重点"。然后是训练:所谓学习,不过是沿着一面山坡一小步一小步往下走,找最低点。走到后面,你会撞见真正有意思的问题:为什么模型一大就突然"开窍"?它一本正经地胡说(我们叫幻觉)是从哪冒出来的?它到底是真懂了,还是一个极其高明的模仿者?

压轴是动手:两百行代码,手搓一个能说话的迷你 GPT,再把开源模型请进你自己的电脑里跑起来。到这一步,它对你就不再是黑箱——是你亲手拼起来的东西。

怎么读,读完你会得到什么

你可以从第一章顺流而下,前一块是后一块的地基;也可以哪章标题勾住你就从哪进,每章都尽量自成一段。我不堆大词,每个术语第一次出现就当场用大白话说清;宁可给你一个精准的类比,也不塞一句正确的废话。

读完,你会换上一副新眼镜:既不神化它,也不贬低它——知道哪些是真本事,哪些是错觉。

而当有人再压低声音说"AI 快有意识了、没人能懂",你不会慌。因为你亲手把它搭过一遍,你清楚那底下是什么。拆开过,就不再怕了。

把黑箱拆开:手搓一个大语言模型 · 王建硕
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校