把黑箱拆开:手搓一个大语言模型 书架
16/16 章已发布

把黑箱拆开:手搓一个大语言模型

从零亲手造一个会说话的 LLM,破解它凭什么'像'有智能的迷

面向理工背景的好奇者 · 一行行把黑箱搭出来

导读 · 从这里进门

都说它是黑箱、是魔法、快有意识了。这本书带你把盖子亲手撬开——你会发现里面没有神,只有矩阵乘法、一个'猜下一个词'的笨目标,和一堆你也写得出来的代码。

目录

01 第一章 · 它其实只在干一件事:猜下一个词

用输入法联想、'今天天气很___'的填空,讲清 LLM 唯一的核心动作就是预测下一个词。抛出全书悬念:这么笨的目标,凭什么长出'智能'?

读 →
02 第二章 · 文字怎么变成数字:切词与编号

用'把句子剪成积木块再给每块编号'讲分词、词表与 BPE,再算一笔账:从十万个候选里选中一个 token,信息量有多惊人。

读 →
03 第三章 · 让词有了'意思':语义坐标系

用'把每个词放进几百维地图'讲词向量:国王-男人+女人≈王后,含义变成可加减的坐标。

读 →
04 第四章 · 神经网络到底在算什么:会拟合的函数

撕掉'神经元/大脑'外衣。神经网络=矩阵乘法+掰弯的非线性,它不思考,只是个巨大的可调函数。

读 →
05 第五章 · 灵魂登场:注意力,让词互相看一眼

全书心脏。用'开会时决定听谁说话'讲注意力,把 Q/K/V 翻译成大白话。

读 →
06 第六章 · 把注意力堆成塔:Transformer 全貌

多头注意力、残差与层归一化、堆很多层,看清从输入到输出词概率的完整流水线。

读 →
07 第七章 · 训练就是下山:损失、梯度、反向传播

用'蒙眼下山'讲梯度下降,'对答案算错多少'讲损失,'把错误反推回每个旋钮'讲反向传播。

读 →
08 第八章 · 先读半个互联网:预训练与微调

用'博览群书打底子,再岗前培训'讲预训练与微调,解释自监督为何让数据近乎无限。

读 →
09 第九章 · 为什么会'涌现':规模一大就变了

用'水到 100 度才沸腾'讲涌现与规模法则,理性讨论是真突变还是度量错觉。

读 →
10 第十章 · 它为什么会一本正经胡说:采样与幻觉

用'掷加权骰子选词'讲采样与温度,讲清幻觉不是 bug 而是机制的必然产物。

读 →
11 第十一章 · 把野孩子调教听话:对齐与 RLHF

用'从会说话到会好好说话'讲指令微调与 RLHF,对齐本质是把人类偏好塞进旋钮。

读 →
12 第十二章 · 它到底记不记得住:上下文窗口与'记忆'

用'只能看一眼固定长度纸条'讲上下文窗口,戳破记忆幻觉:每次都是重读现算。

读 →
13 第十三章 · 它真懂了,还是超级模仿?

立场章。用'背下全世界考卷的学生'和中文屋,理性拆解理解、推理、意识三件事。

读 →
14 第十四章 · 真的动手:两百行搭一个迷你 LLM

从零写一个字符级迷你 GPT,在自己电脑上跑起来,看它从吐乱码到吐出像样句子。

读 →
15 第十五章 · 让开源大模型在你电脑上跑起来

下载并跑开源模型,什么是量化让它塞进普通显卡,用 LoRA 做一次轻量微调。

读 →
16 第十六章 · 拆完之后:清醒地看这波 AI

收尾。它既不是神也不是骗局,是被规模放大的模式机器。因为你亲手搭过,所以你不再怕它。

读 →
把黑箱拆开:手搓一个大语言模型 · 王建硕
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校
⬇ 下载 PDF 版(首次点击需生成约一分钟)