从零亲手造一个会说话的 LLM,破解它凭什么'像'有智能的迷
导读 · 从这里进门都说它是黑箱、是魔法、快有意识了。这本书带你把盖子亲手撬开——你会发现里面没有神,只有矩阵乘法、一个'猜下一个词'的笨目标,和一堆你也写得出来的代码。
用输入法联想、'今天天气很___'的填空,讲清 LLM 唯一的核心动作就是预测下一个词。抛出全书悬念:这么笨的目标,凭什么长出'智能'?
读 → 02 第二章 · 文字怎么变成数字:切词与编号用'把句子剪成积木块再给每块编号'讲分词、词表与 BPE,再算一笔账:从十万个候选里选中一个 token,信息量有多惊人。
读 → 03 第三章 · 让词有了'意思':语义坐标系用'把每个词放进几百维地图'讲词向量:国王-男人+女人≈王后,含义变成可加减的坐标。
读 → 04 第四章 · 神经网络到底在算什么:会拟合的函数撕掉'神经元/大脑'外衣。神经网络=矩阵乘法+掰弯的非线性,它不思考,只是个巨大的可调函数。
读 → 05 第五章 · 灵魂登场:注意力,让词互相看一眼全书心脏。用'开会时决定听谁说话'讲注意力,把 Q/K/V 翻译成大白话。
读 → 06 第六章 · 把注意力堆成塔:Transformer 全貌多头注意力、残差与层归一化、堆很多层,看清从输入到输出词概率的完整流水线。
读 → 07 第七章 · 训练就是下山:损失、梯度、反向传播用'蒙眼下山'讲梯度下降,'对答案算错多少'讲损失,'把错误反推回每个旋钮'讲反向传播。
读 → 08 第八章 · 先读半个互联网:预训练与微调用'博览群书打底子,再岗前培训'讲预训练与微调,解释自监督为何让数据近乎无限。
读 → 09 第九章 · 为什么会'涌现':规模一大就变了用'水到 100 度才沸腾'讲涌现与规模法则,理性讨论是真突变还是度量错觉。
读 → 10 第十章 · 它为什么会一本正经胡说:采样与幻觉用'掷加权骰子选词'讲采样与温度,讲清幻觉不是 bug 而是机制的必然产物。
读 → 11 第十一章 · 把野孩子调教听话:对齐与 RLHF用'从会说话到会好好说话'讲指令微调与 RLHF,对齐本质是把人类偏好塞进旋钮。
读 → 12 第十二章 · 它到底记不记得住:上下文窗口与'记忆'用'只能看一眼固定长度纸条'讲上下文窗口,戳破记忆幻觉:每次都是重读现算。
读 → 13 第十三章 · 它真懂了,还是超级模仿?立场章。用'背下全世界考卷的学生'和中文屋,理性拆解理解、推理、意识三件事。
读 → 14 第十四章 · 真的动手:两百行搭一个迷你 LLM从零写一个字符级迷你 GPT,在自己电脑上跑起来,看它从吐乱码到吐出像样句子。
读 → 15 第十五章 · 让开源大模型在你电脑上跑起来下载并跑开源模型,什么是量化让它塞进普通显卡,用 LoRA 做一次轻量微调。
读 → 16 第十六章 · 拆完之后:清醒地看这波 AI收尾。它既不是神也不是骗局,是被规模放大的模式机器。因为你亲手搭过,所以你不再怕它。
读 →