从一串数字到会写诗的机器:大语言模型工作原理
导读 · 从这里进门先别管神经网络,先想想你小时候学说话的那个下午。
计算机的本质是按规则搬数字;那「理解语言」这件事从哪儿冒出来?
读 → 02 第二章 · 把词切成数字分词与 token:文字怎么变成机器能算的东西
读 → 03 第三章 · 词语的地图词嵌入:为什么「国王−男人+女人≈女王」,语义如何变成几何
读 → 04 第四章 · 就猜下一个词语言模型的全部工作:预测下一个词;为什么这件事难到离谱、强到离谱
读 → 05 第五章 · 注意力:不再逐字读书Transformer 的注意力机制怎么解决长距离指代
读 → 06 第六章 · 一本错题本的故事用错题本讲清训练、损失与梯度下降;预训练到底在干什么
读 → 07 第七章 · 大力出奇迹规模定律与涌现:为什么模型大了会突然会了小模型不会的事
读 → 08 第八章 · 从会说话到会听话指令微调与人类反馈:模型怎么学会「当助手」而不是「续写」
读 → 09 第九章 · 它真的会思考吗推理、幻觉与局限:它知道什么、不知道什么、为什么会一本正经地胡说
读 → 10 第十章 · 学会和 AI 相处工具调用与 agent;普通人使用 AI 的正确姿势(结语)
读 →