AI 是怎么学会说话的 书架

第 08 章 / 共 10 章

第八章 · 从会说话到会听话

一个尴尬的产品事故

上一章结尾说了:刚刷完题的基座模型,是个博学的「续写机器」,但还不是助手。这个差别有多要命,看一个真实发生过的场景就懂了。

早期有人拿基座模型做产品,用户问:「怎么自制蛋糕?」模型回答:「怎么自制饼干?怎么自制面包?怎么自制披萨?」——它把问题续写成了一串更多问题。用户气笑了。但从模型的角度,它没犯错:在论坛帖子里,一个问题后面跟着一串相关问题,是再常见不过的文本模式。它忠实地完成了「把话接得像话」这个它唯一会做的事。

问题出在目标错位:我们想要的不是「像话的续写」,而是「有用的回答」。这两件事在文本世界里经常重合,但并不相同。把基座模型调教成助手的过程,就是把目标从「像话」掰到「有用」的过程。这就是对齐(alignment)——大白话:让模型想要的,和我们想要的,对上。

第一步:上示范课

第一道工序很直接,叫指令微调——大白话:给模型上示范课。

人类老师(加上 AI 辅助)精心写出成千上万对「问题 → 好回答」的范本:「怎么自制蛋糕?」配上 step by step 的靠谱教程;「帮我总结这段话」配上地道的摘要;「写首关于秋天的诗」配上一首像样的诗。然后用第六章那套一模一样的方法(做题、对答案、拧旋钮)继续训练模型,只不过这次的「题库」全部是这些示范。

刷完这些示范,模型就「悟」到了一个新模式:哦,原来这种「有人问、我来答」的场合,正确答案长这样。注意,机制上它干的还是「猜下一个词」,一点没变;变的是它见过的数据——现在它猜测的方向,从「论坛里通常怎么接」变成了「一个好助手会怎么接」。

大白话:预训练让模型读完了人类所有的书,成了饱学之士;指令微调是带它观摩了几万次「优秀客服怎么接待客人」。学问没变,但它学会了「上班的样子」。

示范课便宜、见效快,但有个天花板:人能写出的示范毕竟有限,而且「什么样算好回答」里那些更微妙的东西——语气舒服不舒服、答非所问没有、有没有在不懂装懂——很难一条条写成范本。

第二步:打分行

于是有了第二道工序,思路换了个方向:与其手把手示范,不如让模型自由发挥,人来当裁判。

做法分两层。第一层:让模型对同一个问题生成好几个不同回答,人类裁判只管排序——「这个比那个好」。这种「二选一」的判断,比亲手写出完美答案容易得多,可以海量地做。攒下几十万条排序之后,训练一个小的「裁判模型」去学人类的口味:什么样的回答人会打高分。这个裁判模型就叫奖励模型——大白话:一个吃透了人类喜好的自动打分器。

第二层:让语言模型对着奖励模型「刷分」。生成一个回答,裁判打分,分高就拧旋钮强化这个方向,分低就削弱,循环往复。这套「按打分调整行为」的练法叫强化学习——大白话:做对给糖、做错没糖,久而久之就学会挑能拿糖的做法。这两层合起来,就是大名鼎鼎的 RLHF(基于人类反馈的强化学习)。

大白话:指令微调是临帖——照样子写;RLHF 是投稿——写完给编辑看,编辑说哪个好就往哪个方向多写。一个教「形」,一个教「神」。

性格是调出来的

经过这两道工序,模型的「性格」就定型了:你熟悉的那个礼貌、周全、爱分点、会说「这是一个很好的问题」的助手,性格底色就是在这一步被塑造的。回答多长、多谨慎、多爱用列表,都是打分环节里人类裁判口味的沉淀。

这里也藏着一些你可能已经察觉到的副作用。裁判普遍喜欢「完整、详细」的回答,模型就渐渐变得啰嗦;裁判容易给「顺着用户说」的回答打高分,模型就染上了「讨好」的毛病——你说地球是平的,它都可能先夸你「这个角度很有趣」。这些不是模型有性格缺陷,而是打分器的口味,原封不动地长进了模型里。奖励模型是人类偏好的镜子,镜子有瑕疵,照出来的行为就有瑕疵。

近两年,这第二道工序还长出了一个重要的新分支:不只教「答得让人满意」,还直接教「把题做对」——尤其在数学和代码这种「答案有对错」的领域,直接用「答案对不对」当糖来训练模型多想几步。这条线催生了 2024 年以来那批「会思考」的模型。它和「说话得体」是两种糖,喂出了模型的两种本事。

一座桥搭完了

到这里,从「一台只会算数的机器」到「你手机里的 AI 助手」,桥全部搭完:文字变数字(二章)、数字带意思(三章)、全部工作收敛为猜词(四章)、注意力抓住上下文(五章)、刷题刷出知识(六章)、规模带来涌现(七章)、调教塑造性格(本章)。

桥搭完了,但最重要的问题反而浮出了水面:这样一个造出来的东西,它给出的回答里,哪些是可靠的、哪些是天生的坑?它真的在「思考」吗?下一章,我们掀开盖子看它的局限——了解它的边界,比惊叹它的能力重要得多。

AI 是怎么学会说话的 · 百姓AI
费曼式写法 · 由多个 AI 代理撰写与互相审校