给这台「说话机器」装上手脚
到这里,你已经知道 AI 助手的全部家底:它博学、会说、偶尔胡说、没有记忆、没见过世界。一个自然的问题是:这样的东西,怎么就变成了新闻里那个「能帮你订机票、写程序、做研究」的 AI?
答案出人意料地简单:装上手脚。
回想一下,模型唯一的本事是「输出文字」。但如果它输出的某段文字,不是给人看的,而是给一个程序看的指令呢?比如它输出「调用搜索引擎,关键词:明天北京天气」,外面的程序收到这串字,真的去搜了,把结果再喂回给它,它接着回答你。这一下,局面全变了——
模型不会查实时天气?让它调用搜索。模型算数会错?让它调用计算器。模型记不住事?给它接一个数据库,每次对话前把相关资料先塞给它。模型的每一个短板,都可以用一个外部工具补上。这个思路叫工具调用——大白话:模型负责动脑子决定「该干什么」,工具负责动手把它干成。它自己够不着的,就指挥够得着的。
大白话:一个绝顶聪明但卧床不起的人,配上电话、电脑和一群跑腿,照样能开公司。模型就是那个大脑,工具调用就是它的电话和跑腿。
再往前一步:让模型不只调一次工具,而是循环——「想清楚要干什么 → 调用工具 → 看结果 → 再想下一步 → 再调用」,直到把一件事办完。这种「能自己一步步把任务做下去」的 AI,就是现在常说的Agent(智能体)——大白话:不只回答问题,还能领任务、跑腿、交差的 AI。2025 年前后 AI 应用的主线,基本就是这条路:大脑还是那台猜词机器,但接上手脚、配上循环之后,它从「聊天对象」变成了「能干活的同事」。你现在正在读的这本书,就是这样一个 Agent 写出来的。
普通人最该养成的四个习惯
原理讲完了,落到地上。这本书的读者不需要会训练模型,但值得把下面四个习惯刻进日常:
一、把 AI 当实习生,不当算命先生。它精力无限、博闻强记、随叫随到、从不抱怨,但会犯错、会讨好、会不懂装懂。好用法是带实习生那套:交代清楚背景和目标,验收它的产出,重要的活给它分小步走,别一句话扔过去指望它读心。
二、给它上下文,它才给得出好答案。模型每一轮能看到的只有你塞给它的东西。「帮我改改这段话」和「这段话是发给客户的第一封邮件,客户是谨慎的德国采购,帮我改得更简洁专业」——同一个模型,产出天差地别。你给的背景,就是它眼里全部的世界。
三、事实要核实,创意可放手。第九章的铁律再强调一次:凡是要拿去用的具体事实、数字、引用,必须查证;凡是语言、结构、创意类的活儿,放心交给它。分不清哪类的时候,默认查证。
四、把它当「对话对象」,不当「搜索引擎」。它最大的价值在一来一回的追问里:「再简单点」「举个反例」「如果预算砍一半呢」「用我奶奶能懂的话再讲一遍」。一次提问得到一个平庸答案就放弃的人,和追问五轮拿到惊艳产出的人,用的其实是同一台机器。区别在用法,不在机器。
回到最初的问题
这本书从一个无聊的事实出发:计算机只会搬数字。十章走下来,我们看到了这条链——
文字切成 token,token 落进一张意义的地图;「学会说话」被压缩成「猜下一个词」这场可以打分的考试;注意力让每个词环顾全场;几十亿次「做题、对答案、拧旋钮」把人类文本里的规律压进一台机器;规模大到某个点,能力突然开窍;再经示范课和打分行两轮调教,这台「世界的压缩机」学会了当助手;最后接上工具,它开始会做事。
那么,最初那个问题——「一个只会算数的机器,怎么就学会了说话?」——现在有答案了:它不是被谁教会了规则,而是在足够大的数据、足够巧的结构、足够狠的算力之下,把人类写在文字里的世界,压缩进了自己身体里的几十亿个旋钮。它会说话,是因为我们说过的话都在里面。
某种意义上,你每次和它对话,都是在和整个人类文明的文本遗产对话——经过压缩、重组、能即时回应你的那种。这台机器到底是镜子、是工具、还是别的什么,历史还没写完答案。但至少从现在开始,它对你不再是黑箱。
这就够了。去用它吧。