结果交到你手上了。从这一章开始进入全书最挑战的部分:结果校验——怎么判断 AI 给的东西到底行不行?这件事要分三层做:先看长相(语法层),再看证据来源(数据源层),最后看意思对不对(语义层)。顺序不能乱:长相都不对的东西,没必要讨论它的意思。这一章讲第一层。
什么是语法层
语法层管的是形式:输出的结构、格式、schema 对不对。Schema 翻译成人话就是「规定好的格式清单」——比如一份用户信息表必须包含姓名、电话、邮箱三列,一列都不能少。语法层的校验只回答一个问题:「它长的是不是我要求的样子?」至于内容真假,这层不管。
做法一:格式自测(CF test)
第一个做法叫 CF test,全称 conform test,大白话就是「对照规范自查」。流程是:
- 你先定义一份格式规范。比如让 AI 生成数学练习题,你先写清楚:每道题必须包含题干、四个选项、唯一正确答案、难度标签。
- AI 按规范生成题目。
- 再让它自测:逐题对照规范,检查生成的题目是不是满足格式定义的每一条。
注意这里的巧思:检查格式是一件 AI 自己很擅长的事。判断一道题出得好不好很难,但判断「有没有四个选项」「有没有标答案」是机械核对,AI 做得又快又稳。把校验拆出「它能可靠完成的部分」交给它,你才有精力盯它完成不了的部分。
做法二:结构化结果抽样评审
第二个做法更进一步。AI 生成一大批结构化结果——比如一百条客服回复——你不可能全看。做法是抽取最典型的样本,一个字段一个字段过、一个变量一个变量过。
过完样本还有关键的一步:把你在评审中发现的问题,提炼成一套明确的规则——「回复必须包含道歉句」「金额必须带单位」「不许出现'大概'」——然后用这套规则让 AI 对全部结果做 self test。这样你就完成了一次升级:从「人肉抽查」收敛出一套可执行的检验标准。下一次生成,标准直接内置,质量一轮比一轮稳。
底线:编译和 lint
如果产出是代码或结构化文档,语法层有一条更硬的底线:拿机器去卡。生成的代码拿编译器编一下、拿 lint(静态检查工具,大白话就是「代码的语法老师」)扫一下——编译通过、没有语法结构报错,这是底线。生成的 UAT 测试模板(验收测试清单),一个字一个字过一遍。
语法层的精神:能用机器查的,绝不用眼睛查。机器不疲倦、不偏心、不打哈欠。你的眼睛要留给机器查不了的东西。
这层查不出什么
泼一盆冷水:语法全对的东西,可能错得离谱。四个选项齐全的数学题,答案可以是错的;编译通过的代码,逻辑可以是反的。语法层只是入场券——它保证的是「这份答卷值得被认真批改」。内容可不可信,要看证据从哪儿来,这是下一章的事。