新时代使用 AI 心法 书架

第 10 章 / 共 16 章

第十章 · 让 AI 评 AI

上一章结尾留了个问题:方案好不好、话得不得体——这些没有硬判官的事,只能让 AI 来当裁判。这就是 AI 交叉质检:让一个(或几个)AI 去评审另一个 AI 的产物。这招很重要,但大多数人的用法是错的——他们打开对话框,把 AI 写的东西粘进去,问一句:「你觉得这个怎么样?」

这一问,基本等于没问。

为什么不能随便让它评

随手一问「怎么样」,你会得到一段四平八稳的表扬加几条不痛不痒的建议。原因有三:

AI 天生爱当老好人。它倾向于让你满意,而不是让你清醒。没有明确评审标准时,「总体上写得很好」是它的默认答案。

没有尺子,就没有度量。「好不好」是个没有刻度的问法。你不给它尺子,它就给你感觉;而它的感觉,本质是另一段未经检验的生成——你等于用一个幻觉去验另一个幻觉。

自评有盲区。让写东西的那个模型自己评自己,就像让考生批改自己的卷子——它的错误来自它的认知,用同一套认知去检查,错误恰好藏在看不见的地方。

正确姿势:先造尺子,再量东西

有效的交叉质检,顺序是反过来的:先定尺子,再评审。具体四步:

  1. 定维度。先让 AI(或你自己)确定:这份东西从哪几个维度评?比如一份招聘文案,维度可能是:岗位信息准确性、对目标候选人的吸引力、公司调性一致性、合规风险。
  2. 定指标。每个维度拆成具体指标,并说明指标怎么取值。不是「吸引力好不好」,而是「前两句是否给出候选人关心的具体利益点:有/没有」。
  3. 定输出格式。评审结果给成什么样?逐维度打分加一句证据,还是只列问题清单?定死它,评审结果才可比较、可追踪。
  4. 换模型交叉评。有条件的话,用另一个模型来评,而不是生成它的那个。不同模型的盲区不同,交叉之下漏网之鱼少得多。

一个对照例子

坏问法:「这封客户道歉信写得怎么样?」——你会收到「整体真诚得体,建议注意语气」。

好问法:「按四个维度评审这封道歉信:①是否承认了具体错误(有/无,引原文为证);②是否给出补救措施和时间点;③是否出现推卸责任的表述(逐句检查);④语气是否符合我司客服手册第 3 节的规范(附手册原文)。逐维度给结论和证据,最后列一个必须修改的清单。」——这次你收到的是一份能拿去改东西的质检报告。

一句话记住这章:AI 评审的质量,上限由你的尺子决定。尺子是维度、指标、格式三件套;造好尺子再开评,最好换一把「别的品牌的秤」来称。

质检报告也是 AI 产物

最后提醒一句闭环:交叉质检的报告本身也是 AI 生成的,同样适用于前面三章——查它的格式、查它引的证据在原文里是否真存在、抽几条结论代回去验。裁判也需要被监督。

到这里,五大维度走完了四个。但哪怕问题、计划、过程、结果全都做对,还有最后一关必须过:真实世界认不认。下一章讲回到真实环境的反馈闭环。

新时代使用 AI 心法
费曼式写法 · 由多个 AI 代理撰写与互相审校