上一章结尾留了个问题:方案好不好、话得不得体——这些没有硬判官的事,只能让 AI 来当裁判。这就是 AI 交叉质检:让一个(或几个)AI 去评审另一个 AI 的产物。这招很重要,但大多数人的用法是错的——他们打开对话框,把 AI 写的东西粘进去,问一句:「你觉得这个怎么样?」
这一问,基本等于没问。
为什么不能随便让它评
随手一问「怎么样」,你会得到一段四平八稳的表扬加几条不痛不痒的建议。原因有三:
AI 天生爱当老好人。它倾向于让你满意,而不是让你清醒。没有明确评审标准时,「总体上写得很好」是它的默认答案。
没有尺子,就没有度量。「好不好」是个没有刻度的问法。你不给它尺子,它就给你感觉;而它的感觉,本质是另一段未经检验的生成——你等于用一个幻觉去验另一个幻觉。
自评有盲区。让写东西的那个模型自己评自己,就像让考生批改自己的卷子——它的错误来自它的认知,用同一套认知去检查,错误恰好藏在看不见的地方。
正确姿势:先造尺子,再量东西
有效的交叉质检,顺序是反过来的:先定尺子,再评审。具体四步:
- 定维度。先让 AI(或你自己)确定:这份东西从哪几个维度评?比如一份招聘文案,维度可能是:岗位信息准确性、对目标候选人的吸引力、公司调性一致性、合规风险。
- 定指标。每个维度拆成具体指标,并说明指标怎么取值。不是「吸引力好不好」,而是「前两句是否给出候选人关心的具体利益点:有/没有」。
- 定输出格式。评审结果给成什么样?逐维度打分加一句证据,还是只列问题清单?定死它,评审结果才可比较、可追踪。
- 换模型交叉评。有条件的话,用另一个模型来评,而不是生成它的那个。不同模型的盲区不同,交叉之下漏网之鱼少得多。
一个对照例子
坏问法:「这封客户道歉信写得怎么样?」——你会收到「整体真诚得体,建议注意语气」。
好问法:「按四个维度评审这封道歉信:①是否承认了具体错误(有/无,引原文为证);②是否给出补救措施和时间点;③是否出现推卸责任的表述(逐句检查);④语气是否符合我司客服手册第 3 节的规范(附手册原文)。逐维度给结论和证据,最后列一个必须修改的清单。」——这次你收到的是一份能拿去改东西的质检报告。
一句话记住这章:AI 评审的质量,上限由你的尺子决定。尺子是维度、指标、格式三件套;造好尺子再开评,最好换一把「别的品牌的秤」来称。
质检报告也是 AI 产物
最后提醒一句闭环:交叉质检的报告本身也是 AI 生成的,同样适用于前面三章——查它的格式、查它引的证据在原文里是否真存在、抽几条结论代回去验。裁判也需要被监督。
到这里,五大维度走完了四个。但哪怕问题、计划、过程、结果全都做对,还有最后一关必须过:真实世界认不认。下一章讲回到真实环境的反馈闭环。