前面两章讲的是硬东西:Colossus 有多少张卡(算力),Grok 追到了什么位置(能力)。这两样都能上秤称。可 AI 圈里最响的一句话不是数字,是形容词——「最聪明的 AI」「遥遥领先」「全球第一」。这一章我们只干一件事:把这类句子拆开,看看里面有多少是真本事,多少是化妆品。
先说结论,免得你被绕晕:跑分领先常常只是「口号」层的包装,它离「到你手上好不好用」隔着一条不小的鸿沟。这鸿沟怎么来的,正是本章要讲的机制。
benchmark 是什么:一套全班统考的卷子
benchmark(基准测试,俗称跑分)就是一套标准考题——一堆数学题、一堆代码题、一套常识问答、一份综合知识考试。让不同的模型做同一套题,按答对的比例排名。
说人话:就像全区统考。所有学校用同一张卷子,改完排个名次,你就能说「A 校比 B 校强」。它的价值就俩字——可比。没有统一的卷子,各家各说各话,没法比。
所以 benchmark 本身是个好东西,是行业里少有的、能把「谁强谁弱」量化下来的工具。问题出在下一句:正因为它是一套固定的、公开的考题,它就能被针对。凡是能被提前知道的考试,都能应试。
为什么刷榜能刷:三种「作弊」的机制
一、考前背到了原题(数据污染)
训练一个大模型,要喂它海量互联网文本。而互联网上本来就飘着各种公开题库、往年真题、带答案的习题集。如果某套 benchmark 的题目(或者跟它长得几乎一样的题)不小心混进了训练数据,会发生什么?
模型等于考前背到了原题。考试时它不是在推理,是在回忆。这个现象有个名字,叫 数据污染(test set contamination,测试集污染)——本该「考试才第一次见」的题,训练时已经见过了。
打个比方:高考本该考你的真实水平,但如果这届考生考前拿到了原卷背了答案,考出来的高分说明的是「记性好」,不是「会做题」。分数虚高,能力没涨。
关键在于:数据污染很难完全避免,哪怕厂商没有故意作弊。因为公开题库本来就在语料里,除非评测方把题目严格保密、动态更换,否则污染是默认会渗进来的背景噪音。所以看到一个高得离谱的分,第一反应不该是崇拜,而是问一句:这套题它训练时见没见过?
二、专门刷这类题型(针对性优化)
就算没背到原题,还有一招更「合法」:知道要考什么,就专门练那个题型。
知道要考数学竞赛题,就在类似的竞赛题上加训一轮;知道评测用某种固定的答题格式,就把模型调成最爱吐那种格式;知道用某种提问方式打分,就针对那种提问优化。分数唰地上去了。
就像一个学生只刷高考真题的题型,模拟考次次高分。但换一道没见过的、拐了个弯的新题,他就懵了。分数上去了,泛化能力(举一反三的真本事)没上去。
这就是为什么很多模型在榜单上耀眼,你拿自己的活儿一试却平平——它优化的是「考试」,不是「你的任务」。
三、自己报成绩,还挑对自己有利的比
第三层水分在发布环节。厂商发新模型时晒的那张对比图,几乎总是自己报的成绩,而且哪儿有利挑哪儿:
- 挑对自己有利的评测集——赢的榜放上去,输的榜不提。
- 挑对手的弱版本——拿自家最新款,去比对手上一代,或对手的小号模型。
- 挑对自己有利的设置——给自己开各种技巧(多跑几次挑最好的、给足思考步骤),给对手用朴素设置。
这就是广告的老套路:「本产品去污能力是普通品牌的两倍」——普通品牌是哪个?什么条件下测的?谁测的?广告不会告诉你。AI 的对比图,本质是同一种广告,裁判和运动员是同一个人。
所以「自己报的成绩」和「有独立第三方复现的成绩」,分量完全不同。前者是宣传材料,后者才接近证据。
榜单和「真好用」之间那条鸿沟
退一万步,就算某个分数干干净净、没污染、没针对、第三方也复现了——考试高分,仍然不等于干活好用。
因为你真实工作里遇到的东西,榜单大多测不到:
- 长对话:聊到第二十轮还记不记得前面说过啥。
- 模糊需求:你没说清楚时,它会追问还是瞎猜。
- 你的私有上下文:你公司的黑话、你项目的代码风格,考题里没有。
- 可靠性和速度、成本:偶尔答对没用,得每次都稳、还得快、还得便宜。
- 不乱编:这条最要命——幻觉指模型一本正经地编造不存在的事实,语气笃定、内容全假。榜单上答对一道题,不代表它在你的场景里不会睁眼说瞎话。
这些「软」指标,恰恰是决定一个模型能不能真正帮到你的关键,而它们很难被一套固定考题量化。榜首 ≠ 最好用,这条鸿沟是结构性的。
也得给 benchmark 说句公道话
别矫枉过正。benchmark 不是没用,它是个粗筛工具:能挡掉明显差的。一个连基础数学题都做不对的模型,你确实不用考虑。它的作用像体检的基础指标——不能告诉你谁是运动健将,但能筛出明显不健康的。
而且好的评测一直在进化,专门跟这些水分对着干:
- 防污染:题目保密、定期换新题、用最近才发生的事出题(训练时不可能见过)。
- 动态题:每次生成新题,让你没法背。
- 竞技场式评测(arena,人类盲评对战):让两个匿名模型同答一个真实用户的问题,用户不知道谁是谁,凭「哪个回答更好」投票。因为题目是真人现场提的、答案当场比、评委是人,针对性刷分和背题都很难使上劲。这类评测更贴近「真实好不好用」。
所以正确姿势不是「跑分全是骗人的」,而是:把跑分当粗筛,别当判决。
交付:听到「最强」,问这五件事
这是本章要你带走的东西。下次再听到「最聪明」「遥遥领先」「全球第一」,别急着信也别急着骂,问五个问题:
- 什么任务?——是数学、写代码、还是聊天?「最强」在哪个具体活儿上成立?
- 什么评测集,多新,会不会已被污染?——老题库、公开题库,污染风险高;最近的新题、保密题,才更可信。
- 跟谁的哪个版本比,什么设置?——比的是对手的最新款还是老款、小号?双方设置公不公平?
- 是不是厂商自报,有没有第三方复现?——只有一张官方 PPT,还是有独立机构、竞技场投票印证?
- 到你自己的真实场景还成立吗?——这是终极一问。最靠谱的办法,是拿你手头真实的活儿,让它小测一把。你自己的任务,是唯一没法被别人提前刷分的考卷。
用三层尺子拧干水分
回到全书那把尺子。跑分数字,很多时候待在最上面那层——「口号」层:它是给你看的、经过化妆的、挑好角度拍的宣传照。
把它拧干的办法,是往下沉到「现金 / 物理」那种实证的层面——不问它自称多强,只问一件事:在我自己的真实任务上,它能不能稳定地把活儿干好。算力和能力可以称,话术不能称;能称的地方看数据,不能称的地方,就用你自己的活儿去试。
榜单告诉你「谁考得高」,你的真实任务告诉你「谁靠得住」。前者是口号,后者才是现金。中间那条鸿沟,就是这一章要你随身带着的那把尺子。