你说「八成能成」,是哪来的八成?
前面八章把概率当客观对象来研究。现在转个身:当你自己说「这个项目八成能成」「这事我 90% 有把握」时,这些数字配被信任吗?
好消息是,这不是品味问题,有客观的判卷方法。坏消息是,未经训练的人类在这张考卷上普遍不及格——好消息的另一半是,它可以练,而且练法简单得让人失望。
校准:说 70% 的事,就该七成发生
评判概率的第一把尺子叫校准:把你所有「70% 把握」的预测收集起来,其中应该约 70% 真的发生;「90% 把握」的应约 90% 发生。大白话:你的信心刻度得和现实的命中率对得上。
经典的失败样本是普通人做常识填空题:「我有 90% 把握尼罗河比长江长」——让受试者给几百道题标信心,结果「90% 有把握」的答案只对了约 75%。这叫过度自信:信心跑得比准确率快,是人脑出厂自带的系统性偏差,在专家身上同样存在(有些研究里更严重)。
经典的及格样本是天气预报员。美国国家气象局几十年前就开始给「降水概率 30%」这类预测做校准统计:所有报 30% 的日子,真的约 30% 下了雨。为什么他们能行?三个条件:预测被逐条记录、结果及时反馈、同一类事件反复出现。这恰好是大多数人生决定缺的三样东西——你的「这次创业七成能成」永远没人对账。
Brier 分数:给每个概率打的分
校准只是一半。一个永远说「50%」的人在抛硬币预测上校准完美,但毫无价值——他不提供区分度。所以需要一把同时奖励「准」和「敢」的尺子:Brier 分数,每题得分 = (你报的概率 − 实际结果)²,实际发生记 1、没发生记 0,分数越低越好,平均一大批预测就是你的水平。
平方是精髓。报 90% 而结果没发生,损失 (0.9)² = 0.81;报 60% 而没发生,只损失 0.36。过度自信被平方项加倍惩罚,所以 Brier 分数下最优策略永远是报出你的真实信念——想靠「往中间缩」刷分反而更糟(这种性质叫严格适当,行话叫 proper scoring rule)。它把「诚实」变成了数学上的最优解。
预测锦标赛:赢家用的方法
2011 年起,心理学家菲利普·泰特洛克(Philip Tetlock)办了著名的「良好判断计划」,参加美国情报界(IARPA)主办的预测锦标赛:几百个地缘政治问题(「朝鲜明年会进行核试验吗」),数千名志愿者给出概率,用 Brier 分数排名。结果打败了对照组约 30%,前 2% 的「超级预测者」甚至压过了能接触机密情报的职业情报分析师。
赢家们的方法没有魔法,泰特洛克总结下来核心就这么几条:
- 先看基准率(outside view):不问「这事多特殊」,先问「这类事 historically 多常发生」。预测一家创业公司成败,先查同类公司五年存活率(约一半),再从 50% 出发调整——而不是从创始人的激情出发。
- 把问题拆碎(费米估算):「他当选的概率」拆成党内提名概率 × 大选条件概率,每个子问题的基准率都好查,误差互相抵消。
- 小步高频更新:新证据来了就调,每次调一点(10% 而不是 50%),既不装死也不翻烧饼。
- 精确到个位:超级预测者会报 63% 而不是「六成多」。这不是装腔,是逼自己做区分——「差不多」是校准最大的敌人。
- 对账:记录自己说过的每一个概率,事后算分。这是唯一不可省略的一条。
大白话:估概率的手艺 = 从基准率出发 + 小步更新 + 逐条对账。它更像会计而不是占卜:赢家不是看得最远的人,是账记得最诚实的人。
一个能今晚就用的练习
从今晚开始,建一个表格:左边写下你对未来一两周可验证之事的概率预测(「周五前 PR 会合并:70%」「这个月会去健身 8 次以上:60%」),右边到点填结果。攒到三五十条,画一张校准图。你会亲眼看到自己的过度自信长什么样——多半「90%」的那栏只中了 70%。然后调。
这个练习改变的不是数字,是关系:你和「不确定」之间,从一笔糊涂账变成了一本能对账的账。下一章讲对账之后怎么办——证据来了,信念具体该怎么动。