“这件事有七成把握”“模型准确率超过80%”“专家几乎每次都能判断对”,这些说法听起来很有分量,但它们可能回答的是三种不同问题。七成把握是一项概率预测,80%准确率通常是把结果硬分成“会发生”与“不会发生”后的命中比例,而“几乎每次都对”还可能没有说明总样本和失败记录。
要检验概率预测,不能只问最后猜对没有。一次标为70%的事件没有发生,并不能单独证明预测错误;它本来就允许约30%的失败。真正应检查的是:大量相似预测中,报70%的事件是否大约有70%发生;报20%的事件是否大约有20%发生。这叫概率校准。再配合Brier分数,我们可以把每次概率和实际结果的距离写成可复算的误差,比较不同预测者是否既诚实又有信息量。
一、概率预测不是承诺,而是一组可检验的长期频率
把事件发生记为 y = 1,未发生记为 y = 0,预测概率记为 p。当预测者给出 p = 0.70 时,严谨含义不是“这一次一定成功”,也不是“只要失败就是骗人”,而是:在条件相近、同样被预测为70%的一批事件中,长期发生比例应接近70%。
因此,不能用一个结果评价校准。若今天的70%预测没有发生,误差值得记录,但至少还需要许多事前留下的同类预测。反过来,一次10%概率的小概率事件真的发生,也不说明预测者必然低估了风险;10%本来就意味着平均约十次中可能出现一次。
检验前还要把事件写清楚。例如“系统可能异常”过于含糊,而“未来24小时内是否出现一次持续十分钟以上、影响指定服务的中断”才有明确对象、期限和判定标准。没有事先固定口径,预测者可以在结果出来后改变解释,任何数字都会变得难以证伪。
二、怎样画出一张校准表
假设我们收集了很多事前预测,可以按概率分组,例如把65%到75%的预测放入“约70%”一组。然后计算这一组的实际发生率:
实际发生率 = 该组实际发生次数 ÷ 该组预测总数
如果“约70%”组有100次预测,其中68次发生,那么观察频率是:
68 ÷ 100 = 68%
68%与组内平均预测概率接近,说明这一组校准尚可。如果只有40次发生,观察频率为40%,预测者就明显过度自信;如果有90次发生,则可能过于保守,或者分组、人群、时间环境已经改变。
把每个概率组的平均预测值放在横轴、实际发生率放在纵轴,就得到校准图。理想状态下,各点靠近从左下到右上的对角线。点落在对角线下方,表示报出的概率通常高于实际发生率;点落在上方,则表示实际发生率高于所报概率。
分组只是为了看清趋势,分组边界会影响图形。样本很少时,某一组的发生率也会剧烈波动,所以应同时报告每组数量,并在不同时间段或新样本中复核,不能只挑一张最漂亮的校准图。
三、Brier分数:把每次概率误差平方后取平均
校准图适合观察整体形状,Brier分数则给出一个总体误差。对二元事件,每次预测的误差为:
(p - y)²
把所有预测的平方误差相加,再除以预测次数 n:
Brier分数 = Σ(p - y)² ÷ n
分数范围是0到1,越小越好。预测100%且事件发生,误差是 (1 - 1)² = 0;预测100%但事件未发生,误差是 (1 - 0)² = 1。平方会显著惩罚自信却错误的预测。
看一个四次预测的虚构例子。预测概率依次为90%、70%、60%、20%,实际结果依次是发生、未发生、发生、未发生,即:
- 第一次:
(0.90 - 1)² = 0.01; - 第二次:
(0.70 - 0)² = 0.49; - 第三次:
(0.60 - 1)² = 0.16; - 第四次:
(0.20 - 0)² = 0.04。
总误差为 0.01 + 0.49 + 0.16 + 0.04 = 0.70,所以:
Brier分数 = 0.70 ÷ 4 = 0.175
第二次的70%预测落空,贡献了0.49,是总误差的主要来源。这不表示一次落空就判定整个系统失效,而是说明高把握错误必须留下较大惩罚,不能与接近五五开的谨慎判断等量处理。
四、只看“猜对几次”会丢掉多少信息
若以50%为阈值,把概率大于50%都判断为“会发生”,上例的硬分类依次是会、会、会、不会,四次中猜对三次,准确率是:
3 ÷ 4 = 75%
现在假设另一位预测者对同四件事分别报60%、55%、52%、48%。硬分类完全相同,所以准确率仍是75%。但其Brier分数为:
[(0.60-1)² + (0.55-0)² + (0.52-1)² + (0.48-0)²] ÷ 4
= (0.16 + 0.3025 + 0.2304 + 0.2304) ÷ 4 ≈ 0.2308
在这组数据上,第一位预测者的0.175更低。两者虽然硬分类命中率相同,概率质量却不同。准确率把51%和99%都压成同一个“会”,无法区分谨慎判断与极强信心,也看不见极强信心落空时应有的更大代价。
不过,四次样本只能演示计算,不能给出稳定排名。真正比较时要使用足够多、口径一致、未被筛选的事前预测,并在新的留出样本上复核。
五、校准好不等于预测有用:还要看区分度
假设某类事件长期有一半会发生,一个永远报50%的预测者可能校准得不差,但它没有区分哪些事件风险高、哪些风险低。好的预测不仅要让“报70%的一组约有70%发生”,还应在证据充分时敢于把不同事件分开:更可能发生的给较高概率,更不可能发生的给较低概率。
这通常称为区分度或分辨能力。校准回答“概率数字是否可信”,区分度回答“预测是否能把高风险和低风险对象拉开”。两者缺一不可:总报极端概率可能看起来有判断力,却会被自信错误重罚;总报基准率可能稳妥,却无法帮助排序和行动。
比较Brier分数时还要设置简单基线。例如,若历史上目标事件发生率为30%,一个不看任何信息、始终报30%的基线也有自己的分数。复杂模型若在新数据上没有稳定优于基线,就不能仅凭界面更漂亮、术语更多或个别案例更成功而宣称更可靠。
六、评价一套概率预测的七步流程
第一步,事前定义事件。写明对象、时间窗口、发生标准和数据来源,防止结果出来后改口径。
第二步,保留全部预测。记录时间戳、原始概率和后续结果;撤回、失败和低把握预测不能从分母中消失。
第三步,检查环境是否一致。训练期与评估期、不同人群、不同地区或不同版本不能随意混在一起。
第四步,画校准图。按概率分组,报告每组平均预测、实际发生率和样本量,观察是否系统性过度自信或过于保守。
第五步,计算Brier分数。逐项保留 (p-y)²,避免只展示平均值而无法审计异常预测。
第六步,与基线和替代方案比较。至少比较长期发生率基线,并尽量使用没有参与调参的新样本。
第七步,把决策代价单独写出来。Brier分数评价概率误差,却不会自动告诉你该采取什么行动。漏掉一次高风险事件和多做一次低成本检查的代价可能不同,行动阈值应根据损失、可逆性和资源限制设定。
七、五个常见误区
误区一:一次70%预测失败,就证明概率造假。 单次结果只能贡献一次误差,校准需要一批同口径预测。应记录而不是立即下结论。
误区二:准确率高,概率就一定可靠。 准确率依赖阈值,不评价51%与99%的差别。概率预测应同时检查校准、Brier分数和区分度。
误区三:只保留公开过的成功预测。 事后删掉失败、撤回或模糊预测,会同时扭曲分母和误差。完整时间戳记录比精选截图重要。
误区四:结果出来后再修改概率。 事后解释不是预测。概率必须在事件结果可知之前冻结,才能检验。
误区五:分数更低就能证明因果或保证未来。 Brier分数只评价已定义任务上的概率质量。数据泄漏、环境变化和选择偏差仍会让历史好成绩失效。
八、理性决策与反诈提示
“模型准确率95%”“老师十次押中九次”“内部预警从不出错”都可能利用同一种信息缺口:只报命中,不公开每次事前概率、完整分母、失败记录和评估口径。看到这类宣传,先要求可核验的连续记录,再问是否在独立样本上优于简单基线。
任何预测分数都不能代替身份核验和资金安全。如果对方以“高胜率”“限时信号”或“系统确定”为由要求转账、垫资、共享屏幕、提供验证码或安装不明软件,应立即停止。不要为了验证预测而追加资金;应通过官方网站和自己保存的可靠联系方式独立核实,涉及损失时及时联系银行、支付机构及当地警方或反诈渠道。
总结
概率校准检验的是:一批报70%的事件是否大约有70%发生;Brier分数则把每次预测与0、1结果的距离平方后取平均,对自信错误给予更大惩罚。它们比单看命中率保留了更多信息,但仍需完整样本、事前冻结、明确口径、基线比较和新数据复核。
面对“七成把握”,最理性的反应不是相信或否定一个孤立数字,而是追问这组概率能否长期兑现、是否优于简单基线、失败是否完整保留,以及行动代价是否可承受。能被连续记录、复算和独立检验的概率,才有资格进入决策。
