比较两个方案时,我们常把总成功数除以总人数,再用一个百分比决定谁更好。但有一种看似矛盾的情况:方案A在简单任务中成功率更高,在困难任务中也更高,合并全部任务后,总成功率却低于方案B。这不是算术失灵,而是两个方案面对的任务构成不同,分组权重改变了汇总结果。
这种“分组趋势与总体趋势方向相反”的现象通常称为辛普森悖论。它提醒我们:百分比不仅由组内表现决定,也由各组在总体中占多大比例决定。本文用一组完全虚构、可复算的数据说明反转怎样发生,以及面对课程完成率、产品转化率、服务成功率或网络宣传数据时,怎样避免被单一总数带偏。
一、先看一个反直觉的完整例子
假设我们比较两套学习方案A和B,参加者完成的任务分为“简单”和“困难”两类。为了避免现实身份、平台和商业因素干扰,下面所有数字只用于概率教学。
方案A处理20个简单任务,成功18个,成功率为:
18 ÷ 20 = 90%
它还处理80个困难任务,成功56个,成功率为:
56 ÷ 80 = 70%
方案B处理90个简单任务,成功72个,成功率为:
72 ÷ 90 = 80%
它处理10个困难任务,成功6个,成功率为:
6 ÷ 10 = 60%
分组比较很清楚:简单任务中A的90%高于B的80%;困难任务中A的70%也高于B的60%。如果只看同难度比较,A在两组都高出10个百分点。
二、合并后为什么是B的总成功率更高
现在把两类任务分别合并。方案A总共成功 18 + 56 = 74 个,总任务数是100,因此总成功率为74%。方案B总共成功 72 + 6 = 78 个,总任务数同样是100,因此总成功率为78%。
于是出现了反转:A在每个难度组内都更高,总体却是B的78%高于A的74%。关键不在成功率计算方式,而在任务构成。
方案A的100个任务中,简单任务只占20%,困难任务占80%;方案B正好相反,简单任务占90%,困难任务只占10%。简单任务本来就更容易成功。B的大多数观察值来自高成功率的简单组,而A的大多数观察值来自低成功率的困难组。总体比较同时混入了“方案表现”和“任务难度构成”两种差异。
三、用加权平均把反转写清楚
总体成功率可以写成各分组成功率的加权平均。权重就是该组样本量占总体的比例。
方案A的计算是:
20% × 90% + 80% × 70% = 18% + 56% = 74%
方案B的计算是:
90% × 80% + 10% × 60% = 72% + 6% = 78%
A在每个组内都领先,但它把更大的权重放在70%的困难组;B虽然组内都较低,却把90%的权重放在80%的简单组。加权平均由“组内数值”和“组的权重”共同决定,只比较前者或只比较最终平均值都会丢失信息。
这也说明为什么不能把两个百分比直接做普通平均。A的 (90% + 70%) ÷ 2 = 80% 没有考虑两个组分别有20和80个任务;B的 (80% + 60%) ÷ 2 = 70% 也忽略了90和10的样本差异。只有当各组样本量相同,简单平均才与按人数加权的总体一致。
四、分组结论和总体结论回答的不是同一个问题
“A在每个难度下是否表现更好”是条件比较:给定任务难度后,比较A与B。“哪套方案的全部记录中成功比例更高”是总体比较:不固定难度,把实际样本构成也算进去。
这两个问题都可以有正确答案,却服务于不同决策。如果想判断方案本身在相似条件下的表现,分层比较通常更有解释力;如果想描述某段时间实际完成了多少,总体成功率也有价值,但不能自动解释原因。
辛普森悖论并不表示“分组一定比汇总正确”,也不表示看到反转就能证明因果。难度可能是关键分层变量,也可能还有时间、地区、用户经验、设备类型等因素。选择分层方式必须依据问题机制,而不是为了得到喜欢的结论不断切分数据。
五、用统一权重做一次公平对照
若目的是比较方案而不是比较任务构成,可以让两套方案使用同一组权重。假设把简单和困难任务都按50%计入标准化结果:
方案A:
50% × 90% + 50% × 70% = 80%
方案B:
50% × 80% + 50% × 60% = 70%
统一权重后,A仍在相同任务构成下领先10个百分点。这里的80%和70%不是原始总体成功率,而是为了比较而计算的标准化指标。报告时必须明确权重从哪里来,不能把标准化结果冒充实际发生率。
更稳妥的做法通常是同时展示三层信息:每组的成功数与总数、各组成功率、实际总体与标准化总体。这样读者能看见分母、权重和选择规则,而不是只接收一个脱离结构的百分比。
六、遇到汇总数据时的六步检查法
第一步,确认指标定义一致。两个方案的“成功”是否使用同一标准、同一观察窗口和同一排除规则。
第二步,要求看到分子和分母。78%必须能够还原成78个成功、100个总样本之类的原始计数;只有百分比无法判断样本规模和稳定性。
第三步,寻找可能影响结果的分层变量。任务难度、用户基础、时间段或渠道如果同时影响分组比例和成功率,就可能制造汇总反转。
第四步,在相同分层内比较。不要拿A的困难组与B的简单组交叉比较,也不要只展示其中一个有利分组。
第五步,检查权重。把每组样本数除以总体样本数,写出加权平均,确认总体数字能够由分组数字复算。
第六步,根据决策目的选择报告方式。描述实际运营结果可保留实际权重;比较方案能力则应考虑统一权重、随机分配或其他更可靠的研究设计,并说明局限。
七、四个常见误区
误区一:总成功率高就证明方案更优。 总成功率可能主要反映它接触了更多容易样本,而不是方案本身更有效。
误区二:每组都更高就能忽略总体。 如果问题是预算、容量或实际完成量,总体构成仍然重要。分组与总体应分别回答对应问题。
误区三:发现反转就断言数据造假。 辛普森悖论可以在数据完全真实时出现。应先核对计数、定义和权重,再判断是否存在选择性报告或操纵。
误区四:不停分组直到出现想要的答案。 缺乏事先依据的切分会增加偶然结果。分层变量应有明确机制,最好在分析前确定,并保留全部分组结果。
八、理性决策与反诈提示
网络宣传常用“整体成功率”“通过率”“回款率”或“用户胜率”制造权威感,却不提供各类用户的分母、难度构成、时间窗口和退出样本。即使总体数字没有伪造,也可能通过改变样本权重获得更好看的结果。看到百分比时,应追问:谁被计入、谁被排除、每组有多少人、不同方案面对的条件是否相同。
任何统计截图都不能证明收款方身份,也不能成为充值、垫付、缴纳保证金或解冻费的理由。若对方以“内部高成功率”“特殊分组名额”催促付款,却拒绝提供可独立核验的完整记录,应停止操作。不要泄露验证码、支付密码或屏幕共享权限;已经付款时,应尽快联系银行或支付机构说明疑似诈骗,保存聊天记录、页面、收款账户、时间和金额,并通过所在地警方或正规举报渠道求助。不要再次向声称付费即可追回损失的陌生人转账。
总结
辛普森悖论的核心是权重变化。示例中,A在简单任务和困难任务内分别以90%对80%、70%对60%领先,但A承担了更多困难任务,B承担了更多简单任务,导致总体变成74%对78%。分组结论与总体结论并非算术矛盾,而是在回答不同条件下的问题。
面对汇总百分比,先还原分子和分母,再检查分组变量与样本权重;需要比较方案本身时,可使用统一权重并明确说明标准化方法。统计反转是要求进一步核验的信号,不是相信收益承诺、授权敏感权限或支付费用的证据。
