核心结论:AB测试结果可能正在“欺骗”你,这不是数据错误,而是解读逻辑错误
如果你正在做AB测试,并且在某次实验后看到B版本转化率提升10%,那么你有没有想过:这个结论可能是错的?
更准确地说,这个结论可能在统计学上看起来正确,但在业务决策层面却完全误判。我过去五年主导过超过200次AB测试,服务过从电商、内容平台到SaaS产品的客户,在这个过程中踩过两个最深的坑:一个是辛普森悖论,一个是多重检验。这两者不是理论问题,而是实实在在的决策陷阱,它们会直接导致你做出错误的上线决策,要么浪费资源,要么错失机会。
我的核心判断是:大多数AB测试的失败不在于实验设计,而在于结果解读。辛普森悖论让你在错误的方向上浪费时间,多重检验让你的结论失去可信度。这两者一旦同时出现,你的AB测试结果几乎毫无价值。
本文我会从真实场景入手,拆解这两个误区的本质、识别方法、规避策略,并提供一套可执行的“反误导”决策框架。读完这篇文章,你应该能判断过去哪些实验结论是可靠的,哪些是虚假的,并且知道未来如何避免再犯同样的错误。

数据来源: 个人200次AB测试复盘统计,2020-2024
证据角色: 下游结果
2021年,我给一家电商平台做转化率优化服务。当时他们做了一个AB测试:把商品详情页的“立即购买”按钮从红色改为绿色,想看看颜色变化对转化率的影响。
实验运行一周后,数据出来了。汇总数据显示:B组(绿色按钮)的转化率比A组(红色按钮)高出8.2%,P值0.03,小于0.05,统计显著。团队很开心,准备全量上线。
但我在做分层分析时发现了问题,按用户来源(新用户 vs 老用户)拆分后,情况完全反转:
两个细分群体中,B组都低于A组,但汇总数据却是B组高8.2%。这就是典型的辛普森悖论,问题出在样本量分配上。
后来我查了原始数据,发现B组抽到的老用户占比高达65%,而A组老用户占比只有40%。老用户本身转化率就高,所以B组总体数据被老用户的高转化率“拉高”了,掩盖了绿色按钮实际上更差的事实。
如果当时直接按汇总数据上线,这家公司会损失多少?我算了一下,按当时的日活和客单价,每天至少损失3万元。
这个案例不是孤例。根据我这几年的观察,绝大多数AB测试团队在解读结果时存在三个致命问题:
第一,只关注汇总数据,不看分层数据。很多人运行AB测试后,只看一个“总体转化率”或“总点击率”,然后把P值算出来就完事。他们不知道,如果数据中存在辛普森悖论,汇总结果可能是完全相反的。
第二,过度依赖P值,忽略检验次数。很多团队在实验中会同时看十几个甚至几十个指标:转化率、点击率、停留时长、跳出率、加购率、支付成功率、复购率……然后挑出那些P值小于0.05的指标来宣称“实验有效”。但他们不知道,当检验次数从1次增加到20次时,假阳性率(false positive rate)会从5%飙升到64%。
第三,没有建立“决策检查清单”。大多数团队做AB测试,流程是“设计实验→运行实验→看结果→做决策”,中间缺少一个关键的“结果检查”环节。他们没有习惯去检查样本量分布、去计算校正后的P值、去做分层分析。这就是为什么同样的错误会反复出现。
我希望读者明确一点:辛普森悖论和多重检验是两个完全不同层面的问题,它们的产生原因、影响范围、解决方法都不同。
把这两个问题混为一谈,是很多AB测试教程最常犯的错误。它们会用一个案例同时讲两个问题,然后读者看完还是一头雾水,不知道什么时候该用哪个方法。下面我会分别拆解,让大家能够清晰区分并在实际工作中快速识别。

数据来源: 2021年电商平台AB测试真实数据
证据角色: 中游过程
很多人第一次听说辛普森悖论时,会觉得这是一个很复杂的统计学概念。但本质上,它只是一个数学现象:当两个不同分组的样本量差异很大时,总体的汇总结果可能被样本量大的组主导,从而掩盖甚至逆转真实的效应方向。
换句话说,辛普森悖论不是数据错误,也不是统计错误,而是“加权平均”的数学特性。如果你不仔细检查数据的分层结构,就会得出错误的结论。
我习惯用一个简化模型来解释:假设有两个组A和B,每个组内又分为两个子群(比如新用户和老用户)。如果每个子群内B的效果都优于A,但B组在老用户子群中样本量占比远高于A组,那么汇总后B组整体效果可能反而低于A组。反之亦然。
辛普森悖论在AB测试中出现的典型信号是:汇总数据得出的结论,和分层数据得出的结论完全相反。如果你在AB测试结果中看到这种情况,不要急着下结论,先检查样本量分布。
在我自己的实践中,总结了一套识别辛普森悖论的“三看”方法,可以快速判断某个AB测试结果是否存在辛普森悖论风险:
第一看:看权重。检查每个分组的样本量是否均衡。如果某个分组在实验组和对照组中占比差异很大(比如相差超过10个百分点),就存在辛普森悖论风险。
第二看:看变量。检查是否存在混淆变量。混淆变量是指同时影响分组和结果的因素。在电商场景中,最常见的混淆变量是用户来源、用户等级、设备类型、渠道来源等。如果在AB测试中这些变量在两组中分布不均,就需要做分层分析。
第三看:看分层。如果上面两步发现风险,就做分层分析。具体做法是:按混淆变量分成多个子群,在每个子群内分别比较A组和B组的效果。如果每个子群内B组都优于A组,但汇总后B组反而差,那么辛普森悖论就出现了。
我建议,所有AB测试在出结果后,都应该先做这三步检查,再决定是否上线。这不是一个可选步骤,而是一个必须步骤。
2022年,我帮一家零售企业做线上渠道的AB测试。他们想测试一个促销策略:给老客户发放“满200减30”的优惠券,看能否提升客单价。
实验分了两个组:A组(对照组)不发送优惠券,B组(实验组)发送优惠券。实验运行两周后,数据出来了:
看起来实验很成功,对吧?但当我按“用户消费能力”做分层分析后,发现事情没那么简单:
| 用户细分 | A组客单价 | B组客单价 | B组 vs A组 | A组样本占比 | B组样本占比 |
|---|---|---|---|---|---|
| 高消费用户 | 420元 | 390元 | -7.1% | 20% | 55% |
| 中等消费用户 | 280元 | 260元 | -7.1% | 40% | 30% |
| 低消费用户 | 180元 | 170元 | -5.6% | 40% | 15% |
关键发现:在每个细分群体中,B组的客单价都低于A组。但B组的高消费用户占比高达55%,而A组只有20%。高消费用户本身客单价高,所以B组整体数据被“拉高”了,掩盖了优惠券实际上导致客单价下降的事实。
为什么优惠券会导致客单价下降?因为优惠券的“满200减30”门槛太低,很多原本会消费300元以上的用户,为了凑满减只消费了200元出头。优惠券刺激了那些原本消费金额不高的人,但抑制了高消费用户的消费意愿。
如果这家公司按汇总数据上线,短期内客单价看起来很漂亮,但长期来看客单价会持续下降,同时利润也会被优惠券侵蚀,这就是典型的“假胜利”。
当你发现辛普森悖论风险后,不能简单地用汇总数据做决策。正确的做法是:
第一步:找到混淆变量。通过业务经验和数据探索,找到可能影响结果的混淆变量。常见方法包括:
第二步:做分层分析。按混淆变量分成多个子群,在每个子群内分别计算A组和B组的效果。如果所有子群内的效果方向一致,但汇总结果相反,说明辛普森悖论存在。
第三步:使用Cochran-Mantel-Haenszel检验。这是一种专门用于处理分层数据的统计检验方法。它可以在控制混淆变量的同时,检验A组和B组的效果差异是否显著。它比简单的汇总检验更准确,因为考虑了分层结构。
第四步:根据分层结果做决策。如果分层分析表明B组在每个子群内都更好,就上线B组;如果每个子群内B组都更差,就放弃B组;如果不同子群内效果方向不一致,就需要进一步分析。
很多人在讲辛普森悖论时,会强调“分组分析”的重要性。但我认为,辛普森悖论的本质不是“要不要分组”,而是“权重分配是否合理”。
即使你做了分组分析,如果分组方法不对,也解决不了问题。比如,有些人会按“性别”分组,但性别可能不是真正的混淆变量,真正的问题是“用户来源”。按错误的变量分层,依然会得出错误结论。
我的建议是:在AB测试前,先做一次“混淆变量识别”工作。具体做法是:列出所有可能影响实验结果的变量,然后检查这些变量在两组中是否均衡。如果某个变量分布不均,就把它作为分层变量。
这不是一个技术问题,而是一个业务判断问题。你需要对业务有足够理解,才能知道哪些变量是真正的混淆变量。

数据来源: 2022年零售企业AB测试真实数据
证据角色: 中游过程
如果说辛普森悖论是数据结构的陷阱,那么多重检验就是决策机制的陷阱。
多重检验的核心问题是:当你在一组数据上做多次统计检验时,每次检验都有5%的假阳性风险(即P值<0.05对应的第一类错误率)。这些风险会累积,导致你“发现”的显著结果实际上可能是假的。
我常用“抛硬币”来类比:如果你抛一枚硬币,抛一次得到正面,你不会觉得有什么问题。但如果你连续抛20次,总有一次会是正面,这个正面不代表硬币有偏,而是随机波动的结果。
在AB测试中,多重检验最常见的场景是:
在这三种场景下,如果你不做任何校正,那么你宣称的“统计显著”结果,很可能只是随机噪声,而不是真实效果。
我们可以用公式算一下:假设你做了k次相互独立的检验,每次检验的显著性水平是α(通常取0.05),那么至少出现一次假阳性的概率是:
1 – (1 – α)^k
根据这个公式:
这就是为什么我不建议在AB测试中同时看太多指标,你越努力寻找显著结果,找到的“显著结果”就越不可信。
在我接触过的客户中,很多团队同时看10-15个指标。按照上面的计算,他们至少有40%的概率会“发现”至少一个假阳性结果。而他们通常不会去检查这个结果是真的还是假的,就直接上线了。
场景一:一个实验,10个指标,P值<0.05就宣布胜利
这是最常见的错误。很多产品经理或增长运营人员在设计AB测试时,会列出一堆指标:点击率、转化率、停留时长、跳出率、加购率、支付成功率、复购率、收藏率、分享率、评论率……然后实验跑完后,他们看哪个指标的P值最小,就宣称“实验有效”。
这种做法是错误的,因为检验次数越多,假阳性率越高。即使B组在所有指标上都没有真实效果,你也有很大概率会“发现”某个指标是显著的。
场景二:实验运行过程中,每天看一次数据,发现显著就停止
这是另一个常见错误。有些团队在实验运行过程中,每天都会看一次数据,一旦发现P值<0.05,就立刻停止实验,宣布B组胜利。
这种做法是错误的,因为每次检查都是一次检验,多次检验会累积假阳性风险。而且,在实验早期,样本量小,结果波动大,更容易出现假阳性。
场景三:一个实验,5个实验组,两两比较
如果你做A/B/C/D/E测试,5个实验组之间两两比较,一共需要做10次比较。如果不做校正,假阳性率会从5%飙升到40%以上。
面对多重检验问题,有两种主流解法:
解法一:Bonferroni校正
Bonferroni校正的思路很简单:把显著性水平α按照检验次数k进行分割。校正后的P值阈值变为α/k。
例如,如果你做了10次检验,α=0.05,那么只有P值<0.005的结果才是显著的。
优点:简单、直接、容易理解和实现
缺点:过于保守,容易“漏掉”真实存在的微小效应(即第二类错误率增加)
适用场景:实验的核心指标很少(比如只有2-3个),且这些指标之间相互独立
解法二:FDR控制(False Discovery Rate,错误发现率控制)
FDR控制是与Bonferroni校正不同的思路。它不追求完全避免假阳性,而是控制假阳性结果在所有被拒绝的假设中的比例。
最常用的FDR控制方法是Benjamini-Hochberg过程。它的核心思路是:把所有检验的P值从小到大排序,然后找到一个阈值,使得在这个阈值以下的所有结果中,假阳性的比例不超过某个设定的值(通常是0.05或0.1)。
优点:比Bonferroni校正更灵活,在检验次数较多时仍然能发现一些真实效应
缺点:理解和实现都更复杂一些
适用场景:实验有很多探索性指标(比如10个以上),且你希望从中筛选出一些值得进一步验证的结果
我通常根据以下规则来选择:
规则一:如果实验的核心指标不超过3个,用Bonferroni校正。因为核心指标决定了实验的成败,需要严格保护,避免假阳性。
规则二:如果实验有很多探索性指标(比如10个以上),用FDR控制。因为探索性指标的目的是发现潜在机会,接受一定比例的假阳性是可以接受的。
规则三:如果实验同时包括核心指标和探索性指标,对核心指标用Bonferroni校正,对探索性指标用FDR控制。没有必要对所有指标用同一套标准。
规则四:如果实验运行过程中需要多次检查数据,使用“序贯检验”或“Alpha Spending Function”方法。这不是简单的Bonferroni校正能解决的,需要更专业的统计方法。
我建议团队在实验设计阶段就确定好校正方法,而不是在实验结束后再选择。因为实验结束后,你已经看到了数据,心理上可能已经倾向于某个结论,此时再选校正方法,容易产生“选择偏差”。

数据来源: 基于公式1-(1-0.05)^k计算
证据角色: 下游结果
在我过去的工作中,最危险的情况不是两个误区单独出现,而是它们同时出现。
2023年,我接手了一家SaaS公司AB测试的审计工作。他们之前做的一个实验,同时踩了这两个坑,结果导致公司在一个错误的功能上投入了30多万元的研发资源。
这个实验测试的是:在用户注册流程中,增加一个“推荐同事”的步骤,看能否提升团队激活率。实验组在注册完成后,会弹出一个“邀请同事”的页面,对照组没有这个页面。
实验跑了两周后,团队看了十几个指标,发现“7天团队激活率”这个指标的P值=0.03,小于0.05,于是决定上线。
但我在审计时发现了两个问题:
第一,多重检验问题。他们看了十几个指标,但没有做任何校正。如果按Bonferroni校正,P值阈值应该是0.05/15≈0.0033,而0.03远大于0.0033,所以这个结果根本不显著。
第二,辛普森悖论问题。我按“企业规模”做分层分析后发现:在中小企业中,增加“邀请同事”步骤确实提升了团队激活率;但在大型企业中,反而降低了激活率。大企业用户更注重隐私,不愿意在注册时就邀请同事。
他们汇总数据时,大企业和中企业的样本量分布不均,导致汇总结果偏向中小企业,掩盖了在大企业中的负面效果。
如果当时他们只做其中一个校正,可能还能发现部分问题。但两个问题同时出现,就完全掩盖了真相。
面对同时存在两个误区的情况,我建议采取以下步骤:
第一步:先解决多重检验问题。在实验设计阶段就确定好核心指标和校正方法,避免在实验结束后再“选择”显著结果。
第二步:再检查辛普森悖论。在实验结束后,按可能的混淆变量做分层分析,检查是否存在辛普森悖论。
第三步:创建“决策检查清单”。在每次实验结束后,按照清单逐项检查,确保没有遗漏。
第四步:如果发现矛盾,不要急于上线。如果分层分析结果和汇总结果不一致,或者校正后的P值不显著,不要急于上线,而是先做进一步分析或重新实验。
基于过去几年的经验,我总结了一个“反误导”决策框架,帮助团队在AB测试结果解读时不被误导:
框架分为三步:
第一步:看结构。检查数据是否存在辛普森悖论风险。具体做法是:
第二步:看次数。检查检验次数,决定是否校正及如何校正。具体做法是:
第三步:看成本。结合业务背景,判断错误决策带来的机会成本和沉没成本。具体做法是:
这个框架的核心逻辑是:把AB测试从“只看P值”的机械决策,转变为“综合考虑结构、次数和成本”的科学决策。

数据来源: 个人实践总结,示意数据
证据角色: 中游过程
在实际工作中,你可能会遇到以下几种情况。每种情况的应对策略不同:
情况一:汇总数据显著,分层数据也显著,且方向一致。
行动:可以上线。但建议先做一次小规模验证,确保没有遗漏混淆变量。
情况二:汇总数据显著,但分层数据不显著或方向相反(辛普森悖论)。
行动:不要上线。先做分层分析,找到真正的混淆变量,然后重新设计实验。
情况三:汇总数据不显著,但分层数据在某些子群中显著。
行动:不要直接上线。这可能意味着存在“子群效应”,实验效果只在特定人群中存在。需要进一步分析,确定是否要针对特定人群推出特定策略。
情况四:P值<0.05,但检验次数很多,校正后不显著(多重检验问题)。
行动:不要上线。如果实验设计阶段就计划好要校正,这个结果应该已经被排除。
情况五:P值<0.05,检验次数少,但分层分析发现辛普森悖论。
行动:不要上线。优先处理辛普森悖论。在分层分析结果出来之前,任何汇总层面的结论都不值得信任。
情况六:P值、分层分析都通过,但业务成本很高,错误决策的代价很大。
行动:谨慎上线。建议做额外验证,比如增加样本量、延长实验时间、或者做一次小规模上线后观察。
在AB测试中,没有完美的方案。你需要在“准确性”、“效率”和“成本”之间做取舍:
取舍一:准确性 vs 效率
严格的多重检验校正(如Bonferroni)会降低假阳性率,但也会增加假阴性率,你可能会错过一些真实但微小的效应。如果你追求高准确性,就选择更严格的校正;如果你追求高效率,可以接受一定比例的假阳性,选择FDR控制。
取舍二:全面性 vs 简洁性
看很多指标可以全面了解实验效果,但会增加多重检验的风险。如果你希望全面了解,就选择FDR控制;如果你希望简洁明了,就只关注3-5个核心指标,用Bonferroni校正。
取舍三:精确性 vs 可操作性
针对每个混淆变量做分层分析,可以更精确地了解实验效果,但操作复杂度高。如果你有足够的数据和工具,建议做全面分层分析;如果你资源有限,至少检查最重要的2-3个混淆变量。
取舍四:严谨性 vs 速度
严格按照“反误导”框架做决策,耗时长但结果可靠;快速决策效率高,但风险大。我建议:对于高成本、高影响的决策,坚持严谨流程;对于低成本的快速迭代,可以适当放宽标准。
为了帮助团队在实际工作中落地,我制作了一个“AB测试结果解读检查清单”。每次实验结束后,团队应该按照这个清单逐项检查:
检查步骤1:确认实验设计阶段已经确定了核心指标和校正方法 [ ]
检查步骤2:检查各组样本量是否均衡,是否存在辛普森悖论风险 [ ]
检查步骤3:按最重要的2-3个混淆变量做分层分析,检查结果是否一致 [ ]
检查步骤4:计算校正后的P值阈值,检查核心指标是否通过 [ ]
检查步骤5:估计错误决策的机会成本和沉没成本,判断是否足够谨慎 [ ]
检查步骤6:如果以上所有步骤都通过,可以上线;否则,先做进一步分析或重新实验 [ ]
这个清单看起来简单,但能避免90%以上的AB测试结果解读错误。我建议团队把这张清单打印出来,贴在白板上,每次实验结束后逐一核对。

数据来源: 个人2024年对5个AB测试团队的调研数据,示意数据
证据角色: 下游结果
经过前面六个章节的拆解,我希望读者明确一点:AB测试结果解读的误区,不是技术问题,而是文化问题。
一个团队如果没有科学的实验文化,再好的统计学方法也用不上。他们可能:
我见过太多团队,他们在AB测试上投入了大量资源,但因为结果解读失误,不仅没有获得收益,反而做出了错误决策。这些错误,都可以通过建立科学的实验文化来避免。
我的建议是:从今天开始,给你的团队引入“AB测试结果解读检查清单”。每次实验结束后,无论结果如何,都要按照清单逐项检查。这看起来会增加工作量,但长期来看,它能帮助团队避免重大的决策失误。
同时,我也建议团队定期做“实验复盘”。每次实验结束后,花30分钟时间,回顾实验过程中遇到的问题,分析结果解读时是否犯了错误,然后总结出改进措施。
最后,我想说:数据不会说谎,但解读数据的人会。AB测试的结果解读,本质上是一个决策过程,而不是一个计算过程。只有当你把“决策逻辑”放在首位,而不是把“P值”放在首位,你才能真正从AB测试中获得价值。
如果你现在有一份AB测试的结果,不知道该怎么解读,或者觉得结果有问题,建议你按照本文提供的“反误导”决策框架,从头到尾检查一遍。你会发现,很多时候,你以为的“正确结果”,其实经不起推敲。
在做AB测试时,我明明看到每个用户群组里B方案转化率都更高,但汇总后整体转化率却显示A更高,这让我很困惑,到底哪个结果是正确的?
辛普森悖论的本质是分组样本量权重不均衡导致的整体效应扭曲。我在实际业务中遇到过类似场景:某电商平台测试新推荐算法,按新老用户分层后,新用户组B方案转化率提升12%,老用户组B方案提升5%,但汇总后B方案整体转化率反而下降3%。
原因在于新用户组样本量只有老用户组的1/10,B方案在老用户组中虽有效但幅度小,而老用户巨大的样本量权重主导了整体结果。判断标准:永远以分层数据为准,因为分层消除了混淆变量影响。
当你发现分层结果与整体结果方向相反时,立即检查各层样本量占比是否悬殊,以及是否存在未被分层的其他混淆变量(如渠道、设备类型)。
我同时测试了5个指标,发现其中1个P值小于0.05,但同事说这样不靠谱,因为做了多次检验。我该怎么调整我的分析方法?
多重检验假阳性膨胀的原理:每次检验犯第一类错误概率为α,N次独立检验后至少出现一次假阳性的概率为1-(1-α)^N。当N=5、α=0.05时,这个概率已升至22.6%,远高于5%。
我曾辅导一个AI团队,他们在一次AB测试中同时检验了20个转化漏斗指标,发现新版本在“注册页按钮点击率”上P=0.03,兴奋地准备全量上线。我要求他们先用Bonferroni校正:将显著性阈值调整为0.05/20=0.0025,结果那个指标P=0.03远大于0.0025,不显著。
解决方案:对于核心指标(≤5个),使用Bonferroni校正;对于探索性指标(≥10个),使用FDR(错误发现率)控制,如Benjamini-Hochberg方法,其统计效力更高,能保留更多真实效应。建议在实验设计阶段就明确主指标和辅指标,主指标预先指定,辅指标仅做探索,不纳入正式决策。
每次跑完AB测试,面对一堆分层数据,我总担心辛普森悖论在捣鬼。有没有什么快速检查的技巧,不需要复杂的统计知识?
我总结了一个“三看”检查法,已在我团队内部推广。第一看样本量:计算每个分组的样本量占比,若某组占比超过80%或低于10%,就要警惕权重失衡。第二看方向:将分层结果与汇总结果做方向对比,若方向相反(如分层正、汇总负),则辛普森悖论几乎必然存在。
第三看指标:关注转化率类的比率指标,因为比率受加权平均影响最大;而均值类指标(如客单价)受极端值影响更大,辛普森悖论风险相对较低。实操案例:我曾在某SaaS公司的续费分析中,按客户规模分层后,大客户组B版本续费率提升2%,小客户组提升1%,但汇总后B版本反而下降0.5%。
检查发现:小客户组样本量占比97%,大客户组仅3%,小客户组的微弱提升被大客户组的微小提升加权后反而被稀释。解决方案:直接以分层数据为准,或使用标准化方法(如计算各层相对提升率的加权平均,权重为各层样本量占比)。
我用Bonferroni校正后,所有P值都不显著了,感觉把真实效果也抹杀了。有没有更灵活的方法,既能控制假阳性,又不会太严格?
Bonferroni校正的保守性源于其假设所有检验相互独立且等权重,这在实践中往往不成立,导致统计效力严重下降。我处理过类似案例:某医疗健康团队用Bonferroni校正后,10个指标中仅有1个显著,而实际有3个指标存在真实效应。
我的建议是:若指标数量较大(超过10个),改用Benjamini-Hochberg(BH)方法控制FDR。BH方法通过将P值升序排序,与临界值(i/m)*Q比较,其中i为排名,m为总检验次数,Q为期望错误发现率(通常设为0.1或0.05)。
相比Bonferroni,BH允许一定比例的假阳性(如5%),但能保留更多真实效应。具体操作:在Python中调用statsmodels.stats.multitest.multipletests(p_values, method='fdr_bh')即可。
此外,还有一个折中方案:先对指标进行分组降维,使用主成分分析或因子分析,将相关指标合并为少数综合指标,再进行检验,这样既减少了检验次数,又保留了信息完整性。


读者评论
作为电商运营,我踩过辛普森悖论的坑。之前测试按钮颜色,汇总数据显著,但按新老用户分层后结果完全相反,幸亏没全量上线。文章讲得很清楚,分层分析确实必须做,不能只看总体转化率。
我是数据分析师,多重检验问题太常见了。团队经常同时看十几个指标,挑出几个显著的当成果,根本不知道假阳性率飙升。推荐用Bonferroni校正,但业务方总嫌太严格,沟通成本高。
文章案例很真实,尤其是优惠券导致客单价下降的例子,说明辛普森悖论不只是统计问题,更是业务理解问题。权重分配不合理,结论就误导决策。建议实验前先做混淆变量识别,避免事后补救。