一个做了五年数据分析的同行告诉我,他统计课挂了两次,却在实际工作中靠“背公式”混过了三个项目。真正让他崩溃的是第一次独立做促销评估:系统里几十万条订单,他算出了“人均消费提升23%”的漂亮结论,却在汇报前被追问了一句“这个差异是随机波动还是真实提升?”,他答不上来。这不是个别现象。我见过太多数据分析入门者把数理统计等同于“公式大全”,但真正在工作中,你需要的不是背下所有公式,而是建立三种能力:判断数据是否可靠、估出真实范围、比较差异是否显著。
这篇文章是我从多年数据分析和带教经验里提炼出的数理统计核心知识点,不按教材顺序,而是按数据分析的实际工作流重新组织。我会先把结论放在前面,再讲真实场景、常见误区、判断逻辑、数据案例和行动建议。读完你可以直接应用,不需要先啃完一本《概率论与数理统计》。
很多人在入门阶段被“大数定律、切比雪夫不等式、矩估计、极大似然估计、卡方分布、F分布”这些名词吓退。但回到数据分析的真实场景,你会发现所谓数理统计,本质就是回答五个问题:
这五个问题构成了我的核心结论:数据分析入门的数理统计,不是一门数学课,而是一门“用有限数据做可靠判断”的决策课。你要学的不是每个定理的推导,而是建立“误差意识”和“推断逻辑”。
我带的学员里,最快入门的那个只用了两周。她没有高等数学基础,但每学一个概念都追问“这个在业务里怎么用、不用会怎样”。两周后她做出了一个别人没发现的判断:某功能上线后次日留存率看似涨了1.2个百分点,但置信区间跨过0,并不显著。我把这周的教学模式总结成一张知识点占比图,你可以直观看到真实工作里哪些知识在“扛大梁”。

真正的描述统计是从三个维度刻画数据:集中趋势(均值、中位数、众数)、离散程度(方差、标准差、极差)、分布形状(偏度、峰度)。只报均值是入门者最常见的偷懒方式。
我审过一份周报,某渠道点击量的平均数是1.8万,看起来不错。但看分布图,80%的天数连5000都不到,某一天靠一次外部投放冲到12万,直接把均值拉高。如果只看均值,你会误以为渠道很稳定。平均数是所有统计量里最容易撒谎的一个。
为什么样本均值的抽样分布总是近似正态?为什么不管总体长什么样,只要样本量够大,均值就稳定下来?中心极限定理回答的就是这件事。它不是让你背结论,而是让你敢用样本去推测总体,而且能精确算出误差范围。
这里的一个关键经验是:很多真实业务数据的分布极度右偏,比如客单价、订单金额、用户在线时长,但一旦分组求平均,样本均值的分布立刻快速收敛到正态。这意味着你可以用正态分布近似,去构造置信区间、做假设检验,而不需要去看每个用户的原始数值。
置信区间给出的是一个范围,比如“促销活动的真实增量在2.1%到4.3%之间,置信水平95%”。它比单一P值提供了更多信息。P值只告诉你“差异是否显著”,置信区间还告诉你“差异有多大、有多不确定”。当置信区间下边界接近0时,说明效果可能很小,即使统计显著,业务上也未必值得投入。
假设检验的逻辑很简单:先假设没有差异,然后看数据中出现当前结果的概率有多大。如果概率很小(P<0.05),就拒绝原假设,认定有差异。用一句话理解:它是在问“如果真相是没有任何区别,那我们观察到这么大差异的可能性有多大?”
样本量足够大时,微小差异也能被判定为“统计显著”。比如10万样本量下,转化率1.00%和1.03%的差异可能P值小于0.001,但0.03个百分点的提升,对业务来说毫无意义。你必须同时关注“效果量”和“业务成本”,否则就会被P值绑架。
核心结论说完,我用一个亲身经历来展开,因为没有具体场景,上面的结论都只是空壳。
2022年,我参与一家连锁零售品牌的咨询服务。客户在全国有600多家门店,某个周末做了一次“满100减30”的促销活动。活动结束后,业务方发来的喜报是:“活动期间销售额环比提升40%,活动很成功。”
我当时第一反应不是质疑,而是好奇这个“环比”对比的是什么。一查发现,业务方对比的是活动前两天的工作日销售额。且不说工作日和周末本身就有流量差异,这个对比完全没有排除自然增长、季节波动和其他营销动作。这就是一个典型的统计陷阱:把“相关性”当成“因果性”,把“含混的比较”当成“可靠的推断”。
我一开始也用了一个偷懒的方法:把活动当周周六和周日的销售额,与前三周周末的平均值对比,算出“提升18%”。这个数字业务方很满意。但我在做完以后开始较真,问了三个问题:
第一,前几周周末本身有没有趋势?如果门店客流在自然增长,这种对比本身就高估了活动效果。第二,600家门店里有几十家同时在做商场店庆,这部分门店的数据混在一起,无法说明活动本身的作用。第三,每天的销售额波动非常大,18%的差异有没有可能是随机波动造成的?
我在一次内部复盘中提出这些问题,领导的反问让我印象深刻:“那你说,到底怎么算才能证明是活动带来的增长?”
我换了一种方法:把每家门市活动周的周末销售额,与它自身前两周周末的平均销售额做差,得到一组“每店变化量”。然后对门店两期差异做配对t检验,而不是把所有门店数据混在一起。
结果出来时我后背发凉:P值为0.12,大于0.05,差异在95%置信水平下并不显著。这证明,表面上18%的提升,主要是季节性、门店趋势和少数大店拉动带来的。而更让我惊讶的是,店型拆分数据后,购物中心店的提升反而显著,社区店基本没有变化。这说明促销对两类门店的效果是不同的。
这个项目让我明白了一个道理:数理统计不是“事后算个P值”,而是“事前设计一个能回答业务问题的对比框架”。“算了”和“算对”是两码事。这里我做一个对比,展示两种分析方式在成本和准确性上的真实差异,这也是咨询公司客户最在意的地方。

在带教和项目评审过程中,我反复看到同样的误区。这里拆解四个最影响结论质量的坑。
很多入门者一上来就假设数据服从正态分布,直接套用均值加减标准差的框架。但真实业务数据的分布往往不是正态的:用户消费金额是右偏的,网页停留时长是指数型的,销售转化率是二项型的。我见过一个团队分析订单金额时,用均值1.46个标准差表示波动边界,结果出现“负数订单金额”的荒谬结论。
正确做法是先画分布图,判断数据形态,再决定用均值还是中位数、用t检验还是非参数检验。如果你懒得看分布,很多问题可以用自助法(Bootstrap)重新抽样解决,不需要硬套正态假设。与其猜测总体分布,不如善用重抽样,这会让你的结论稳健得多。
样本量当然重要,但“越大越好”是错的。更准确的说法是“在合适的采样方式下,样本量越大越好”。如果样本本身有偏,再大也无用。比如你只在App弹窗用户里做问卷回收,即使回收了10万份,也代表不了全量用户。
另一个问题是“伪重复”:很多数据点并不是独立样本。比如同一个用户产生100笔订单,如果直接把订单看成100个独立样本,会严重高估统计功效,导致虚假显著的结论。你必须明确“样本量的单位是什么”,是用户还是订单、是门店还是门店周数据,这决定了样本量的真实有效性。
P值是在“原假设为真”的前提下,观测到当前或更极端数据的概率。它不直接等于“效果存在的概率”。很多入门者把P值理解反了,看到“P<0.05”就认定有95%的概率是真差异。这是最经典的P值误读。
真实业务里,如果做了20个假设检验,在0.05的显著性水平下,平均会有1次是“假阳性”。这就是多重比较问题。当你同时验证10个页面的转化率提升效果时,不做多重检验校正,就可能在垃圾结果里捞到“神药”。专业做法是至少做一次Benjamini-Hochberg校正,或者把P值阈值降到0.01。
置信区间不是随便一个句子,它有精确的含义:如果把实验重复做100遍,每次构造一个区间,大约有95个区间包含真实的总体参数。注意,这不是说“总体参数有95%概率落在这个区间里”,而是“这个区间覆盖总体参数的过程有95%的概率是成功的”。对入门者来说,这个区别极容易混淆,但理解它对决策很关键。
更实用的是:置信区间的宽度就是你的决策风险。宽度越窄,说明估计越精确;宽度越宽,说明信息越少。当置信区间横跨“业务决策阈值”时,无论P值怎样,你都不能把结论当作确定事实。下面这张图把四个误区在真实项目中的影响程度做了一个直观对比,它们都会导致“决策方向错误”或“信心错误”。

在真实项目中,直接跳进“算均值、跑回归”是新手最常犯的错。我的习惯是走固定四步,先建立判断框架再动手。
第一步永远是看数据长什么样。先做描述统计和可视化分布,同时搞清楚“每行代表什么”,是整个用户、每次访问,还是每个订单,并且确认数据是否符合当前分析的计算口径。如果从订单维度按用户拆分,需要先做聚合,避免同一个人的多次行为被当成多个独立样本。
这一步的产出不只是一个图,而是一份判断:这组数据适合用均值还是中位数、适合用参数检验还是非参数方法、分析单元是什么。
接下来要问:这些数据是怎么来的?是随机抽样、便利抽样、自选择样本,还是一整段时间的全量数据?如果分析的是全量数据,就不存在“抽样误差”问题,只存在“测量误差”和“系统偏差”。如果你拿的是A/B测试的样本,就需要核查实验分流的随机性和组间样本量的均衡性。
一个小诀窍:做样本量计算时,不要只靠在线工具。你至少要能自己估算一个粗量级:在95%置信度、5%的绝对误差下,大约需要384个样本(假设总体比例未知时,p=0.5最保守)。这个数字在业务会议里可以直接用,显得你既有经验又有分寸。
明确数据的分布和样本来源之后,才好选统计量。比较两组均值用t检验或Mann-Whitney U检验;比较多组用方差分析或Kruskal-Wallis检验;比较比例用卡方检验或Z检验;看两变量关系用相关系数。每种方法都有前提条件,用错就等于白做。
最容易记错的是:t检验的前提是“每组近似正态”且“组间方差齐性”,而不是“总体服从正态”。如果样本量足够大(比如每组大于30),中心极限定理会帮你兜底,但方差齐性仍然要注意。这里我画了一个判断逻辑路径表,你在决策时可以直接对照。
| 业务问题 | 数据类型 | 优先选择的方法 | 前提条件 |
|---|---|---|---|
| 两组用户平均消费是否不同 | 连续型 | 独立样本t检验 | 组间独立性、近似正态、方差齐性 |
| 同一批用户前后变化是否显著 | 连续型、配对 | 配对样本t检验 | 差值近似正态 |
| 两个版本的转化率是否有差异 | 二分类 | 两比例Z检验 | 样本独立、np和n(1-p)均大于5 |
| 多个方案效果比较 | 连续型 | 方差分析 | 各组独立、近似正态、方差齐性 |
| 数据分布不明或严重偏态 | 连续型/有序 | 非参数检验 | 独立样本、有序或连续 |
| 评估某指标的总体范围 | 连续型/比例 | 构造置信区间 | 抽样随机或近似随机 |
最后一步是“跑数”与“解释”。跑数只是几分钟的事情,难在解释。我要问自己三句:第一,这个差异的实际量级有多大?第二,它的置信区间是多少?第三,结论能推广到哪些人群、哪些时段?如果你做的是A/B测试,还要考虑“外部有效性”:实验流量是低流量页面,结论能不能平移到高流量页面?用户里有多少是新用户,结论对老用户还成立吗?
在评估“效度”的问题上,一个统计显著但置信区间过宽的结论,决策价值往往很低。此时你需要放下“显著”的执念,转头看“实际影响”。四步走完之后,你得到的不只是一个“显著/不显著”的结论,而是一个完整的决策链条。下面用决策流的方式把这四步串起来,便于你在实际项目里按顺序执行。

理论讲多了,我拿一组真实数据观察来做完整演示。这不是竞赛数据集,而是我某次在社区电商项目中处理过的销售数据片段。
某社区电商平台在某城市的82个前置仓,收集了日均销售额。分析目标是判断“引入新签收流程后,销售额是否有显著提升”。数据分两组:实验组40个仓,使用新流程;对照组42个仓,使用旧流程。对比周期为14天。
拿到数据后第一件事,我不是去算均值,而是先画了两组数据的分布图。实验组日均销售额范围在1.2万元到35万元之间,标准差非常大;对照组则在0.8万元到28万元之间。两组都严重右偏,而且有几家仓日均销售额超过20万元,属于大型中心仓。如果直接做独立样本t检验,正态假设和市场环境差异会直接导致检验效度不佳。
我把两组数据直接合并计算,实验组日均销售额均值10.8万元,对照组9.6万元,差值1.2万元,看着好像是“新流程带来12.5%提升”。但再用t检验时,P值为0.38,远大于0.05。为什么?因为仓与仓之间的销售额差异太大,掩盖了组间的细微差异。
这里有一个关键经验:高基线的方差会掩盖真实效果。如果不把实验前的历史数据纳入模型,实验效果根本体现不出来。
我调整了分析策略:把每个仓在实验前14天的日均销售额作为基线,计算实验期与基线的差值,然后对比两组的“变化量”。这样,大型仓和小型仓的绝对差异被消除,我们只看“变化”。这是简单的“双重差分”思想。
调整后得到:实验组的平均提升为8500元/天,对照组平均提升为2300元/天,差值为6200元。进一步做置换检验(Permutation Test),P值为0.045,刚好小于0.05。这次结论站住了。为什么不用t检验?因为差值分布仍然偏态,置换检验无需正态假设,更稳健。
这次分析给我三点启发。第一,一个合理的实验分析,需要纳入实验前的协变量,纯粹只看组间均值对比往往得出不可用结论。第二,置换检验和Bootstrap的实际应用频率比我预想的高多了。第三,业务结论不能只用一个绝对涨跌额,要看置信区间。我算了下,实验组平均日提升的95%置信区间是[1800元,11500元],跨度极大,说明样本量仍不充分,建议再运行两周。
为了让你直观看到“高方差如何掩盖信号”,我把本次两组仓库的日均销售额分布做了模拟展示,你可以清楚地看到数据重叠程度有多高。

我把“数理统计怎么学”按不同岗位拆开,因为数据分析里的统计知识,最终是为了支撑不同决策质量要求。学多了浪费时间,学少了容易翻车。以下是我给四类人的具体建议。
产品经理的日常是评估功能上线效果,最需要的是“对比思维”和“基础的A/B测试常识”。你要能看懂实验报告里的P值、置信区间、提升幅度,并敢在评审会上追问“样本量是否足够、实验周期是否覆盖完整”。
给产品经理的优先级排序:A/B测试与随机分流知识 > 假设检验流程 > 置信区间 > 描述统计。不需要学区间估计的数学推导,但要能判断一次实验的结论是否可信。你学的核心不是计算,而是提问的能力:这次实验的样本量预先算过吗?实验组和对照组在基线上是否可比?看的是绝对提升还是相对提升?
运营人员每天面对的是用户行为、活动数据、内容数据,最需要的是读懂分布、合理分层。不要被平均数骗了:看活动效果时,要同时看中位数、分位数,以及不同用户群的差异。
给运营的优先级:描述统计 > 分组对比 > 基础置信区间 > 简单抽样判断。比如做用户分群时,建议用4分位数或十分位数分层,而不是直接按均值上下分;做活动复盘时,要区分“新客”和“老客”、“活跃”和“沉默”,分别看数据。
分析师是专业选手,不能只懂概念,必须能写代码跑出数字。我的建议是:用Python或R把“模拟抽样分布”这个过程亲手做一遍,直到你能向别人解释清楚“为什么1000次重抽样能代替教科书里的抽样分布公式”。
一个可以今天练的练习:取任意非正态数组(例如指数分布),每次从中抽取100个样本计算均值,重复1000次,绘制均值的分布,观察它是否接近正态。做完了你会把中心极限定理刻进骨子里,比背任何公式都管用。
管理者的价值在于做重大决策。你不需要做t检验,但你一定要知道:任何一个销售数据背后都有波动,任何一次对比都不能轻易得出“因果结论”。当汇报者说“提升了20%”,你的第一句话应该是:“这个20%是跟谁比出来的?它的置信区间是多少?样本量有多大?”
管理者的学习重心是:区分“描述性报告”和“推断性结论”,要求分析方给出置信区间和效果量。如果一个汇报只说均值不说波动,只说P值不说置信区间,这份报告的专业度在你这里就要打个折。
为了把以上路径量化,我把不同岗位建议投入的“精力分布”做成了一张对比图,方便你判断自己应该优先学什么、以及每一项需要投入的时间权重。

写到最后,我想说一个很多人不愿意讲的观点:不是所有数据分析问题都需要做统计推断。如果你拥有全量数据,你要做的就不是推断,而是“核对”。比如分析本季度全公司所有员工的人数变化,准确数是多少就是多少,不需要置信区间。只有在“用样本推断总体”时,“误差”这个话题才有意义。
当你手上的数据就是业务对象的全量、没有测量误差或误差可控时,不需要推断。例如全量库存盘点、全量订单统计、全量用户画像的描述。做这类分析时,统计推断不但不增加价值,反而可能带来误导。
另一个不用统计推断的场景是:决策成本极低、可以快速试错时。比如优化一个按钮颜色,你可以直接看接下来一周的数据,快速迭代,不需要花大量精力做严格检验。在快速迭代的语境下,一个低成本的近似判断比一个高成本的精确估计划算得多。
反之,当你的决策会导致重大资源投入、影响面广、且数据本身来自抽样时,必须使用统计推断。比如:一是对千万级用户群体的产品功能进行改版并打算全量上线前;二是确定年度品牌投放策略时,误判一次就可能损失数百万元预算;三是做供应链补货决策时,对需求预测的错误估计导致高库存或断货风险;四是在科学实验及用户研究中,需要将小样本结论推广到大群体时。
在这些场景下,不做统计推断等于“凭感觉下注”。我见过最典型的反面案例是某准备上市的新品在做内测时,100个试用用户有60个说好,业务方直接决定大批量生产,结果上市后因为试用用户偏向种子用户而非真实人群,实际转化率差了一大截。“没有计算样本量、没有考虑采样偏差、没有置信区间”,这三点叠加就是一场决策灾难。
我给自己定了一个“三问检验法”,推荐你也试试。第一,我手里的数据是总体还是样本?第二,如果结论错了,损失有多大?第三,有没有更快更便宜的验证方式?
| 判断维度 | 倾向简单描述分析 | 倾向完整统计推断 |
|---|---|---|
| 数据类型 | 全量数据、口径明确 | 抽样数据、存在波动 |
| 决策成本 | 低,可快速试错 | 高,试错成本高昂 |
| 结论用途 | 内部参考、趋势观察 | 对外汇报、资源投入和战略决策 |
| 时间约束 | 小时级快速响应 | 可支撑3-7天分析周期 |
| 误差容忍度 | ±5%以上可接受 | 尽可能严格控制在1%-2%以内 |
做完结这张表,你对“要不要用统计”的判断就会清晰很多,不会再被高深术语带着走,也不会因为害怕出错而回避必要的统计分析。

写到这里,我做一个独特观点的总结:数理统计入门,真正要学会的是一套“有原则的怀疑”:怀疑平均数、怀疑P值、怀疑置信区间、怀疑抽样过程,并把这种怀疑变成可量化的工具。教材是按数学逻辑编写的,但工作是按决策逻辑展开的。你不需要记住每一个公式的推导,但你需要知道什么时候该使用哪个工具,以及一个结论到底意味着什么。
下一步不是去购买一本厚厚的统计教材,也不是囤积各式教程。今天就打开一张真实的数据表,用编程语言跑一次描述统计、画一次分布图、做一次Bootstrap抽样,然后给你自己一份小报告。从“看数据”到“模拟抽样”再到“给出置信区间”,这一套流程跑通,你就真正迈进了数据分析世界里最重要的一道门。
我学数理统计时总听别人说“样本量大于30就可以近似正态”,但我不理解,明明总体分布很偏,为什么样本均值就变正态了?这个定理到底在解决什么实际问题?
我第一次真正理解中心极限定理,是在分析某APP的日活用户使用时长时。原始分布是典型的长尾偏态,平均值被极值拉高,直接看分布根本没法做区间估计。但把每天的用户分成500个样本组后,每组均值的分布非常接近正态,这时才能用均值±1.96倍标准误去构建置信区间。很多人把“n>30”当成魔法数字,这是误区。
n=30是否够用,取决于总体分布的偏度和是否存在异常值。我做过模拟:对于均匀分布,n=10时均值已接近正态;但对对数正态分布,n=30时均值分布仍然右偏,n=50后才有明显改善;若存在极端异常值,n=100都可能不够。
所以中心极限定理的核心价值,并不是让你“不管什么数据都套正态”,而是告诉你:做推断时,不确定性主要来自抽样波动,而抽样波动可以被量化。实际建议是:先用分布图看原始数据的形态,再决定样本量;如果数据极端偏态,优先做对数变换或使用稳健统计量,不要迷信30。
我在读论文和做AB测试时,常看到p<0.05就宣布显著,我总觉得这个p值就是“原假设为真的概率”,但老师一直说这是错误理解。那它到底是什么意思?如果p值不是概率,我们该怎么用它做决策?
我曾做过一个AB实验,两个文案的点击率差异超过20%,p值只有0.03,看上去很显著。但后来发现,由于样本量巨大,只要0.1%的绝对差异就能让p值变得很小。那个“显著”的业务意义其实很弱。所以p值的第一层理解是:它是在“原假设为真”这一前提下,当前样本或更极端样本出现的概率,而不是原假设为真的概率。
第二层理解要结合条件概率。P(数据|原假设) ≠ P(原假设|数据),除非你有先验概率。我习惯用贝叶斯思维做交叉验证:如果先验上原假设和备择假设等可能,p=0.04时,后验概率实际上可能只有50%左右,远没有“显著”两个字听起来那么可靠。
因此我的经验判断是:p值只能作为“证据强度”的参考,不能作为决策的唯一依据。正式汇报时,我会同时给出效应量(如Cohen's d)和置信区间。如果效应量小到业务上可忽略,即使p<0.001,我也会建议不采纳该改动。真正的避坑方法,是先在实验设计阶段就定好最小效应量,再反推样本量,而不是事后看p值。
我处理4种优惠券策略的转化率数据时,很自然地想到每两组做一次t检验,结果被同事说会增大错误率。我不明白,既然是两两比较,为什么不行?方差分析到底起到了什么作用?
我在一次多版本测试中,对4个版本做了6次两两t检验。没有做任何校正时,发现其中一个对比p=0.04,很开心。但当我改用Bonferroni校正(显著阈值设为0.05/6≈0.0083)后,这个p值完全不显著。这就是多重比较的问题:比较次数越多,出现“假阳性”的累积概率越大。
方差分析(ANOVA)的逻辑不是直接比较各组均值,而是先做一个整体检验:把总变异拆分成组间变异和组内变异,用F = 组间均方/组内均方来判断是否存在“至少一组与其他组不同”。好处是,无论你分多少组,F检验的整体显著性水平仍然控制在0.05,不会因为比较次数而膨胀。
但要注意,F显著不代表“所有组都不同”,只说明“有差异”,具体是哪几组,还需要事后检验(如Tukey HSD)。我自己的操作习惯是:先看行业基准或历史经验,判断哪些对比是事先指定的(confirmatory),哪些是事后探索(exploratory)。
如果是探索性分析,哪怕ANOVA不显著,我也只看效应量和置信区间,不再纠结p值。这个习惯帮我减少了很多无意义的“显著性骚扰”。
我在学习数理统计时,一会儿看到频率派的置信区间,一会儿看到贝叶斯的后验概率,有点懵。感觉贝叶斯很强大,但算起来好复杂。作为新手,我到底该先学哪一个?工作中用哪个更合适?
我刚入行时也是一样,觉得贝叶斯才高级。后来做一个活动转化率估计,产品经理问“A方案上线后,它的转化率落在哪个范围?”频率派答案是“构造一个95%置信区间”,而贝叶斯答案是“直接给出后验分布,说A方案有92%的概率转化率超过2%”。
前者严格来讲是关于区间的概率,后者是关于参数的命题,业务直觉上贝叶斯更好沟通。但真正做工程时,我发现频率派的假设检验和回归分析是基础中的基础,几乎所有工具默认都支持,而且可解释性更稳定。贝叶斯需要先设定先验分布,如果先验拍脑袋,结果会误导决策。
我曾经用一个很弱的先验(Beta(1,1))去估计小样本转化率,结果和频率派的置信区间几乎重合;一旦我改成“基于历史数据”的强先验,结果就会偏离当时实验数据,差点把好方案否决。我的判断是:入门先学频率派,把假设检验、置信区间、回归模型吃透,因为这些在日常业务中够用且稳健。
当你处理小样本、稀疏数据或者需要“参数大于某值的概率”这类表述时,再学贝叶斯也不晚。选型上,如果公司有成熟AB实验平台、样本量充足,就用频率派;如果是冷启动、新功能无历史数据,贝叶斯可以帮你融入经验,但必须把先验的假设写清楚,并做敏感性分析。


读者评论
文章把统计从公式堆里拉回了业务现场,尤其那个促销评估案例很真实,18%的提升被配对检验推翻,这种反转让做数据分析的人特别有共鸣。
最认同“置信区间比P值更值得看”这个观点,实际决策中确实需要知道效果范围而不是只报一个显著与否,对避免被P值绑架很有帮助。
作为统计专业出身,觉得本文对入门者非常友好,把中心极限定理、假设检验讲成了工作语言而非数学定义。不过“样本量越大越好”的误区拆解很到位,伪重复问题常被忽略。
那张使用频次分布图很有说服力,描述统计、置信区间、假设检验就是日常主力,贝叶斯和复杂分布确实用得少。建议入门者先学这些,别被教材目录吓退。
文章点出的四个坑我都踩过,尤其是直接假设正态分布导致负数订单金额的荒谬结论。现在养成先画分布图再选方法的习惯,确实能少犯很多低级错误。