新药试验 p=0.03、民调「95% 置信区间不含零」、App 改版「有统计学显著提升」——
这些术语天天见,却最容易被听成「肯定有效 / 肯定没差」。
读者容易理解成:通勤确实变长了,而且「证据很硬」。但统计学家想表达的,往往是另一层意思——在「其实没变化」的假设下,这次抽样的差距算不算少见。
假设全市真实平均通勤一直是 40 分钟(我们不知道)。今年随机问了 200 人,样本平均 42;去年另一批 200 人,样本平均 38。
就算城市真实的平均通勤时间一整年都没变,你随机问两批人,算出的平均数也几乎不会完全一样:今天问 200 人得 39 分钟,下周再问 200 人可能得 41 分钟。
这不是调查员偷懒,而是抽样本身就会晃——和抛硬币短期里比例偏离 50% 是同一类现象。问题变成:我们看到的差距,是「真变了」,还是「抽样晃出来的」?
「显著性」讨论的不是「结果有多重要」,而是:在一种保守假设(通常叫零假设)下,当前数据有多「出乎意料」。 置信区间和 p 值,都是帮你在「波动」里划边界的工具。
样本均值是一个估计,会随抽样变化。与其只报「样本平均 42 分钟」,不如报一个置信区间,例如「95% 置信区间:40~44 分钟」——意思是:用这套方法反复抽样、反复算区间,大约 95% 的区间会罩住真实平均值。
「真实平均值有 95% 的概率落在这个区间里。」
「重复做 100 次这种调查,大约 95 次算出的区间能罩住真实平均值。」(95% 是方法的长期命中率,不是「这个区间里参数有 95% 概率」。)
真实平均值是固定的(只是我们不知道),区间才是随样本变的。把 95% 理解成「参数在区间里的概率」,是科普里最需要纠正的误解之一。
若报道写「两种疗法差异的 95% 置信区间为 0.2~3.1(单位:天)」:
检验时常先假设零假设 H₀ 成立——例如「新药与安慰剂效果一样」「通勤时间今年和去年没差」。在这个假设下,我们可以问:如果 H₀ 真对,抽到像现在这样(或更极端)的数据,有多常见?
这个「有多常见」的量化,就是 p 值(probability 的 p,但不是「结论为真的概率」)。
p 小 → 在「其实没差」的世界里,这次结果挺少见 → 有人会拒绝 H₀,报告「统计显著」。
p 大 → 在 H₀ 下这类结果很常见 → 数据不足以说 H₀ 不对(不等于证明 H₀ 对)。
「p = 0.03,所以新药有效的概率是 97%。」
「p = 0.03 说的是:若药其实无效,我们这么巧抽到当前数据的概率约 3%。」
「药是否有效」是我们要判断的事;p 值是在假设无效的前提下,对数据的稀有程度打分——两者不是同一个概率。
0.05 只是人为约定的阈值,不是自然定律。重复做很多检验、只挑显著的结果报道,会产生大量「假阳性」——看起来显著,其实只是运气。
样本太小、测量噪声大,都可能导致 p 值很大。「没检出来」≠「不存在」——可能只是证据不够。置信区间很宽时尤其要小心这种解读。
在常见的「差异是否为 0」检验里,二者往往同步:95% 置信区间不含 0,通常对应双侧 p < 0.05。但区间还额外告诉你差距可能有多大——这是 p 值单独给不出的。
在线广告 A 点击率 10.00%,B 点击率 10.05%,样本各 100 万——p 值可能极小,统计上「显著更好」。但对业务来说,0.05 个百分点值得改全站吗?显著性看的是信号是否不像纯噪声;重要性看的是幅度与成本。
新疗法平均多延长 2 个月生存,但试验只招募了 30 人——区间很宽,p 值可能大于 0.05。差异可能很重要,只是当前数据还不足以让检验「报警」。
① 效应有多大?(看均值差、比例差、置信区间宽度)
② 这个幅度对我重要吗?(医疗、金钱、时间、风险)——统计显著只是第一道筛,不是终点。
你可以试试:切换两种模拟——重复抽样看 95% 置信区间有多少罩住真值;或在零假设(其实没差)下,看「极端结果」出现有多罕见,对照 p 值的直觉。
设定真实平均值(绿线),反复随机抽样并画 95% 置信区间。大约 95% 的区间应罩住真值——偶尔「漏网」是正常的。
假设两组其实没差别(零假设),重复做实验,记录「样本均值差」。直方图是 H₀ 下差距的分布;竖线是你设定的「观测差距」——落在右尾越靠外,p 值越小。
同样总体,重复抽样会得到不同估计——差距未必代表真实变化。
描述方法的长期命中率;不是「参数有 95% 概率在区间内」。
在 H₀ 下,数据至少这么极端的概率;不是「结论为真」的概率。
还要看效应大小、区间宽度、成本与场景——别只盯 p < 0.05。