统计学进阶 · 假设检验直觉

新闻说「显著差异」,
到底显著在哪?

新药试验 p=0.03、民调「95% 置信区间不含零」、App 改版「有统计学显著提升」——
这些术语天天见,却最容易被听成「肯定有效 / 肯定没差」。

向下滑动
第一步 · 现象

同一总体,抽两次样,结论可能不一样

1 一条常见新闻

「某市平均通勤时间为 42 分钟,较去年的 38 分钟统计学显著上升(p < 0.05)。」

读者容易理解成:通勤确实变长了,而且「证据很硬」。但统计学家想表达的,往往是另一层意思——在「其实没变化」的假设下,这次抽样的差距算不算少见

2 先用具体数字走一遍(30 秒版)

假设全市真实平均通勤一直是 40 分钟(我们不知道)。今年随机问了 200 人,样本平均 42;去年另一批 200 人,样本平均 38

人话:区间回答「估计晃多大」;p 值回答「若没真差别,这结果有多离谱」。两者都在处理抽样波动,不是在说「有多重要」。

2 抽样的天然波动

就算城市真实的平均通勤时间一整年都没变,你随机问两批人,算出的平均数也几乎不会完全一样:今天问 200 人得 39 分钟,下周再问 200 人可能得 41 分钟。

这不是调查员偷懒,而是抽样本身就会晃——和抛硬币短期里比例偏离 50% 是同一类现象。问题变成:我们看到的差距,是「真变了」,还是「抽样晃出来的」?

核心问题

「显著性」讨论的不是「结果有多重要」,而是:在一种保守假设(通常叫零假设)下,当前数据有多「出乎意料」。 置信区间和 p 值,都是帮你在「波动」里划边界的工具。

第二步 · 置信区间

区间在说什么?

1 用区间代替「一个点」

样本均值是一个估计,会随抽样变化。与其只报「样本平均 42 分钟」,不如报一个置信区间,例如「95% 置信区间:40~44 分钟」——意思是:用这套方法反复抽样、反复算区间,大约 95% 的区间会罩住真实平均值。

95% 置信区间 ≈ 样本均值 ± 一点「误差余地」
误差余地来自样本大小和数据的离散程度——样本越大,区间通常越窄

2 最常见的误读(务必纠正)

❌ 错误说法

「真实平均值有 95% 的概率落在这个区间里。」

✓ 更准确的说法

「重复做 100 次这种调查,大约 95 次算出的区间能罩住真实平均值。」(95% 是方法的长期命中率,不是「这个区间里参数有 95% 概率」。)

真实平均值是固定的(只是我们不知道),区间才是随样本变的。把 95% 理解成「参数在区间里的概率」,是科普里最需要纠正的误解之一。

3 怎么用来读新闻?

若报道写「两种疗法差异的 95% 置信区间为 0.2~3.1(单位:天)」:

第三步 · p 值

p 值量的是什么?

1 从「零假设」出发

检验时常先假设零假设 H₀ 成立——例如「新药与安慰剂效果一样」「通勤时间今年和去年没差」。在这个假设下,我们可以问:如果 H₀ 真对,抽到像现在这样(或更极端)的数据,有多常见?

这个「有多常见」的量化,就是 p 值(probability 的 p,但不是「结论为真的概率」)。

2 人话版定义

p 值 = 在 H₀ 成立时,
得到「至少这么极端」结果的概率
「极端」由具体检验定义——比如样本均值离假设值特别远、两组差距特别大

p 小 → 在「其实没差」的世界里,这次结果挺少见 → 有人会拒绝 H₀,报告「统计显著」。
p 大 → 在 H₀ 下这类结果很常见 → 数据不足以说 H₀ 不对(不等于证明 H₀ 对)。

3 p 值同样不是「结果为真的概率」

❌ 错误

「p = 0.03,所以新药有效的概率是 97%。」

✓ 正确方向

「p = 0.03 说的是:若药其实无效,我们这么巧抽到当前数据的概率约 3%。」

「药是否有效」是我们要判断的事;p 值是在假设无效的前提下,对数据的稀有程度打分——两者不是同一个概率。

第四步 · 常见误解

听统计术语时,别自动脑补

1 「p < 0.05 = 发现了真理」

0.05 只是人为约定的阈值,不是自然定律。重复做很多检验、只挑显著的结果报道,会产生大量「假阳性」——看起来显著,其实只是运气。

2 「不显著 = 没效果」

样本太小、测量噪声大,都可能导致 p 值很大。「没检出来」≠「不存在」——可能只是证据不够。置信区间很宽时尤其要小心这种解读。

3 「显著 ↔ 置信区间」各说各话?

在常见的「差异是否为 0」检验里,二者往往同步:95% 置信区间不含 0,通常对应双侧 p < 0.05。但区间还额外告诉你差距可能有多大——这是 p 值单独给不出的。

记住:置信区间讲「估计范围 + 方法长期命中率」;p 值讲「在 H₀ 下数据有多极端」。它们都不直接回答「效应有多大、是否值得行动」——那是另一个问题。
第五步 · 显著 ≠ 重要

统计显著,生活未必在乎

1 样本够大,微小差距也能「显著」

在线广告 A 点击率 10.00%,B 点击率 10.05%,样本各 100 万——p 值可能极小,统计上「显著更好」。但对业务来说,0.05 个百分点值得改全站吗?显著性看的是信号是否不像纯噪声;重要性看的是幅度与成本。

2 反过来:重要但未必显著

新疗法平均多延长 2 个月生存,但试验只招募了 30 人——区间很宽,p 值可能大于 0.05。差异可能很重要,只是当前数据还不足以让检验「报警」。

读报道时的两个追问

效应有多大?(看均值差、比例差、置信区间宽度)
这个幅度对我重要吗?(医疗、金钱、时间、风险)——统计显著只是第一道筛,不是终点。

延伸阅读:若还不熟悉「抽样为什么会晃」,可先读 《数据从哪来?抽样像尝一勺汤》; 关于波动大小,见 《离散:大家挤一起还是很散?》
第六步 · 互动演示

用模拟感受区间与 p 值

你可以试试:切换两种模拟——重复抽样看 95% 置信区间有多少罩住真值;或在零假设(其实没差)下,看「极端结果」出现有多罕见,对照 p 值的直觉。

设定真实平均值(绿线),反复随机抽样并画 95% 置信区间。大约 95% 的区间应罩住真值——偶尔「漏网」是正常的。

真实平均值 罩住真值的区间 未罩住(约 5%)
已抽样 0 次
100
30

总抽样次数

0

罩住真值

0

覆盖率

假设两组其实没差别(零假设),重复做实验,记录「样本均值差」。直方图是 H₀ 下差距的分布;竖线是你设定的「观测差距」——落在右尾越靠外,p 值越小。

模拟 0 次
3.0
25

模拟次数

0

≥ 观测差距的次数

0

估计 p 值

读图:橙色区域是「在没差别假设下,差距 ≥ 你设定值」的模拟结果。p 估计 = 极端次数 ÷ 总次数。样本量越大,分布越窄——小差距也可能变得「显著」。
总结

显著性:在噪声里判「算不算少见」

抽样会晃

同样总体,重复抽样会得到不同估计——差距未必代表真实变化。

置信区间

描述方法的长期命中率;不是「参数有 95% 概率在区间内」。

p 值

在 H₀ 下,数据至少这么极端的概率;不是「结论为真」的概率。

显著 ≠ 重要

还要看效应大小、区间宽度、成本与场景——别只盯 p < 0.05。

问「显著吗」之前,
先问「差多少、对我重要吗」
← 统计系列 返回首页