统计学入门 · 抽样与偏差

尝一勺汤,
就知道整锅咸淡

民调只问几百人,就能推测全国态度;老师抽查几份作业,就能判断全班水平。
数据从哪来——为什么「只看一部分」有时也说得通?

向下滑动
第一步 · 日常里的「尝汤」

你其实已经在做抽样了

1 厨房里的统计学

熬一大锅汤,厨师不会把整锅喝完才判断咸淡——搅一搅,舀一勺,尝一口就够了。前提是:汤已经搅匀,这一勺能代表整锅的「平均味道」。

🍲

整锅汤 = 总体

所有要判断的对象:每一滴汤的咸度

🥄

一勺汤 = 样本

从中取出的一小部分,用来推断整体

2 校园与社会里的「一勺汤」

同样的逻辑无处不在:

班级抽查

随机抽 5 份作业,估计全班平均分

产品质量

从一批零件里抽检,判断整批是否合格

民意调查

问几百人,推测千万选民的倾向

医学试验

部分患者试药,推断药物是否有效

关键问题

不是「能不能只看一部分」,而是这一小部分选得公不公平、代不代表。选对了,一勺就够;选偏了,尝十勺也可能错。

第二步 · 三个核心词

总体、样本、参数

1 先对齐词汇

总体(Population)

你真正关心的全部对象。全国选民、整锅汤、一整批豆子。

样本(Sample)

从总体里实际观察到的那一部分。民调受访者、勺里的汤、舀出的豆子。

参数 vs 统计量

总体的真实比例叫参数(往往未知);样本算出的比例叫统计量,用来估计参数。

样本统计量 ≈ 总体参数
例如:样本中 38% 支持某政策 → 估计总体中也有大约 38% 支持(若抽样合理)

2 为什么不每次都「普查」?

理论上,问遍每一个人最准确——这叫普查(census)。但现实中常常做不到:

所以统计学的主线往往是:用较小成本,换足够好的近似——这就是抽样。

第三步 · 为什么抽样能 work

随机性,与「越大越稳」

1 汤要先搅匀

若盐都沉在锅底,只舀表面会淡得离谱;若只舀锅底会咸得吓人。好的抽样像先搅匀再舀——让每个对象都有机会被抽到,这叫随机抽样

随机抽样

每人/每颗豆子机会均等
误差围绕真值上下波动

有偏抽样

只问愿意回答的人
或只舀某一层——系统性偏离

2 样本越大,通常越稳

尝一口汤可能碰巧偏咸或偏淡;多舀几勺取平均,判断会更接近真值。不必记公式,记住直觉就好:

样本量 ↑ → 估计通常更接近总体 → 但成本也 ↑
民调几百到几千人,是在「够准」和「够省」之间找平衡
注意:「越大越稳」说的是随机抽样。若抽样方式本身有偏,堆再大样本也只是在更精确地错
第四步 · 偏差从哪来

常见误解:不是样本小,是选法歪了

1 有偏抽样的典型场景

📞 只打固定电话

年轻人多用手机、少接陌生来电,固定电话样本会系统性漏掉某一类人,结果偏向年长群体。

🙋 只问志愿者

网上「点击参与调查」的人往往更关心话题、更极端。志愿者≠路人,估计会向积极或极端一侧偏

🏫 只问某个班

重点班 vs 普通班、城区 vs 乡镇——若样本来自单一群体,不能代表更大范围的总体。

✓ 好做法

明确总体是谁 → 设计人人有机会被抽到的方案 → 报告样本量与抽法 → 承认仍可能有误差。

2 两个容易混淆的概念

抽样误差

随机抽样的「正常波动」——样本换一批,数字会略变。通常可通过增大样本减小。

抽样偏差

抽法系统性偏向某类对象——估计稳定地偏一边。增大样本也救不了,必须改抽法。

读新闻时多问一句

「这项调查问了谁?怎么找到的?能代表谁?」——比单纯看百分比更重要。

第五步 · 互动演示

罐子抽豆子:随机 vs 只舀表层

你可以试试:罐子里混有红豆和黄豆,真实红豆比例是 30%(绿色竖线)。分别用「随机抽取」和「只舀表层」估比例,多抽几次看差别。

1先选抽法 → 2可调「每次几颗 / 连抽几次」 → 3点下方实心按钮「抽一次」或「连续抽多次」
前两个是「选模式」(会保持选中);后三个是「做事」(点一下即可,不会常亮)。鼠标移上去有说明。手机可点按按钮查看说明气泡。
15
5

当前抽法:随机抽取 — 点「抽一次」开始

① 选择抽法(会保持选中)

② 执行操作(点一下就做事,不会保持选中)

🫙 豆子罐(红豆沉底示意)

真实红豆比例:30%

本次样本

估计红豆比例:

误差:—

0% 真值 30% 100%

历史估计会显示在上方

随机抽取

平均估计:

围绕 30% 上下波动,偶尔偏一点是正常的抽样误差

只舀表层

平均估计:

表层黄豆更多,估计会系统性偏低——这是抽样偏差

结论

切换两种抽法各试几次:随机法长期围绕真值;表层法稳定地错。

总结

尝汤之后,带走这四点

总体 vs 样本

关心的是全体(整锅汤),实际只能看一部分(一勺)。样本是用来推断总体的工具。

抽样省成本

普查准确但贵、慢、有时不可行。合理抽样用较小代价获得可用答案。

随机是关键

像搅匀再舀——让每个对象有机会被抽到。有偏抽法会稳定地错,加大样本也救不了。

越大通常越稳

在随机前提下,样本越大,估计越接近真值。读数据时先问:问的是谁、怎么抽的。

数据从哪来?
Often:从总体里公正地舀一勺
下一回看到调查数字,先想汤有没有搅匀——再决定信不信那一勺。
← 统计系列 返回首页