民调只问几百人,就能推测全国态度;老师抽查几份作业,就能判断全班水平。
数据从哪来——为什么「只看一部分」有时也说得通?
熬一大锅汤,厨师不会把整锅喝完才判断咸淡——搅一搅,舀一勺,尝一口就够了。前提是:汤已经搅匀,这一勺能代表整锅的「平均味道」。
所有要判断的对象:每一滴汤的咸度
从中取出的一小部分,用来推断整体
同样的逻辑无处不在:
随机抽 5 份作业,估计全班平均分
从一批零件里抽检,判断整批是否合格
问几百人,推测千万选民的倾向
部分患者试药,推断药物是否有效
不是「能不能只看一部分」,而是这一小部分选得公不公平、代不代表。选对了,一勺就够;选偏了,尝十勺也可能错。
你真正关心的全部对象。全国选民、整锅汤、一整批豆子。
从总体里实际观察到的那一部分。民调受访者、勺里的汤、舀出的豆子。
总体的真实比例叫参数(往往未知);样本算出的比例叫统计量,用来估计参数。
理论上,问遍每一个人最准确——这叫普查(census)。但现实中常常做不到:
所以统计学的主线往往是:用较小成本,换足够好的近似——这就是抽样。
若盐都沉在锅底,只舀表面会淡得离谱;若只舀锅底会咸得吓人。好的抽样像先搅匀再舀——让每个对象都有机会被抽到,这叫随机抽样。
每人/每颗豆子机会均等
误差围绕真值上下波动
只问愿意回答的人
或只舀某一层——系统性偏离
尝一口汤可能碰巧偏咸或偏淡;多舀几勺取平均,判断会更接近真值。不必记公式,记住直觉就好:
年轻人多用手机、少接陌生来电,固定电话样本会系统性漏掉某一类人,结果偏向年长群体。
网上「点击参与调查」的人往往更关心话题、更极端。志愿者≠路人,估计会向积极或极端一侧偏。
重点班 vs 普通班、城区 vs 乡镇——若样本来自单一群体,不能代表更大范围的总体。
明确总体是谁 → 设计人人有机会被抽到的方案 → 报告样本量与抽法 → 承认仍可能有误差。
随机抽样的「正常波动」——样本换一批,数字会略变。通常可通过增大样本减小。
抽法系统性偏向某类对象——估计稳定地偏一边。增大样本也救不了,必须改抽法。
「这项调查问了谁?怎么找到的?能代表谁?」——比单纯看百分比更重要。
你可以试试:罐子里混有红豆和黄豆,真实红豆比例是 30%(绿色竖线)。分别用「随机抽取」和「只舀表层」估比例,多抽几次看差别。
当前抽法:随机抽取 — 点「抽一次」开始
① 选择抽法(会保持选中)
② 执行操作(点一下就做事,不会保持选中)
真实红豆比例:30%
估计红豆比例:—
误差:—
历史估计会显示在上方
平均估计:—
围绕 30% 上下波动,偶尔偏一点是正常的抽样误差。
平均估计:—
表层黄豆更多,估计会系统性偏低——这是抽样偏差。
切换两种抽法各试几次:随机法长期围绕真值;表层法稳定地错。
关心的是全体(整锅汤),实际只能看一部分(一勺)。样本是用来推断总体的工具。
普查准确但贵、慢、有时不可行。合理抽样用较小代价获得可用答案。
像搅匀再舀——让每个对象有机会被抽到。有偏抽法会稳定地错,加大样本也救不了。
在随机前提下,样本越大,估计越接近真值。读数据时先问:问的是谁、怎么抽的。