统计学进阶 · 多组比较

三种包装摆货架,
周报说 C 最受欢迎——
真该全面换 C 吗?

超市试了 A/B/C 三种包装,各问了 50 位顾客;C 的「喜欢」比例最高。
老板想立刻改产线——但「谁最高」和「有没有真差别」,是两件不同的事。

向下滑动
第一步 · 何时需要比多组

一组数不够,问题变成「几组之间有没有差」

前面几篇我们多半在描述一组数据:平均多少、散不散、图表有没有骗人。现实里更常遇到的是分组对比——不同包装、不同班级、不同疗法、不同按钮颜色,到底表现一不一样?

货架 · 三种包装

每种包装各让 50 人打分:喜欢 / 一般 / 不喜欢。你想知道:包装本身会不会影响「喜欢」的比例?

校园 · 四个班数学均分

甲班 78、乙班 81、丙班 79、丁班 85——丁班最高。你想知道:班级是不是因素,还是随机波动?

1 两类常见问法

本篇不背检验表,只建立「怎么判断差得多不多」的生活版框架。

核心问题

多组比较问的不是「哪一组数字最大」,而是:组与组之间的差别,大到不像抽样运气能轻易解释吗?

第二步 · 不能只看哪个最高

「C 包装最高」≠「C 明显更好」

包装 A
42%

50 人中 21 人喜欢

包装 B
46%

50 人中 23 人喜欢

包装 C ★
52%

50 人中 26 人喜欢

1 排名会骗人

C 比 A 高 10 个百分点——听起来不少。但若三种包装其实没差,纯靠运气,150 人里也可能碰巧出现「C 略高」的排列。只看冠军,忽略了:差距有多大、整体数据是否支持「有结构性的不同」

2 还要看「不喜欢」那一列

列联表把行(组别)× 列(结果类型)交叉计数。A 可能「喜欢」少,但「不喜欢」也少、中间「一般」多——单看一列比例会漏掉整体模式。

❌ 草率结论

「C 最高,立刻全换 C。」——没问差距是否稳定、是否值得改产线成本。

✓ 更稳的问法

「三组比例的整体模式,偏离『其实没差』有多远?差够大、样本够稳吗?」

第三步 · 波动与样本量

小样本里,谁最高可能只是运气

1 同样的「结构」,样本越小越晃

三种包装真实偏好完全一样(各 40% 喜欢),你各问 5 人,完全可能出现 3:1:1 这种「看起来 C 碾压」的表——总共才 15 人,波动极大。

各问 500 人,三组比例会挤在 40% 附近,谁略高谁略低通常差不了几个点——若仍出现 52% vs 38%,才更值得认真怀疑「包装真有影响」。

2 和 p 值篇连起来想

多组比较本质上也在问:在「各组其实一样」的假设下,眼前这张表有多少见? 样本大 → 小差距也可能被判定为「显著」;样本小 → 大差距也可能只是噪声(详见《「显著」是什么意思?》)。

样本量 checklist:每组人数是否够?是否只测了一两家店、一个班?有没有中途换规则?——这些都会让「多组比较」的结论变脆。
第四步 · 列联表与卡方直觉

不背公式,也能感到「偏离有多远」

1 列联表:把交叉计数摆成格子

行是组别(A/B/C 包装),列是结果(喜欢 / 不喜欢)。每个格子填实际数到的次数(观测值)。一眼能看到:每组内部比例、组间差别大概长什么样。

2 「期望计数」:若包装没差,格子大概该多少?

假设三种包装对喜欢率没有影响,那总体 40% 的人喜欢,这 40% 应该「公平地」分摊到各组——结合每组的样本量,算出每个格子的期望计数

期望 ≈(该行合计 × 该列合计)÷ 总人数
人话:在「行与列独立、互不影响」的世界里,这个格子「理应」出现多少次

3 卡方直觉:观测离期望有多远?

卡方检验(Chi-square)不要你背表,核心画面是:

Demo 里的「偏离指数」就是这种直觉的简化版——不是正式检验统计量,但方向一致:离期望越远,越值得追问「组间真有差吗」。

第五步 · ANOVA 直觉

比的是分数时:组间差 vs 组内散

列联表 / 卡方

结果类型是类别(喜欢/不喜欢、合格/不合格)。问:各组的比例结构是否一致?

ANOVA(方差分析)直觉

结果是数值(考分、等待分钟)。问:各组均值之间的差距,是否大于组内每个人的随机波动?

1 四班均分:别只盯丁班 85

甲 78、乙 81、丙 79、丁 85——若每班内部成绩很散(有人 40 有人 95),那 7 分的班际差距可能只是正常波动;若每班内部都挤在窄区间,7 分就更「扎眼」。

2 一句话类比

ANOVA 直觉 ≈ 组间差距 够不够大,
相对每组内部的「散度」
组内越散,越需要更大的组间差才敢说「班级/疗法/版本真的不同」
工具选型:类别结果 → 列联表思路;数值结果 → 比均值 + 看组内波动。两者底层问题相同:差别是否超出抽样噪声? 正式分析还要配对设计、多重比较校正等——本篇只建立直觉。
本页 Demo 聚焦列联表:下方互动是「三种包装 × 喜欢/不喜欢」。四班均分 / ANOVA 仅作概念对照——同一直觉(组间差 vs 组内散),可玩 Demo 请用包装场景。
第六步 · 动手体验

三种包装:差得多吗?

你可以试试:切换场景、调整每组样本量——看列联表、柱状图和「期望 vs 实际」偏离如何变化。感受「谁最高」和「整体差得多不多」为何不是一回事。

列联表(观测 / 期望 / 偏离)

喜欢 不喜欢 行合计
列合计
观测值 括号内为期望 偏离(观−期)

「喜欢」比例柱状对比

偏离指数:各格观测与期望差值的绝对值之和(直觉版,非正式 χ²)
50 人/组

总结

带走这四点

  1. 多组比较问的是「有没有结构性差别」,不是简单排名谁第一——包装、班级、疗法都适用。
  2. 不能只看最高那一组:看整张列联表或各组分布;类别结果用比例结构,数值结果看均值与散度。
  3. 样本量决定波动:小样本里「C 最高」可能只是运气;样本大仍差很多,才更值得行动。
  4. 卡方 / ANOVA 的公共直觉:观测(或组间差)离「其实没差」的期望有多远?够远且样本稳,再谈改包装、换教法、上新版。
← 统计系列 返回首页