超市试了 A/B/C 三种包装,各问了 50 位顾客;C 的「喜欢」比例最高。
老板想立刻改产线——但「谁最高」和「有没有真差别」,是两件不同的事。
前面几篇我们多半在描述一组数据:平均多少、散不散、图表有没有骗人。现实里更常遇到的是分组对比——不同包装、不同班级、不同疗法、不同按钮颜色,到底表现一不一样?
每种包装各让 50 人打分:喜欢 / 一般 / 不喜欢。你想知道:包装本身会不会影响「喜欢」的比例?
甲班 78、乙班 81、丙班 79、丁班 85——丁班最高。你想知道:班级是不是因素,还是随机波动?
本篇不背检验表,只建立「怎么判断差得多不多」的生活版框架。
多组比较问的不是「哪一组数字最大」,而是:组与组之间的差别,大到不像抽样运气能轻易解释吗?
50 人中 21 人喜欢
50 人中 23 人喜欢
50 人中 26 人喜欢
C 比 A 高 10 个百分点——听起来不少。但若三种包装其实没差,纯靠运气,150 人里也可能碰巧出现「C 略高」的排列。只看冠军,忽略了:差距有多大、整体数据是否支持「有结构性的不同」。
列联表把行(组别)× 列(结果类型)交叉计数。A 可能「喜欢」少,但「不喜欢」也少、中间「一般」多——单看一列比例会漏掉整体模式。
「C 最高,立刻全换 C。」——没问差距是否稳定、是否值得改产线成本。
「三组比例的整体模式,偏离『其实没差』有多远?差够大、样本够稳吗?」
三种包装真实偏好完全一样(各 40% 喜欢),你各问 5 人,完全可能出现 3:1:1 这种「看起来 C 碾压」的表——总共才 15 人,波动极大。
各问 500 人,三组比例会挤在 40% 附近,谁略高谁略低通常差不了几个点——若仍出现 52% vs 38%,才更值得认真怀疑「包装真有影响」。
多组比较本质上也在问:在「各组其实一样」的假设下,眼前这张表有多少见? 样本大 → 小差距也可能被判定为「显著」;样本小 → 大差距也可能只是噪声(详见《「显著」是什么意思?》)。
行是组别(A/B/C 包装),列是结果(喜欢 / 不喜欢)。每个格子填实际数到的次数(观测值)。一眼能看到:每组内部比例、组间差别大概长什么样。
假设三种包装对喜欢率没有影响,那总体 40% 的人喜欢,这 40% 应该「公平地」分摊到各组——结合每组的样本量,算出每个格子的期望计数。
卡方检验(Chi-square)不要你背表,核心画面是:
Demo 里的「偏离指数」就是这种直觉的简化版——不是正式检验统计量,但方向一致:离期望越远,越值得追问「组间真有差吗」。
结果类型是类别(喜欢/不喜欢、合格/不合格)。问:各组的比例结构是否一致?
结果是数值(考分、等待分钟)。问:各组均值之间的差距,是否大于组内每个人的随机波动?
甲 78、乙 81、丙 79、丁 85——若每班内部成绩很散(有人 40 有人 95),那 7 分的班际差距可能只是正常波动;若每班内部都挤在窄区间,7 分就更「扎眼」。
你可以试试:切换场景、调整每组样本量——看列联表、柱状图和「期望 vs 实际」偏离如何变化。感受「谁最高」和「整体差得多不多」为何不是一回事。
| 喜欢 | 不喜欢 | 行合计 | |
|---|---|---|---|
| 列合计 | — | — | — |
—