新闻说某市「平均工资 1.2 万」,你拿 6 千——是你拖后腿了吗?
也许问题不在你,而在平均数本身。
这类新闻你一定见过:某城人均月薪破万、某校班级平均分 85……数字听起来挺体面,可一对照身边,总觉得对不上号。
72, 78, 85, 90, 68, 74, 81, 88
大部分同学在 70–90 分之间,感觉「正常水平」大概 80 左右。
平均分 ≈ 79.5
此时平均数还算靠谱——大家差距不大。
5, 6, 5.5, 4.8, 5.2, 5.8, 5.1, 4.9
八个人大多月入四五千到六千,中位数大约 5.2 千——挺符合直觉。
突然来了一位月入 50 万的大老板……
「平均月收入」瞬间飙到约 6 万——可街上的人还是拿五六千。
当数据里出现极端高值(或极端低值)时,「平均」会被狠狠拽走,不再代表「典型的大多数人」。这不是你不够努力,是指标选错了。
它们都想用一个数概括整组数据,但算法完全不同——这就决定了谁能扛住极端值。
把所有数加起来再除以个数。每个数据都有发言权,极端值权重和普通值一样大——所以容易被「拉飞」。
把数据从小到大排队,取正中间那个(偶数个则取中间两数平均)。只看位置,不看具体有多大——极端值挤不进「C 位」。
八人收入(千元/月):4.8, 4.9, 5, 5.1, 5.2, 5.5, 5.8, 6 → 平均数约 5.3 千,中位数 = (5.1 + 5.2) ÷ 2 = 5.15 千。
再加入一位月入 50 万(即 500 千元)的老板:九人平均数 ≈ 60 千(约 6 万/月),中位数仍约 5.2 千——典型的人几乎没变,被拉飞的是「平均」。
这不是统计学家故意为难你,而是数学定义带来的必然结果。
求平均时,极端大数和普通人在加法里权重相同。一个超级大数能把总和抬上天——就像班级平均分里混入一个远超满分的异常分,全班平均立刻失真。
排序后,中间那个人前面和后面各有一半人。你在末尾加一个超级高收入,只是队列变长了,中间站的人还是原来那位。
数据对称分布、没有极端离群值时(比如同一套卷子上,全班成绩集中在 75–85),均值和中位数会非常接近,用哪个都行。
两者没有绝对好坏,关键看你想回答什么问题、数据长什么样。
数据较对称、无极端离群;需要总量信息(如「人均用电量 × 人数 = 总用电」);做进一步计算(方差、标准差都以均值为中心)。
收入、财富、房价等右边拖着长尾巴(少数超高值)的数据——统计上常叫右偏;想描述「典型的人」而非「被极端值抬高的整体」;报告里想避免误导公众。
均值和中位数差很多,本身就在告诉你:分布不对称,存在极端值。负责任的报道会同时给出两者。
你可以试试:切换「班级成绩」或「小镇收入」场景,打开极端高值并拖动滑块——观察平均数与中位数的分轨变化。
当前无极端值:均值与中位数接近,说明数据较对称。
把所有人按收入从低到高排成柱状图,你会看到:左边挤着大多数人,右边拖着一条长长的尾巴——少数极高收入把均值往右拽,中位数却留在「人多的地方」。
右偏 = 右边有长尾。此时中位数通常 < 平均数(均值被超高值抬高)。看到「平均」远高于你的感受时,先问:是不是少数极端值在作怪?