一个困扰无数学子的问题

为什么统计学
到处都是平方

方差、最小二乘法、正态分布……
统计学家是不是对"平方"有什么执念?

向下探索
第一步 · 序章

一个让我失眠的问题

1 平方无处不在

翻开任何一本统计学书,你会发现"平方"像刺客一样埋伏在各个角落:

方差

误差的平方的平均

最小二乘法

误差的平方和最小

正态分布

e−x² 藏在中心

标准差

方差的平方根

2 有人问了

"为什么不直接用绝对值?3 和 −3 的误差都是 3,多直观啊!"

绝对值的困惑

"|3| = 3,|−3| = 3,
听起来很合理啊?"

老师的回答

"因为数学上方便。"
……这跟没说一样

真相是...

统计学家不是偏爱平方,而是三百年的数学推理证明了:平方是最优雅的选择。这不是习惯,是数学的必然。

第二步 · 起源

一个靠赌博养家的数学家

1 棣莫弗 (1667–1754)

法国数学家,因宗教迫害逃到英国。靠给贵族子弟教数学糊口——但真正让他上瘾的,是赌博。

他不是烂赌鬼,而是那种坐在赌场边,拿笔算概率的人。

2 他的问题

抛一枚硬币很多次,正面朝上的次数会怎么分布?

他算啊算,终于发现了一个神奇的公式——在这个公式的正中央,站着一个东西:

e−x²
这是正态分布的"老祖宗",也是"平方"第一次在概率界亮相
0 (均值) −σ −2σ +2σ 正态分布 · 钟形曲线 e⁻ˣ² 是它的核心

棣莫弗没想到的

他只是觉得"嗯,这个平方用起来挺顺手"。他没意识到,自己刚刚点燃了一根引信——这根引信,三十年后会被一个 24 岁的德国小伙子引爆。

第三步 · 突破

24岁天才的"封神操作"

1 高斯的问题

1801 年,天文学家头疼极了:谷神星这颗小行星跑哪儿去了?大家测了很多次,数据都不一样。怎么从这些杂乱的测量中,找到"最可能"的位置?

大家都会取平均值。但问题来了:凭什么平均值就是最好的?

2 高斯的大胆假设

高斯(当时才24岁!)做了一个大胆假设:

"如果测量误差的分布,刚好是棣莫弗那个带平方的曲线呢?"

顺着这个思路,他发现了美妙的事情:

如果用"误差的平方和"衡量总误差

那么让平方和最小的那个数

恰好就是算术平均数!

双向奔赴

相信"平均数最好"
→ 误差公式里必须有平方

使用"平方误差最小"
→ 最佳估计就是平均数

一拍即合

"平均数"和"平方和"
是天生一对!

这就是最小二乘法的数学基础

从此,平方封神

高斯用最小二乘法确定了谷神星的位置。从此,用最小化误差平方和来找最佳估计的方法,就叫"最小二乘法"。平方从一个不起眼的数学运算,一夜之间封神。

第四步 · 核心问题

为什么不用绝对值?终于有答案了

1 两个函数的样子

答案其实很简单,但也很颠覆:绝对值函数有一个"尖角",平方函数是光滑的。

平方函数 y = x² 光滑的碗底 → 可导 绝对值 y = |x| 尖尖的角 → 不可导 可以用微积分求最小值 微积分工具失效

2 "可导"是什么意思?

数学里会说:平方函数可导,绝对值函数在零点不可导。

用人话解释就是:

平方函数 = 光滑的碗

站在碗底,往左往右都平滑过渡。
你可以轻松滑到最低点。
微积分可以求最小值

绝对值函数 = 大V

站在V的尖尖上,往左往右都不对。
数学上很难处理。
微积分无法使用

结论:不是统计学家偏爱平方,而是平方让数学变得优雅、简单、可解。它不是习惯,是必然。
第五步 · 方差

高尔顿和皮尔逊:方差的诞生

1 他们想解决什么问题?

他们想衡量一组数据有多"散"——比如一个班级的成绩分布。

用绝对值算"平均误差"当然可以,但那个尖角问题又来了。于是他们顺理成章地用了平方。

① 计算每个数据点与均值的差

误差 = x − 平均值

② 把每个误差平方,去掉负号

误差² = (x − 平均值)²

③ 取平均 → 方差

方差 = Σ(误差²) / N

④ 再开个平方 → 标准差

标准差 = √方差(和原始数据单位一致)

2 从此我们有了简洁的语言

"这个班级平均分85分,
标准差是5分。"
这背后的"5分",站着的,是三百年的数学大厦
第六步 · 均值与中位数

平均数和中位数,你选谁?

1 两种误差,两种最优

误差准则 最优代表 数学工具
平方误差 算术平均数 微积分可用
绝对误差 中位数 优化困难

2 为什么生活中更常用平均数?

平均工资、平均分、平均身高……不是因为平均数永远更好,而是因为——

统计学的"漫威宇宙"

平方误差体系长出了一个庞大的工具家族:

方差 标准差 最小二乘法 正态分布 回归分析 t检验 ANOVA 置信区间

它们彼此支持,形成了一个自洽的统计学宇宙

平方误差体系

有联盟
方差+正态分布+回归+……
形成了一个强大的工具家族

绝对误差体系

像孤胆英雄
很强,但缺少联盟支持
工具链不完整

第七步 · 互动演示

平方 vs 绝对值:谁更适合当「误差」?

你可以试试:在数轴上拖动数据点,观察均值中位数谁能让总误差更小——以及为什么平方误差偏爱均值。

拖动圆点改变数据

均值(算术平均)

平方误差和 SSE =

绝对误差和 SAE =

中位数

平方误差和 SSE =

绝对误差和 SAE =

结论

均值最小化平方误差;中位数最小化绝对误差。

提示:下方曲线对比单个误差 e 的 e² 与 |e|——注意 e² 在 0 处光滑,|e| 在 0 处有尖角。
2.0

e² = 4.0  |  |e| = 2.0

总结

下次看到平方,不要再抓狂了

1700s · 棣莫弗

研究赌博概率,发现 e−x²。平方第一次在概率界亮相。

1800s · 高斯

用最小二乘法确定谷神星位置,证明了"平均数和平方误差"是天造地设的一对。

平方的数学优势

光滑可导,微积分全程可用。绝对值有尖角,优化困难。

工具生态

平方误差体系长出了方差、正态分布、回归分析……形成统计学宇宙。

平方不是统计学的怪癖
而是"平均值是最优代表"
这个信念的数学化身
知道了这个故事之后,
你再看平方——它在发光。
1700s

棣莫弗 · 正态分布诞生

1800s

高斯 · 最小二乘法封神

今天

深度学习 · 梯度下降的核心

← 统计系列 返回首页