统计决策 · 进阶

A/B 测试:
哪个按钮更好?

产品团队把「立即购买」改成蓝色大按钮——
点击率涨了 0.3%。是改版成功,还是随机波动在骗你?

向下滑动
第一步 · 现象

两个版本,谁该赢?

电商 App 想提高下单率。设计师做了两版结账按钮,产品同学拍板:各放一半用户,看哪版点击更多——这就是 A/B 测试的日常。

立即购买

版本 A · 灰色小按钮

老版本,团队觉得「稳但不够醒目」。

立即购买

版本 B · 蓝色大按钮

新版本,设计师押宝「更抢眼 = 更多点击」。

1 上线第一天就开会

每组只来了 200 个用户:A 版点击率 4.5%,B 版 6.0%。产品经理兴奋地说:「B 赢了,全量上线!」

一周后样本到了 5000,B 版反而略低于 A 版——第一天的「赢家」是假的,只是小样本里的运气。

关键线索

A/B 测试不是「比两个数谁大」,而是在问:我看到的差距,是改版真的更好,还是随机噪声? 回答这个问题,需要公平分组、足够样本,以及克制「偷看」的冲动。

第二步 · 概念

A/B 测试在比较什么?

1 核心结构

随机分组

用户被随机分到 A 或 B,两组除按钮外尽量相同

同时运行

两版并行上线,避免「周一用 A、周二用 B」的时间差干扰

看指标

常用点击率、转化率、停留时长等可量化结果

积累样本

收集足够多用户后,再判断差距是否稳定

2 点击率怎么算

点击率 = 点击人数 ÷ 看到按钮的人数
例如 B 组 3000 人看到按钮、180 人点击 → 点击率 = 180 ÷ 3000 = 6%
随机分组是灵魂:如果主动把「爱点按钮的老用户」都塞进 B 组,B 赢不代表按钮更好——只代表你挑了更容易点击的人。公平比较的前提,是分组像抛硬币一样随机。
第三步 · 为什么

样本量与抽样波动

1 小样本里,谁都能「暂时领先」

即使两版真实点击率一样,抽 50 个人也可能 A 是 8%、B 是 2%——纯粹是运气。样本越小,这种「假差距」越大、越常见。

每组 100 人

A 5.0% vs B 7.5%
差距可能是噪声

每组 5000 人

A 5.1% vs B 6.4%
趋势更可信

2 为什么要「攒够人」再下结论

样本量越大,观测到的点击率越靠近真实水平,随机上下抖动的幅度越小——这和抛硬币「次数多了比例才稳」是同一类直觉。

真实差距很小 → 需要更多人才能可靠分辨
0.1% 的点击率提升,比 5% 的提升更难测出来,实验往往要跑更久

人话版

样本量不是「越大越好」的虚荣指标,而是对抗运气的弹药。差距越小、你越想要把握,需要的弹药就越多。

第四步 · 误解

过早偷看:「假赢家」从哪来

1 偷看(peeking)的诱惑

实验跑着跑着,忍不住每天刷新后台:「咦,B 领先了,赶紧全量!」——这叫偷看结果。每偷看一次,就多一次「碰巧看到 B 领先」的机会;看得越多,误报「B 赢了」的概率越高,即使 B 其实没更好。

2 三种常见坑

表现 为什么错
样本太小就拍板 每组几百人就宣布胜负 随机波动可以伪造 1–2 个百分点的差距
分组不随机 把 VIP 用户全给新版本 比较的是「人群差异」,不是「版本差异」
反复偷看、见好就收 每天看数据,一领先就停 多次检验放大「假阳性」,把运气当胜利
记住:专业团队会事先定好样本量或实验时长,跑满再分析;或者使用专门的「序贯检验」方法——不是「看着顺眼就停」。大众版原则更简单:别太早下结论
第五步 · 互动演示

模拟两版按钮:小样本里的「假赢家」

你可以试试:下方隐藏设定是B 版真实点击率略高。调节「每组新增用户」,点「再收集一批」或「偷看一次结果」——看样本少时 A 是否也会「暂时领先」;也可关掉公平分组,看「混杂」如何污染结论。

点击率对比
版本 A · 灰按钮
0 展示 · 0 点击
版本 B · 蓝按钮
0 展示 · 0 点击
0
总用户数
0
偷看次数
当前领先
100

先点「再收集一批」积累用户;样本少时领先方可能随时翻转——那就是「假赢家」。

总结

A/B 测试:公平比较 + 足够样本 + 别偷看

随机分组

像抛硬币分配用户,两组才可比;偏袒某一组会污染结论。

样本量

人越多,点击率越稳;小差距要更多人才能看清。

假赢家

小样本里的领先常常是运气,不是改版真的更好。

别过早偷看

反复偷看、见好就收,会把随机波动当成胜利。

好的 A/B 测试:
随机分、跑够人、一次定案
下次看到「改版涨 0.3%」——先问:分组公平吗?样本够吗?是不是只看了一天数据?
← 统计系列 返回首页