产品团队把「立即购买」改成蓝色大按钮——
点击率涨了 0.3%。是改版成功,还是随机波动在骗你?
电商 App 想提高下单率。设计师做了两版结账按钮,产品同学拍板:各放一半用户,看哪版点击更多——这就是 A/B 测试的日常。
老版本,团队觉得「稳但不够醒目」。
新版本,设计师押宝「更抢眼 = 更多点击」。
每组只来了 200 个用户:A 版点击率 4.5%,B 版 6.0%。产品经理兴奋地说:「B 赢了,全量上线!」
一周后样本到了 5000,B 版反而略低于 A 版——第一天的「赢家」是假的,只是小样本里的运气。
A/B 测试不是「比两个数谁大」,而是在问:我看到的差距,是改版真的更好,还是随机噪声? 回答这个问题,需要公平分组、足够样本,以及克制「偷看」的冲动。
用户被随机分到 A 或 B,两组除按钮外尽量相同
两版并行上线,避免「周一用 A、周二用 B」的时间差干扰
常用点击率、转化率、停留时长等可量化结果
收集足够多用户后,再判断差距是否稳定
即使两版真实点击率一样,抽 50 个人也可能 A 是 8%、B 是 2%——纯粹是运气。样本越小,这种「假差距」越大、越常见。
A 5.0% vs B 7.5%
差距可能是噪声
A 5.1% vs B 6.4%
趋势更可信
样本量越大,观测到的点击率越靠近真实水平,随机上下抖动的幅度越小——这和抛硬币「次数多了比例才稳」是同一类直觉。
样本量不是「越大越好」的虚荣指标,而是对抗运气的弹药。差距越小、你越想要把握,需要的弹药就越多。
实验跑着跑着,忍不住每天刷新后台:「咦,B 领先了,赶紧全量!」——这叫偷看结果。每偷看一次,就多一次「碰巧看到 B 领先」的机会;看得越多,误报「B 赢了」的概率越高,即使 B 其实没更好。
| 坑 | 表现 | 为什么错 |
|---|---|---|
| 样本太小就拍板 | 每组几百人就宣布胜负 | 随机波动可以伪造 1–2 个百分点的差距 |
| 分组不随机 | 把 VIP 用户全给新版本 | 比较的是「人群差异」,不是「版本差异」 |
| 反复偷看、见好就收 | 每天看数据,一领先就停 | 多次检验放大「假阳性」,把运气当胜利 |
你可以试试:下方隐藏设定是B 版真实点击率略高。调节「每组新增用户」,点「再收集一批」或「偷看一次结果」——看样本少时 A 是否也会「暂时领先」;也可关掉公平分组,看「混杂」如何污染结论。
先点「再收集一批」积累用户;样本少时领先方可能随时翻转——那就是「假赢家」。
像抛硬币分配用户,两组才可比;偏袒某一组会污染结论。
人越多,点击率越稳;小差距要更多人才能看清。
小样本里的领先常常是运气,不是改版真的更好。
反复偷看、见好就收,会把随机波动当成胜利。