自由 开放 发现 分享 专业 助力
注册

认知网精选 · 认知

A/B 测试

把「我觉得」换成「两个版本各跑一半,看数据说话」。
A/B 测试是一套用受控对照来比较两个方案的办法。把人群随机分成两组,只改一个变量,一组看原来的做法,一组看新做法,再比较结果有没有真实差异。关键在「随机」和「只改一个」,否则你分不清到底是谁起的作用。
mindmodels.net

一、它到底是什么

它不只是网页按钮颜色的工具。任何「两个做法选哪个」的问题,只要能量化结果、能量控制变量,都能套进来。广告文案、邮件标题、定价展示、课程封面、推送时间,都能测。

它的根子在实验设计。统计学家费希尔最早在农业试验里,把随机化、对照、重复这套做法系统化,后来被搬进医学临床试验,再被搬上网。

二、为什么它管用 / 为什么人会这样

人天生不擅长从少量观察里判断因果。我们容易记住印象深的、声音大的、最近发生的证据,还容易把「改了什么」和「结果变好」直接连起来,忽略了同一时期其他变化。

随机分组能压掉这个偏差。两组除了被测的那个变量,其他条件在希望上是差不多的,结果差异就更可能来自变量本身,而不是运气或者季节、活动、外部新闻。这就把「相关」往「因果」推近了一步。

还有一点:它让争论有了裁判。团队里谁说服力强、谁职位高,都不重要,数据说了算。这会明显降低做决定的摩擦。

三、什么时候会碰到它 / 该用它

  • 有两个以上可选方案,且说不清哪个更好。
  • 结果可以量化,比如点击、注册、付费、留存。
  • 能控制除被测变量以外的其他条件。
  • 流量或样本量足够,能在合理时间内看出差异。
  • 改动可逆,失败代价小,值得用小成本换确定性。

四、什么时候它不管用

当样本太小、差异太小,或者结果受很多外部因素干扰时,A/B 测试会给你噪声,甚至给你相反的结论。当改动不可逆、代价极高,比如一次性大促、品牌重塑、合规敏感动作,你没有第二次机会随机分组,就不该硬测。还有一类情况:真正的问题是产品价值不成立,这时候测按钮颜色,只是在优化一个没人想要的东西。

五、例子

改按钮文案

一个注册页长期只有少数访客完成注册。团队把「立即开始」和「免费试用,随时可退出」两个版本各投一半人,一周后发现后者点的人更多,于是保留。改动只涉及一行字。

邮件标题

同一封通知邮件写两个标题,随机发出。结果一个标题打开的人明显更多,之后同类邮件都沿用这个写法。注意,这里测的是标题,不是邮件正文。

更隐蔽的日常版

你总觉得自己做的菜咸淡刚好,家人却常说要再加点。与其争,不如这周做饭分两锅,一锅按你的量放盐,一锅按家人的量,让他们盲吃、不告诉哪锅是哪锅,回来统计哪锅被吃得更干净。你在用一顿饭做了一次对照。

六、最容易走偏的地方

  • 一次改好几个地方:标题、价格、配图一起换了,最后根本不知道是哪个起作用。一次只动一个变量。
  • 提前偷看结果就下结论:数据刚开始波动大,看到好就停,容易把运气当成效果。先定好测多久、看什么指标。
  • 只看点击不看后续:点击涨了,注册却降了,说明你吸引来的是不该来的人。要盯真正的目标指标。
  • 样本量不够硬测:几十个人的样本,随机波动就能造出「显著差异」。先算清楚需要多少样本,或者干脆不测。

七、怎么把它用起来

  • 用一句话写下要回答的问题,比如「换标题能不能提高打开率」。
  • 定一个主指标,再定一两个不能被伤害的护栏指标,防止按下葫芦起了瓢。
  • 只改一个变量,其余全部保持一致。
  • 随机分组,确保两组人在关键特征上大体相当。
  • 提前决定测多久、凑够多少样本,到点再看结果,不中途改规则。
  • 结果出来后写一句结论,并说明它在什么条件下成立,避免过度推广。

八、它和「假设检验」不一样

A/B 测试是执行层的一套做法,讲的是怎么把实验跑起来、怎么分组、怎么控变量。假设检验是统计层的判断工具,讲的是拿到数据后,这个差异是真信号还是随机波动的概率有多大。一次 A/B 测试的结果,通常要靠假设检验来下判断。两者是搭档,不是一回事。

九、常问的几个问题

必须随机分组吗?

是。不随机,两组人本来就不一样,你分不清差异来自方案还是来自人群。

只测一个变量会不会太慢?

会慢,但结论可信。想快,可以并行跑多个互不干扰的实验,而不是在一个实验里堆变量。

测出好结果就能全量推吗?

还要看它有没有伤害别的指标,以及换到更大范围、不同人群后是否还成立。

相关

假设检验、漏斗分析、期望值、对照实验、统计显著性

一句话收束

A/B 测试的价值不在「测」,而在逼你把猜测变成可被推翻的判断,并用数据来裁决。

想回头看看这个概念的原始整理,从原页进去。

前往 mindmodels.net

回顶部

Copyright © 2021-2026 陕ICP备2021016533号-1法律条款