WMW

A/B测试显著性计算器

Free

检查A/B测试结果是否具有统计显著性,提供p值、z值以及提升的置信区间。

完全在您的浏览器中运行。您的数字绝不会被上传到任何地方。

对照组(A)

变体(B)

使用标准的双比例z检验来比较两个转化率。

最近活动

所有人可见。所有访客的最近 20 次使用记录,最新的在前。

暂无活动记录。快来成为第一个吧。

评论 (0)

觉得这个工具有用吗?留下评论、分享一个小技巧,或者告诉我们如何改进它。

访客评论在发布前会经过审核。 登录 即可立即发布。

暂无评论,快来抢沙发分享您的想法吧!

此工具的功能

这个A/B测试显著性计算器可以告诉您对照组和变体转化率之间的差异在统计上是否显著,还是可能只是随机噪声。输入每组的访客数和转化数,它会运行标准的双比例z检验,得出p值、z值以及明确的显著/不显著判定。

除了判定结果之外,它还显示以百分点表示的绝对差异和相对提升,以及真实潜在差异的置信区间,这样您就能了解合理结果的范围,而不仅仅是一个通过/不通过的答案。

解决的问题

常见问题

这里的"具有统计显著性"实际上是什么意思?

这意味着,在您选择的置信水平下,对照组和变体转化率之间观察到的差异不太可能仅仅是由随机机会造成的。这并不意味着该效应很大或具有实际重要性--在访客数量足够的情况下,一个微小的真实差异也可能具有统计显著性,而小样本中看起来很大的差异可能并不具有统计显著性。

为什么我的测试显示比率有很大差异,但结果却是"不显著"?

这是典型的小样本陷阱:访客较少时,仅凭随机噪声就很容易产生看似很大的转化率波动,而这种波动会随着数据增多而消失。p值考虑的是样本量,而不仅仅是差异的大小;每组10名访客的10%对30%差异所提供的证据,远少于每组10,000名访客的相同百分比所提供的证据。

什么是p值?

这是在两组之间实际上没有真实差异("零假设")的前提下,观察到至少这么大差异的概率。较小的p值(低于您的显著性阈值,例如95%置信度对应0.05)意味着在无差异假设下观察到的数据不太可能出现,这是存在真实差异的证据,而不是证明。

提升的置信区间告诉了我什么?

这是变体和对照组转化率真实差异的一个合理值范围,而不仅仅是单一的点估计。如果该区间不跨越零,则与显著结果相符;如果跨越零(意味着"没有差异"是一个合理的结果),则与不显著结果相符,区间的宽度反映了估计的精确程度。

我应该在测试变得显著后立即停止吗?

一般来说不应该,这被称为"窥视"(peeking),它会使您的真实假阳性率超过您选择的置信水平,因为反复检查会给随机噪声更多机会越过显著性阈值。请提前决定样本量或持续时间(样本量计算器可以帮助您做到这一点),并且只在达到该值后才检查结果,而不是在看到显著性的那一刻就停止。

这个工具使用什么检验,它与我的A/B测试工具报告的结果一致吗?

它使用标准的双比例z检验,这也是大多数A/B测试平台用于二元转化指标的基础方法。由于连续性校正、单尾与双尾假设,或某些平台改用贝叶斯方法等原因,不同工具之间的精确数字可能略有差异,因此请将此视为一个可靠的通用交叉检验,而不要期望与每个平台的p值完全相同。

相关工具