A/B测试样本量计算器
Free找出您的A/B测试每个变体需要多少访客,支持多变体(邦费罗尼校正)并提供测试时长估算。
完全在您的浏览器中运行。您的数字绝不会被上传到任何地方。
基线与效应
测试参数
超过2个变体时会应用邦费罗尼校正,以在所有与对照组的两两比较中将整体错误率保持在您选择的置信水平。
估算测试时长(可选)
最近活动
所有人可见。所有访客的最近 20 次使用记录,最新的在前。
暂无活动记录。快来成为第一个吧。
此工具的功能
此A/B测试样本量计算器根据您的基线转化率、您希望可靠检测到的最小效应、期望的置信水平和统计功效,计算出运行测试前每个变体所需的访客数量。它使用大多数A/B测试平台所基于的标准双比例z检验公式。
除了基本的双变体计算之外,它还支持通过自动应用邦费罗尼校正来测试多个变体与对照组的对比,从而使所有比较中的整体假阳性风险仍然符合您选择的置信水平,而不是悄悄升高。一个可选的每日流量字段还会大致估算测试需要运行多少天。
解决的问题
- 在启动A/B测试之前确定它需要多少访客,而不是靠猜测或提前停止。
- 了解追求更小的最小可检测效应所带来的样本量成本。
- 正确确定含3个或更多变体的测试规模,而不低估整体假阳性风险。
- 根据您网站的实际每日流量,大致估算测试需要运行多少天。
- 比较置信水平、功效和效应大小如何与所需样本量相互权衡。
常见问题
›什么是最小可检测效应(MDE)?
这是您真正希望测试能够检测到的对照组和变体之间的最小真实差异。设置得太小(追求微小的改进)需要巨大的样本量,而设置得太大则意味着测试可能会漏掉真正有意义但较小的改进。绝对模式直接将百分点加到基线上(10% + 2个百分点 = 12%);相对模式按百分比缩放基线(10% x 1.20 = 12%)。
›置信水平和统计功效实际上控制着什么?
置信水平控制您对假阳性的容忍度--即在实际没有差异时宣布获胜者(95%的置信水平意味着有5%的概率发生这种情况)。统计功效控制您对假阴性的容忍度--即漏检确实存在的真实差异(80%的功效意味着如果效应存在,有80%的概率正确检测到它,20%的概率漏检)。
›为什么测试超过2个变体需要进行校正?
每增加一次与对照组的比较,就多一次假阳性悄悄溜过的机会,因此在相同的单次比较置信水平下测试更多变体会不知不觉地提高您真正的整体错误率。邦费罗尼校正收紧了每次单独比较的置信水平,使所有比较的综合风险仍然符合您最初选择的置信水平,代价是每个变体需要更大的样本量。
›为什么所需的样本量比我预期的大得多?
可靠地检测小效应本质上在样本量方面成本高昂,所需样本量大致与您要检测的效应的平方成反比增长,因此将MDE减半大约会使所需样本量增加四倍。这是真实的统计学限制,而不是计算上的缺陷,这是每个A/B测试平台都会面临的相同权衡。
›测试时长估算是如何计算的?
它将所有变体所需的总样本量除以您的每日访客数(按照您的流量在各变体之间的实际分配比例),然后向上取整到最近的整天。这是一个假设流量稳定一致的规划性估算;如果流量下降,或者您还想考虑用户行为的每周周期性变化,实际测试时长可能会更长。
›该工具假设使用什么统计检验来分析结果?
它假设使用标准的双比例z检验来比较转化率,这是典型A/B测试中衡量"转化或未转化"这类二元结果最常用的方法。如果您衡量的是连续型指标,比如收入或页面停留时间,则会采用基于该指标方差的不同样本量公式。
评论 (0)
觉得这个工具有用吗?留下评论、分享一个小技巧,或者告诉我们如何改进它。
暂无评论,快来抢沙发分享您的想法吧!