A/Bテストサンプルサイズ計算機
FreeA/Bテストがバリアントごとに必要な訪問者数を求めます。複数バリアント(ボンフェローニ補正)のサポートとテスト期間の見積り付き。
すべてブラウザ内で動作します。数値がどこかにアップロードされることはありません。
ベースラインと効果
テストパラメータ
バリアントが2つを超える場合、ボンフェローニ補正が適用され、対照群とのすべてのペア比較全体で全体的なエラー率を選択した信頼水準に保ちます。
テスト期間の見積り(任意)
最近のアクティビティ
全員に公開されています。すべての訪問者による直近20回の使用履歴を新しい順に表示します。
まだアクティビティはありません。最初の一人になりましょう。
このツールの機能
このA/Bテストサンプルサイズ計算機は、ベースラインのコンバージョン率、確実に検出したい最小の効果、希望する信頼水準、統計的検出力に基づいて、テストを実行する前にバリアントごとに必要な訪問者数を求めます。ほとんどのA/Bテストプラットフォームの基盤となっている標準的な2標本比率z検定の式を使用しています。
基本的な2バリアント計算に加え、ボンフェローニ補正を自動的に適用することで対照群に対して複数のバリアントをテストすることをサポートし、すべての比較にわたる全体的な偽陽性リスクが静かに上昇するのではなく、選択した信頼水準と一致し続けるようにします。任意の1日あたりのトラフィック欄では、テストの実行に必要なおおよその日数も見積もります。
解決できる問題
- 推測したり早期に打ち切ったりするのではなく、A/Bテストを開始する前に必要な訪問者数を決める。
- より小さな最小検出可能効果を追求することのサンプルサイズコストを理解する。
- 全体的な偽陽性リスクを過小評価することなく、3つ以上のバリアントを持つテストを正しくサイジングする。
- サイトの実際の1日あたりのトラフィックを考慮して、テストを実行する必要があるおおよその日数を見積もる。
- 信頼水準、検出力、効果量が必要なサンプルサイズとどのようにトレードオフの関係にあるかを比較する。
よくある質問
›最小検出可能効果(MDE)とは何ですか?
これは、対照群とバリアントの間で実際にテストに検出してほしい最小の実質的な差です。小さく設定しすぎる(わずかな改善を追い求める)と膨大なサンプルサイズが必要になり、大きく設定しすぎるとテストが本当に意味のある、しかし小さめの改善を見逃す可能性があります。絶対モードはベースラインにパーセンテージポイントを直接加算します(10% + 2pt = 12%)。相対モードはベースラインをパーセンテージで拡大縮小します(10% x 1.20 = 12%)。
›信頼水準と統計的検出力は実際に何を制御していますか?
信頼水準は、実際には差がないのに勝者を宣言してしまう偽陽性への許容度を制御します(信頼水準95%は、そうなる確率が5%であることを意味します)。統計的検出力は、実際に存在する差を見逃してしまう偽陰性への許容度を制御します(検出力80%は、効果が存在する場合にそれを正しく検出する確率が80%、見逃す確率が20%であることを意味します)。
›なぜ2つを超えるバリアントをテストするには補正が必要なのですか?
対照群との比較が増えるたびに、偽陽性がすり抜ける機会も増えるため、比較ごとの信頼水準を同じにしたまま多くのバリアントをテストすると、実際の全体エラー率が静かに上昇します。ボンフェローニ補正は、個々の比較の信頼水準を厳しくすることで、すべての比較を合わせたリスクが元々選択した信頼水準と一致するようにします。ただし、その代償としてバリアントごとに必要なサンプルサイズが大きくなります。
›なぜ必要なサンプルサイズは予想よりもずっと大きいのですか?
小さな効果を確実に検出することは、サンプルサイズの観点から本質的にコストがかかります。必要なサイズは検出しようとしている効果のおおよそ逆二乗に比例して増加するため、MDEを半分にすると必要なサンプルサイズはおよそ4倍になります。これは計算の欠陥ではなく実際の統計的制約であり、すべてのA/Bテストプラットフォームが直面する同じトレードオフです。
›テスト期間の見積りはどのように計算されますか?
すべてのバリアントに必要な総サンプルサイズを1日あたりの訪問者数(実際のトラフィックがバリアント間でどう分配されているかに応じて)で割り、最も近い整数日に切り上げます。これは安定した一貫したトラフィックを前提とした計画上の見積りであり、トラフィックが落ち込んだ場合や、ユーザー行動の週次サイクルも考慮したい場合は、実際のテスト期間はさらに長くなる可能性があります。
›これは結果の分析にどの統計検定が使われることを前提としていますか?
これは、コンバージョン率を比較する標準的な2標本比率z検定を前提としており、「コンバージョンした/しなかった」のような二値の結果を測定する典型的なA/Bテストで最も一般的な手法です。収益やページ滞在時間のような連続的な指標を測定する場合は、その指標の分散に基づく別のサンプルサイズの式が適用されます。
コメント (0)
このツールは役に立ちましたか?コメントを残したり、コツを共有したり、改善方法を教えてください。
まだコメントはありません。最初にご意見をお寄せください!