WMW

Kalkulator Wielkości Próby Testu A/B

Free

Znajdź, ilu odwiedzających na wariant potrzebuje twój test A/B, z obsługą wielu wariantów (z korektą Bonferroniego) i szacunkiem czasu trwania testu.

Działa całkowicie w twojej przeglądarce. Twoje liczby nigdy nigdzie nie są przesyłane.

Wartość Bazowa i Efekt

Parametry Testu

Więcej niż 2 warianty stosują korektę Bonferroniego, aby utrzymać ogólny wskaźnik błędu na twoim wybranym poziomie ufności we wszystkich parowych porównaniach z kontrolą.

Oszacuj Czas Trwania Testu (opcjonalnie)

Ostatnia Aktywność

Widoczne dla wszystkich. Ostatnie 20 użyć wśród wszystkich odwiedzających, najpierw najnowsze.

Wartość bazowa 10%, MDE 2pp -> 3,839 / wariant

6 godzin temu

Garis dasar 10%, MDE 2pp -> 3,839 / varian

2 dni temu

기준선 10%, MDE 2pp -> 변형당 3,839

2 dni temu

기준선 10%, MDE 2pp -> 변형당 3,839

2 dni temu

Basis 10%, MDE 2pp -> 3,839 / Variante

3 dni temu

Basis 10%, MDE 2pp -> 3,839 / Variante

3 dni temu

Baseline 10%, MDE 2pp -> 3,839 / variant

3 dni temu

Baseline 10%, MDE 2pp -> 3,839 / variant

3 dni temu

Garis dasar 10%, MDE 2pp -> 3,839 / varian

3 dni temu

Baseline 10%, MDE 2pp -> 3,839 / variant

4 dni temu

Basislijn 10%, MDE 2pp -> 3,839 / variant

4 dni temu

Base 10%, MDE 2pp -> 3,839 / variante

4 dni temu

الأساس 10%، MDE 2pp -> 3,839 / متغير

4 dni temu

基线 10%,MDE 2pp -> 每变体 3,839

4 dni temu

Базова лінія 10%, MDE 2pp -> 3,839 / варіант

4 dni temu

Wartość bazowa 10%, MDE 2pp -> 3,839 / wariant

4 dni temu

Base 10%, MDE 2pp -> 3,839 / variante

4 dni temu

الأساس 10%، MDE 2pp -> 3,839 / متغير

5 dni temu

الأساس 10%، MDE 2pp -> 3,839 / متغير

5 dni temu

Basislijn 10%, MDE 2pp -> 3,839 / variant

5 dni temu

Komentarze (0)

Uznałeś to narzędzie za przydatne? Zostaw komentarz, podziel się wskazówką, lub powiedz nam, jak możemy je ulepszyć.

Komentarze gości są sprawdzane przed publikacją. Zaloguj się aby publikować natychmiast.

Jeszcze brak komentarzy. Bądź pierwszym, który podzieli się swoimi przemyśleniami!

Co robi to narzędzie

Ten kalkulator wielkości próbki testu A/B znajduje, ilu odwiedzających na wariant potrzebujesz przed uruchomieniem testu, na podstawie twojego bazowego wskaźnika konwersji, najmniejszego efektu, jaki chcesz niezawodnie wykryć, twojego pożądanego poziomu ufności, i mocy statystycznej. Używa standardowej formuły testu z dla dwóch proporcji, która leży u podstaw większości platform testów A/B.

Poza podstawowym obliczeniem 2-wariantowym, obsługuje testowanie więcej niż jednego wariantu przeciwko kontroli przez automatyczne zastosowanie korekty Bonferroniego, więc ogólne ryzyko fałszywie dodatniego wyniku we wszystkich porównaniach nadal odpowiada wybranemu poziomowi ufności zamiast po cichu rosnąć. Opcjonalne pole dziennego ruchu szacuje też mniej więcej, ile dni musiałby trwać test.

Problemy, które rozwiązuje

Często zadawane pytania

›Czym jest minimalny wykrywalny efekt (MDE)?

To najmniejsza prawdziwa różnica między twoją kontrolą a wariantem, którą faktycznie chcesz, aby test mógł wykryć. Ustawienie jej zbyt małej (pogoń za drobnymi ulepszeniami) wymaga ogromnej wielkości próbki, podczas gdy ustawienie jej zbyt dużej oznacza, że test może przegapić naprawdę znaczące, ale mniejsze ulepszenie. Tryb bezwzględny dodaje punkty procentowe bezpośrednio do wartości bazowej (10% + 2pp = 12%); tryb względny skaluje wartość bazową o procent (10% x 1,20 = 12%).

›Co faktycznie kontrolują poziom ufności i moc statystyczna?

Poziom ufności kontroluje twoją tolerancję na fałszywie dodatni wynik, ogłaszanie zwycięzcy, gdy tak naprawdę nie ma różnicy (poziom ufności 95% oznacza 5% szansy, że to się stanie). Moc statystyczna kontroluje twoją tolerancję na fałszywie ujemny wynik, przeoczenie prawdziwej różnicy, która faktycznie tam jest (moc 80% oznacza 80% szansy na poprawne wykrycie efektu, jeśli istnieje, 20% szansy na przeoczenie go).

›Dlaczego testowanie więcej niż 2 wariantów wymaga korekty?

Każde dodatkowe porównanie z kontrolą to kolejna szansa na przeniknięcie fałszywie dodatniego wyniku, więc testowanie większej liczby wariantów przy tym samym poziomie ufności na porównanie po cichu podnosi twój prawdziwy ogólny wskaźnik błędu. Korekta Bonferroniego zaostrza poziom ufności dla każdego pojedynczego porównania, więc łączne ryzyko dla wszystkich nadal odpowiada twojemu pierwotnie wybranemu poziomowi ufności, kosztem potrzeby większej próbki na wariant.

›Dlaczego wymagana wielkość próbki jest tak dużo większa, niż się spodziewałem?

Niezawodne wykrywanie małych efektów jest z natury kosztowne pod względem wielkości próby, wymagana wielkość rośnie mniej więcej z odwrotnością kwadratu efektu, który próbujesz wykryć, więc zmniejszenie MDE o połowę mniej więcej czterokrotnie zwiększa potrzebną wielkość próby. To prawdziwe ograniczenie statystyczne, nie wada w obliczeniach, to ten sam kompromis, z jakim mierzy się każda platforma testowania A/B.

›Jak jest obliczane oszacowanie czasu trwania testu?

Dzieli całkowitą potrzebną wielkość próbki dla wszystkich wariantów przez twoją dzienną liczbę odwiedzających (podzieloną tak, jak twój ruch jest faktycznie podzielony między warianty) i zaokrągla w górę do najbliższego pełnego dnia. To oszacowanie planistyczne zakładające stały, spójny ruch, faktyczny czas trwania testu może być dłuższy, jeśli ruch spadnie lub jeśli chcesz też uwzględnić cykle tygodniowe w zachowaniu użytkowników.

›Jaki test statystyczny to zakłada do analizy wyników?

Zakłada standardowy test z dla dwóch proporcji porównujący wskaźniki konwersji, najczęstsze podejście dla typowych testów A/B mierzących wynik binarny jak "skonwertował lub nie". Jeśli zamiast tego mierzysz ciągłą metrykę, jak przychód lub czas na stronie, zastosowanie miałaby inna formuła wielkości próbki oparta na wariancji tej metryki.

Powiązane Narzędzia