WMW

Калькулятор розміру вибірки A/B-тесту

Free

Знайдіть, скільки відвідувачів на варіант потребує ваш A/B-тест, з підтримкою кількох варіантів (скоригованих за Бонферроні) та оцінкою тривалості тесту.

Працює повністю у вашому браузері. Ваші числа ніколи нікуди не завантажуються.

Базова лінія і Ефект

Параметри тесту

Більше 2 варіантів застосовує корекцію Бонферроні, щоб утримати загальну частоту помилок на обраному вами рівні довіри у всіх попарних порівняннях з контролем.

Оцінити Тривалість Тесту (опціонально)

Недавня Активність

Видно всім. Останні 20 використань серед усіх відвідувачів, найновіші спочатку.

Wartość bazowa 10%, MDE 2pp -> 3,839 / wariant

6 годин тому

Garis dasar 10%, MDE 2pp -> 3,839 / varian

2 дні тому

기준선 10%, MDE 2pp -> 변형당 3,839

2 дні тому

기준선 10%, MDE 2pp -> 변형당 3,839

2 дні тому

Basis 10%, MDE 2pp -> 3,839 / Variante

3 дні тому

Basis 10%, MDE 2pp -> 3,839 / Variante

3 дні тому

Baseline 10%, MDE 2pp -> 3,839 / variant

3 дні тому

Baseline 10%, MDE 2pp -> 3,839 / variant

3 дні тому

Garis dasar 10%, MDE 2pp -> 3,839 / varian

3 дні тому

Baseline 10%, MDE 2pp -> 3,839 / variant

4 дні тому

Basislijn 10%, MDE 2pp -> 3,839 / variant

4 дні тому

Base 10%, MDE 2pp -> 3,839 / variante

4 дні тому

الأساس 10%، MDE 2pp -> 3,839 / متغير

4 дні тому

基线 10%,MDE 2pp -> 每变体 3,839

4 дні тому

Базова лінія 10%, MDE 2pp -> 3,839 / варіант

4 дні тому

Wartość bazowa 10%, MDE 2pp -> 3,839 / wariant

4 дні тому

Base 10%, MDE 2pp -> 3,839 / variante

4 дні тому

الأساس 10%، MDE 2pp -> 3,839 / متغير

5 днів тому

الأساس 10%، MDE 2pp -> 3,839 / متغير

5 днів тому

Basislijn 10%, MDE 2pp -> 3,839 / variant

5 днів тому

Коментарі (0)

Знайшли цей інструмент корисним? Залиште коментар, поділіться порадою, чи скажіть нам, як ми можемо покращити його.

Коментарі гостей переглядаються перед публікацією. Увійти щоб публікувати миттєво.

Ще немає коментарів. Будьте першим, хто поділиться думками!

Що робить цей інструмент

Цей калькулятор розміру вибірки A/B-тесту знаходить, скільки відвідувачів на варіант вам потрібно перед запуском тесту, на основі базового коефіцієнта конверсії, найменшого ефекту, який ви хочете надійно виявити, бажаного рівня довіри та статистичної потужності. Він використовує стандартну формулу z-тесту для двох пропорцій, що лежить в основі більшості платформ A/B-тестування.

Окрім базового розрахунку з 2 варіантами, він підтримує тестування більше одного варіанта проти контролю шляхом автоматичного застосування корекції Бонферроні, тому загальний ризик хибно-позитивного результату серед усіх порівнянь все ще відповідає обраному вами рівню довіри замість того, щоб тихо повзти вгору. Опціональне поле щоденного трафіку також приблизно оцінює, скільки днів потрібно проводити тест.

Проблеми, які це вирішує

Часті запитання

›Що таке мінімальний виявний ефект (MDE)?

Це найменша реальна різниця між вашим контролем і варіантом, яку ви насправді хочете, щоб тест міг виявити. Встановлення її занадто малою (гонитва за крихітними покращеннями) вимагає величезного розміру вибірки, тоді як встановлення занадто великою означає, що тест може пропустити дійсно значуще, але менше покращення. Абсолютний режим додає відсоткові пункти безпосередньо до базової лінії (10% + 2пп = 12%); відносний режим масштабує базову лінію на відсоток (10% x 1,20 = 12%).

›Що насправді контролюють рівень довіри та статистична потужність?

Рівень довіри контролює вашу толерантність до хибно-позитивного результату, оголошення переможця, коли насправді немає різниці (95% рівень довіри означає 5% шанс, що це станеться). Статистична потужність контролює вашу толерантність до хибно-негативного результату, пропуску реальної різниці, яка насправді існує (80% потужність означає 80% шанс правильно виявити ефект, якщо він існує, 20% шанс пропустити його).

›Чому тестування понад 2 варіантів потребує корекції?

Кожне додаткове порівняння з контролем - це ще один шанс для хибно-позитивного результату проскочити, тому тестування більшої кількості варіантів на тому самому рівні довіри за порівняння тихо підвищує вашу справжню загальну частоту помилок. Корекція Бонферроні звужує рівень довіри для кожного окремого порівняння, щоб об'єднаний ризик серед усіх них все ще відповідав вашому початково обраному рівню довіри, ціною необхідності більшого розміру вибірки на варіант.

›Чому потрібний розмір вибірки набагато більший, ніж я очікував?

Надійне виявлення малих ефектів за своєю суттю дорого коштує з точки зору розміру вибірки, необхідний розмір зростає приблизно обернено пропорційно квадрату ефекту, який ви намагаєтесь виявити, тому зменшення MDE вдвічі приблизно вчетверо збільшує необхідний розмір вибірки. Це реальне статистичне обмеження, а не недолік в обчисленні, це той самий компроміс, з яким стикається кожна платформа A/B тестування.

›Як обчислюється оцінка тривалості тесту?

Це ділить загальний необхідний розмір вибірки для всіх варіантів на вашу кількість щоденних відвідувачів (розподілену так, як фактично розподілений ваш трафік між варіантами), і округлює вгору до найближчого цілого дня. Це планова оцінка, що передбачає стабільний, послідовний трафік, фактична тривалість тесту може бути довшою, якщо трафік падає, чи якщо ви також хочете врахувати тижневі цикли в поведінці користувачів.

›Який статистичний тест передбачається для аналізу результатів?

Це передбачає стандартний z-тест двох пропорцій, що порівнює коефіцієнти конверсії, найпоширеніший підхід для типових A/B тестів, що вимірюють бінарний результат, наприклад "конвертувалось чи ні". Якщо ви натомість вимірюєте безперервну метрику, наприклад дохід чи час на сторінці, застосовувалась би інша формула розміру вибірки на основі дисперсії цієї метрики.

Пов'язані Інструменти