WMW

Калькулятор размера выборки A/B-теста

Free

Узнайте, сколько посетителей на вариант нужно для вашего A/B-теста, с поддержкой нескольких вариантов (с поправкой Бонферрони) и оценкой продолжительности теста.

Работает полностью в вашем браузере. Ваши числа никуда не загружаются.

Базовое значение и эффект

Параметры теста

Более 2 вариантов приводят к применению поправки Бонферрони, чтобы общая частота ошибок оставалась на выбранном уровне достоверности во всех попарных сравнениях с контролем.

Оценить продолжительность теста (необязательно)

Недавняя активность

Видно всем. Последние 20 использований от всех посетителей, сначала новые.

Пока нет активности. Будьте первым.

Комментарии (0)

Понравился инструмент? Оставьте комментарий, поделитесь советом или расскажите, как нам его улучшить.

Комментарии гостей проверяются перед публикацией. Войти чтобы опубликовать мгновенно.

Пока нет комментариев. Будьте первым, кто поделится мнением!

Что делает этот инструмент

Этот калькулятор размера выборки для A/B-теста определяет, сколько посетителей на вариант вам нужно перед запуском теста, на основе вашего базового коэффициента конверсии, наименьшего эффекта, который вы хотите надёжно обнаружить, желаемого уровня достоверности и статистической мощности. Он использует стандартную формулу z-теста для двух долей, лежащую в основе большинства платформ A/B-тестирования.

Помимо базового расчёта для 2 вариантов, он поддерживает тестирование более одного варианта против контроля, автоматически применяя поправку Бонферрони, чтобы общий риск ложноположительного результата по всем сравнениям по-прежнему соответствовал выбранному вами уровню достоверности, а не незаметно рос. Необязательное поле ежедневного трафика также приблизительно оценивает, сколько дней потребуется для проведения теста.

Какие проблемы решает

Часто задаваемые вопросы

Что такое минимально обнаруживаемый эффект (MDE)?

Это наименьшая реальная разница между вашим контролем и вариантом, которую вы действительно хотите, чтобы тест мог обнаружить. Слишком маленькое значение (погоня за крошечными улучшениями) требует огромного размера выборки, а слишком большое означает, что тест может пропустить действительно значимое, но меньшее улучшение. Абсолютный режим прибавляет процентные пункты напрямую к базовому показателю (10% + 2 п.п. = 12%); относительный режим масштабирует базовый показатель на процент (10% x 1,20 = 12%).

Что на самом деле контролируют уровень достоверности и статистическая мощность?

Уровень достоверности определяет допустимую вероятность ложноположительного результата - объявления победителя, когда на самом деле разницы нет (уровень достоверности 95% означает 5%-ную вероятность этого). Статистическая мощность определяет допустимую вероятность ложноотрицательного результата - пропуска реально существующей разницы (мощность 80% означает 80%-ную вероятность правильно обнаружить эффект, если он есть, и 20%-ную вероятность его пропустить).

Почему тестирование более 2 вариантов требует поправки?

Каждое дополнительное сравнение с контролем - это ещё один шанс проскочить ложноположительному результату, поэтому тестирование большего числа вариантов при одном и том же уровне достоверности на сравнение незаметно повышает вашу истинную общую частоту ошибок. Поправка Бонферрони ужесточает уровень достоверности для каждого отдельного сравнения, чтобы совокупный риск по всем ним по-прежнему соответствовал изначально выбранному уровню достоверности, ценой необходимости большего размера выборки на вариант.

Почему требуемый размер выборки намного больше, чем я ожидал?

Надёжное обнаружение малых эффектов по своей природе требует больших затрат с точки зрения размера выборки - необходимый размер растёт примерно обратно пропорционально квадрату эффекта, который вы пытаетесь обнаружить, поэтому уменьшение MDE вдвое примерно вчетверо увеличивает требуемый размер выборки. Это реальное статистическое ограничение, а не недостаток расчёта, с этим же компромиссом сталкивается каждая платформа A/B-тестирования.

Как рассчитывается оценка продолжительности теста?

Он делит общий необходимый размер выборки по всем вариантам на количество ежедневных посетителей (распределённых так, как реально распределяется ваш трафик между вариантами), и округляет до целого дня. Это плановая оценка, предполагающая стабильный, постоянный трафик; фактическая продолжительность теста может быть больше, если трафик падает или если вы также хотите учесть недельные циклы в поведении пользователей.

Какой статистический тест предполагается использовать для анализа результатов?

Предполагается стандартный z-тест для двух долей, сравнивающий коэффициенты конверсии - наиболее распространённый подход для типичных A/B-тестов, измеряющих бинарный результат вроде «конвертировал или нет». Если вместо этого вы измеряете непрерывную метрику, например доход или время на странице, применялась бы другая формула размера выборки, основанная на дисперсии этой метрики.

Похожие инструменты