WMW

Калькулятор статистической значимости A/B-теста

Free

Проверьте, является ли результат A/B-теста статистически значимым, с p-значением, z-оценкой и доверительным интервалом прироста.

Работает полностью в вашем браузере. Ваши числа никуда не загружаются.

Контроль (A)

Вариант (B)

Использует стандартный z-тест для двух долей для сравнения двух коэффициентов конверсии.

Недавняя активность

Видно всем. Последние 20 использований от всех посетителей, сначала новые.

Пока нет активности. Будьте первым.

Комментарии (0)

Понравился инструмент? Оставьте комментарий, поделитесь советом или расскажите, как нам его улучшить.

Комментарии гостей проверяются перед публикацией. Войти чтобы опубликовать мгновенно.

Пока нет комментариев. Будьте первым, кто поделится мнением!

Что делает этот инструмент

Этот калькулятор значимости A/B-теста показывает, является ли разница между коэффициентами конверсии контроля и варианта статистически значимой или это может быть случайным шумом. Введите количество посетителей и конверсий для каждой группы, и он выполнит стандартный z-тест для двух долей, чтобы получить p-значение, z-оценку и чёткий вывод о значимости/незначимости.

Помимо вывода, он показывает как абсолютную разницу в процентных пунктах, так и относительный прирост, плюс доверительный интервал для истинной базовой разницы, так что вы получаете представление о диапазоне правдоподобных результатов, а не просто единственный ответ прошёл/не прошёл.

Какие проблемы решает

Часто задаваемые вопросы

Что на самом деле означает «статистически значимо» здесь?

Это означает, что наблюдаемая разница между коэффициентами конверсии вашего контроля и варианта вряд ли произошла случайно, при выбранном вами уровне достоверности. Это не означает, что эффект велик или практически важен - крошечная реальная разница может быть статистически значимой при достаточном количестве посетителей, в то время как кажущаяся большой разница на малой выборке может таковой не являться.

Почему мой тест показал большую разницу в показателях, но результат оказался «незначимым»?

Это классическая ловушка малой выборки: при малом числе посетителей случайный шум сам по себе может легко создать кажущиеся большими колебания коэффициента конверсии, которые исчезают при увеличении данных. P-значение учитывает размер выборки, а не только величину разницы; разница 10% против 30% при 10 посетителях в каждой группе несёт гораздо меньше доказательств, чем те же проценты при 10 000 посетителей в каждой группе.

Что такое p-значение?

Это вероятность увидеть разницу, по крайней мере такую же большую, между двумя группами, если бы на самом деле реальной разницы между ними не было (это «нулевая гипотеза»). Малое p-значение (ниже вашего порога значимости, например 0,05 для достоверности 95%) означает, что наблюдаемые данные были бы маловероятны при этом предположении об отсутствии разницы - это свидетельство, а не доказательство, что реальная разница существует.

Что мне говорит доверительный интервал прироста?

Это диапазон правдоподобных значений истинной разницы в коэффициенте конверсии между вариантом и контролем, а не просто одна точечная оценка. Если интервал не пересекает ноль, это соответствует значимому результату; если пересекает ноль (что означает, что «отсутствие разницы» - правдоподобный исход), это соответствует незначимому результату, а ширина интервала отражает точность оценки.

Должен ли я останавливать тест, как только он становится значимым?

Как правило, нет - это называется «подглядыванием» (peeking), и это завышает вашу реальную частоту ложноположительных результатов сверх выбранного уровня достоверности, потому что многократные проверки дают случайному шуму больше шансов пересечь порог значимости. Заранее определите размер выборки или продолжительность (в этом поможет калькулятор размера выборки) и проверяйте результаты только по достижении этого значения, а не останавливайтесь в момент, когда видите значимость.

Какой тест используется здесь, и совпадает ли он с тем, что показывает мой инструмент A/B-тестирования?

Используется стандартный z-тест для двух долей - тот же базовый подход, который применяет большинство платформ A/B-тестирования для бинарных метрик конверсии. Точные цифры могут немного отличаться между инструментами в зависимости от поправок на непрерывность, односторонних или двусторонних предположений, либо байесовских методов, которые используют некоторые платформы, поэтому воспринимайте это как надёжную общую перекрёстную проверку, а не ожидайте идентичного p-значения на каждой платформе.

Похожие инструменты