Калькулятор статистической значимости A/B-теста
FreeПроверьте, является ли результат A/B-теста статистически значимым, с p-значением, z-оценкой и доверительным интервалом прироста.
Работает полностью в вашем браузере. Ваши числа никуда не загружаются.
Контроль (A)
Вариант (B)
Использует стандартный z-тест для двух долей для сравнения двух коэффициентов конверсии.
Недавняя активность
Видно всем. Последние 20 использований от всех посетителей, сначала новые.
Пока нет активности. Будьте первым.
Что делает этот инструмент
Этот калькулятор значимости A/B-теста показывает, является ли разница между коэффициентами конверсии контроля и варианта статистически значимой или это может быть случайным шумом. Введите количество посетителей и конверсий для каждой группы, и он выполнит стандартный z-тест для двух долей, чтобы получить p-значение, z-оценку и чёткий вывод о значимости/незначимости.
Помимо вывода, он показывает как абсолютную разницу в процентных пунктах, так и относительный прирост, плюс доверительный интервал для истинной базовой разницы, так что вы получаете представление о диапазоне правдоподобных результатов, а не просто единственный ответ прошёл/не прошёл.
Какие проблемы решает
- Проверка того, является ли результат A/B-теста реальным доказательством разницы или может быть случайным шумом.
- Избегание классической ошибки доверия большой процентной разнице из небольшой выборки.
- Получение диапазона (доверительного интервала) того, насколько большим может быть истинный эффект, а не просто вывод да/нет.
- Перепроверка результата, сообщённого платформой A/B-тестирования, с помощью независимого расчёта.
- Понимание того, насколько большой прирост дал победивший вариант, как в абсолютном, так и в относительном выражении.
Часто задаваемые вопросы
›Что на самом деле означает «статистически значимо» здесь?
Это означает, что наблюдаемая разница между коэффициентами конверсии вашего контроля и варианта вряд ли произошла случайно, при выбранном вами уровне достоверности. Это не означает, что эффект велик или практически важен - крошечная реальная разница может быть статистически значимой при достаточном количестве посетителей, в то время как кажущаяся большой разница на малой выборке может таковой не являться.
›Почему мой тест показал большую разницу в показателях, но результат оказался «незначимым»?
Это классическая ловушка малой выборки: при малом числе посетителей случайный шум сам по себе может легко создать кажущиеся большими колебания коэффициента конверсии, которые исчезают при увеличении данных. P-значение учитывает размер выборки, а не только величину разницы; разница 10% против 30% при 10 посетителях в каждой группе несёт гораздо меньше доказательств, чем те же проценты при 10 000 посетителей в каждой группе.
›Что такое p-значение?
Это вероятность увидеть разницу, по крайней мере такую же большую, между двумя группами, если бы на самом деле реальной разницы между ними не было (это «нулевая гипотеза»). Малое p-значение (ниже вашего порога значимости, например 0,05 для достоверности 95%) означает, что наблюдаемые данные были бы маловероятны при этом предположении об отсутствии разницы - это свидетельство, а не доказательство, что реальная разница существует.
›Что мне говорит доверительный интервал прироста?
Это диапазон правдоподобных значений истинной разницы в коэффициенте конверсии между вариантом и контролем, а не просто одна точечная оценка. Если интервал не пересекает ноль, это соответствует значимому результату; если пересекает ноль (что означает, что «отсутствие разницы» - правдоподобный исход), это соответствует незначимому результату, а ширина интервала отражает точность оценки.
›Должен ли я останавливать тест, как только он становится значимым?
Как правило, нет - это называется «подглядыванием» (peeking), и это завышает вашу реальную частоту ложноположительных результатов сверх выбранного уровня достоверности, потому что многократные проверки дают случайному шуму больше шансов пересечь порог значимости. Заранее определите размер выборки или продолжительность (в этом поможет калькулятор размера выборки) и проверяйте результаты только по достижении этого значения, а не останавливайтесь в момент, когда видите значимость.
›Какой тест используется здесь, и совпадает ли он с тем, что показывает мой инструмент A/B-тестирования?
Используется стандартный z-тест для двух долей - тот же базовый подход, который применяет большинство платформ A/B-тестирования для бинарных метрик конверсии. Точные цифры могут немного отличаться между инструментами в зависимости от поправок на непрерывность, односторонних или двусторонних предположений, либо байесовских методов, которые используют некоторые платформы, поэтому воспринимайте это как надёжную общую перекрёстную проверку, а не ожидайте идентичного p-значения на каждой платформе.
Похожие инструменты
Калькуляторы
Калькулятор ANC
Рассчитайте абсолютное количество нейтрофилов (ANC) по значениям общего анализа крови и узнайте степень нейтропении по NCI CTCAE прямо в браузере.
FreeКалькуляторы
Калькулятор ангельских чисел
Узнайте нумерологическое значение повторяющегося числа или числа жизненного пути по дате рождения прямо в браузере.
FreeКалькуляторы
Конвертер углов
Конвертируйте углы между градусами, радианами, градами, оборотами, угловыми минутами, угловыми секундами и миллирадианами с живой поддержкой ГМС.
FreeКалькуляторы
Калькулятор угловой скорости
Конвертируйте угловую скорость между об/мин, рад/с, Гц и другими единицами, или вычислите её из линейной скорости и радиуса.
Комментарии (0)
Понравился инструмент? Оставьте комментарий, поделитесь советом или расскажите, как нам его улучшить.
Пока нет комментариев. Будьте первым, кто поделится мнением!