WMW

Calculadora de Significancia de Pruebas A/B

Free

Comprueba si el resultado de una prueba A/B es estadísticamente significativo, con valor p, puntuación z, y un intervalo de confianza para el aumento.

Funciona completamente en tu navegador. Tus números nunca se suben a ningún sitio.

Control (A)

Variante (B)

Usa una prueba z de dos proporciones estándar para comparar las dos tasas de conversión.

Actividad reciente

Visible para todos. Últimos 20 usos de todos los visitantes, más recientes primero.

Aún no hay actividad. Sé el primero.

Comentarios (0)

¿Te ha resultado útil esta herramienta? Deja un comentario, comparte un consejo o cuéntanos cómo podemos mejorarla.

Los comentarios de invitados se revisan antes de publicarse. Iniciar sesión para publicar al instante.

Aún no hay comentarios. ¡Sé el primero en compartir tu opinión!

Qué hace esta herramienta

Esta calculadora de significancia de pruebas A/B te indica si la diferencia entre las tasas de conversión de un control y una variante es estadísticamente significativa, o podría plausiblemente ser ruido aleatorio. Ingresa los recuentos de visitantes y conversiones de cada grupo, y ejecuta una prueba z de dos proporciones estándar para producir un valor p, una puntuación z y un veredicto claro de significativo/no significativo.

Más allá del veredicto, muestra tanto la diferencia absoluta en puntos porcentuales como el aumento relativo, además de un intervalo de confianza para la diferencia subyacente real, para que tengas una idea del rango de resultados plausibles, no solo una única respuesta de aprobado/reprobado.

Problemas que resuelve

Preguntas frecuentes

¿Qué significa realmente "estadísticamente significativo" aquí?

Significa que es poco probable que la diferencia observada entre las tasas de conversión de tu control y variante haya ocurrido solo por azar, al nivel de confianza elegido. No significa que el efecto sea grande o prácticamente importante; una diferencia real y diminuta puede ser estadísticamente significativa con suficientes visitantes, mientras que una diferencia que parece grande en una muestra pequeña podría no serlo.

¿Por qué mi prueba mostró una gran diferencia en las tasas pero salió "no significativa"?

Esta es la trampa clásica de las muestras pequeñas: con pocos visitantes, el ruido aleatorio por sí solo puede producir fácilmente oscilaciones aparentemente grandes en la tasa de conversión que desaparecen con más datos. El valor p tiene en cuenta el tamaño de la muestra, no solo el tamaño de la diferencia; una diferencia del 10% frente al 30% con 10 visitantes cada uno aporta mucha menos evidencia que los mismos porcentajes con 10,000 visitantes cada uno.

¿Qué es un valor p?

Es la probabilidad de observar una diferencia al menos así de grande entre los dos grupos si en realidad no hubiera una diferencia real entre ellos (la "hipótesis nula"). Un valor p pequeño (por debajo de tu umbral de significancia, como 0.05 para un 95% de confianza) significa que los datos observados serían poco probables bajo ese supuesto de no diferencia, lo cual es evidencia, no prueba, de que existe una diferencia real.

¿Qué me indica el intervalo de confianza del aumento?

Es un rango de valores plausibles para la diferencia real en la tasa de conversión entre variante y control, no solo una única estimación puntual. Si el intervalo no cruza el cero, eso concuerda con un resultado significativo; si sí cruza el cero (lo que significa que "ninguna diferencia" es un resultado plausible), eso concuerda con uno no significativo, y el ancho del intervalo refleja qué tan precisa es la estimación.

¿Debo detener mi prueba tan pronto como se vuelva significativa?

Generalmente no; esto se llama "peeking" (espiar) e infla tu tasa real de falsos positivos más allá del nivel de confianza elegido, porque revisar repetidamente le da al ruido aleatorio más oportunidades de cruzar el umbral de significancia. Decide un tamaño de muestra o duración de antemano (una calculadora de tamaño de muestra ayuda con esto) y revisa los resultados solo una vez que se alcance, en lugar de detenerte en el momento en que ves significancia.

¿Qué prueba usa esto y coincide con lo que reporta mi herramienta de pruebas A/B?

Usa una prueba z de dos proporciones estándar, el mismo enfoque subyacente que usan la mayoría de las plataformas de pruebas A/B para métricas de conversión binarias. Los números exactos pueden diferir ligeramente entre herramientas según las correcciones de continuidad, los supuestos de una cola frente a dos colas, o los métodos bayesianos que algunas plataformas usan en su lugar, así que trata esto como una sólida comprobación cruzada de propósito general en lugar de esperar un valor p idéntico en cada plataforma.

Herramientas relacionadas