WMW

Calculadora de Tamaño de Muestra para Pruebas A/B

Free

Encuentra cuántos visitantes por variante necesita tu prueba A/B, con soporte para múltiples variantes (corregidas con Bonferroni) y una estimación de duración de la prueba.

Funciona completamente en tu navegador. Tus números nunca se suben a ningún sitio.

Línea base y efecto

Parámetros de la prueba

Más de 2 variantes aplica una corrección de Bonferroni para mantener la tasa de error general en el nivel de confianza elegido en todas las comparaciones por pares contra el control.

Estimar duración de la prueba (opcional)

Actividad reciente

Visible para todos. Últimos 20 usos de todos los visitantes, más recientes primero.

Aún no hay actividad. Sé el primero.

Comentarios (0)

¿Te ha resultado útil esta herramienta? Deja un comentario, comparte un consejo o cuéntanos cómo podemos mejorarla.

Los comentarios de invitados se revisan antes de publicarse. Iniciar sesión para publicar al instante.

Aún no hay comentarios. ¡Sé el primero en compartir tu opinión!

Qué hace esta herramienta

Esta calculadora de tamaño de muestra para pruebas A/B determina cuántos visitantes por variante necesitas antes de ejecutar una prueba, según tu tasa de conversión de referencia, el efecto más pequeño que quieres detectar de forma fiable, el nivel de confianza deseado y la potencia estadística. Usa la fórmula estándar de prueba z de dos proporciones que subyace a la mayoría de las plataformas de pruebas A/B.

Más allá de un cálculo básico de 2 variantes, admite probar más de una variante contra un control aplicando automáticamente una corrección de Bonferroni, de modo que el riesgo general de falso positivo en todas las comparaciones siga coincidiendo con el nivel de confianza elegido en lugar de aumentar silenciosamente. Un campo opcional de tráfico diario también estima aproximadamente cuántos días necesitaría ejecutarse la prueba.

Problemas que resuelve

Preguntas frecuentes

¿Qué es el efecto mínimo detectable (MDE)?

Es la diferencia real más pequeña entre tu control y variante que realmente quieres que la prueba pueda detectar. Establecerla demasiado pequeña (persiguiendo mejoras diminutas) exige un tamaño de muestra enorme, mientras que establecerla demasiado grande significa que la prueba podría pasar por alto una mejora genuinamente significativa pero más pequeña. El modo absoluto suma puntos porcentuales directamente a la referencia (10% + 2pp = 12%); el modo relativo escala la referencia por un porcentaje (10% x 1.20 = 12%).

¿Qué controlan realmente el nivel de confianza y la potencia estadística?

El nivel de confianza controla tu tolerancia a un falso positivo, declarar un ganador cuando en realidad no hay diferencia (un nivel de confianza del 95% significa un 5% de probabilidad de que eso ocurra). La potencia estadística controla tu tolerancia a un falso negativo, no detectar una diferencia real que sí existe (una potencia del 80% significa un 80% de probabilidad de detectar correctamente el efecto si existe, un 20% de probabilidad de no detectarlo).

¿Por qué probar más de 2 variantes necesita una corrección?

Cada comparación adicional contra el control es otra oportunidad para que se cuele un falso positivo, así que probar más variantes con el mismo nivel de confianza por comparación eleva silenciosamente tu tasa de error real general. La corrección de Bonferroni ajusta el nivel de confianza de cada comparación individual para que el riesgo combinado de todas ellas siga coincidiendo con el nivel de confianza elegido originalmente, a costa de necesitar un tamaño de muestra mayor por variante.

¿Por qué el tamaño de muestra requerido es mucho mayor de lo que esperaba?

Detectar efectos pequeños de forma fiable es inherentemente costoso en términos de tamaño de muestra; el tamaño requerido crece aproximadamente con el cuadrado inverso del efecto que intentas detectar, así que reducir el MDE a la mitad aproximadamente cuadruplica el tamaño de muestra necesario. Esta es una restricción estadística real, no un fallo en el cálculo; es la misma compensación que enfrenta toda plataforma de pruebas A/B.

¿Cómo se calcula la estimación de duración de la prueba?

Divide el tamaño de muestra total necesario entre todas las variantes por tu cantidad de visitantes diarios (dividido según cómo se reparta realmente tu tráfico entre las variantes) y redondea al día completo más cercano. Es una estimación de planificación que asume un tráfico estable y constante; la duración real de la prueba puede ser mayor si el tráfico baja o si también quieres tener en cuenta los ciclos semanales del comportamiento de los usuarios.

¿Qué prueba estadística se asume que se usará para analizar los resultados?

Se asume una prueba z de dos proporciones estándar que compara tasas de conversión, el enfoque más común para pruebas A/B típicas que miden un resultado binario como "convirtió o no". Si en cambio estás midiendo una métrica continua, como ingresos o tiempo en página, se aplicaría una fórmula de tamaño de muestra diferente basada en la varianza de esa métrica.

Herramientas relacionadas