WMW

Calculadora de Tamanho de Amostra para Teste A/B

Free

Descubra quantos visitantes por variante seu teste A/B precisa, com suporte para múltiplas variantes (corrigidas por Bonferroni) e uma estimativa de duração do teste.

Funciona inteiramente no seu navegador. Seus números nunca são enviados a lugar nenhum.

Linha de base e efeito

Parâmetros do teste

Mais de 2 variantes aplicam uma correção de Bonferroni para manter a taxa de erro geral no nível de confiança escolhido em todas as comparações par a par com o controle.

Estimar duração do teste (opcional)

Atividade recente

Visível para todos. Últimos 20 usos de todos os visitantes, mais recentes primeiro.

Ainda sem atividade. Seja o primeiro.

Comentários (0)

Achou esta ferramenta útil? Deixe um comentário, compartilhe uma dica ou nos diga como podemos melhorá-la.

Comentários de convidados são revisados antes da publicação. Entrar para publicar instantaneamente.

Ainda sem comentários. Seja o primeiro a compartilhar sua opinião!

O que esta ferramenta faz

Esta calculadora de tamanho de amostra para teste A/B determina quantos visitantes por variante você precisa antes de rodar um teste, com base na sua taxa de conversão de referência, no menor efeito que deseja detectar de forma confiável, no nível de confiança desejado e no poder estatístico. Ela usa a fórmula padrão de teste z de duas proporções que fundamenta a maioria das plataformas de teste A/B.

Além de um cálculo básico de 2 variantes, ele suporta testar mais de uma variante contra um controle aplicando automaticamente uma correção de Bonferroni, para que o risco geral de falso positivo em todas as comparações ainda corresponda ao nível de confiança escolhido em vez de subir silenciosamente. Um campo opcional de tráfego diário também estima aproximadamente quantos dias o teste precisaria rodar.

Problemas que resolve

Perguntas frequentes

O que é o efeito mínimo detectável (MDE)?

É a menor diferença real entre seu controle e variante que você realmente quer que o teste consiga detectar. Defini-la muito pequena (buscando melhorias minúsculas) exige um tamanho de amostra enorme, enquanto defini-la muito grande significa que o teste pode deixar passar uma melhoria genuinamente significativa, porém menor. O modo absoluto soma pontos percentuais diretamente à referência (10% + 2pp = 12%); o modo relativo escala a referência por uma porcentagem (10% x 1,20 = 12%).

O que o nível de confiança e o poder estatístico realmente controlam?

O nível de confiança controla sua tolerância a um falso positivo, declarar um vencedor quando na verdade não há diferença (um nível de confiança de 95% significa 5% de chance disso acontecer). O poder estatístico controla sua tolerância a um falso negativo, deixar passar uma diferença real que realmente existe (poder de 80% significa 80% de chance de detectar corretamente o efeito se ele existir, 20% de chance de deixá-lo passar).

Por que testar mais de 2 variantes precisa de uma correção?

Cada comparação extra contra o controle é mais uma chance de um falso positivo passar despercebido, então testar mais variantes no mesmo nível de confiança por comparação eleva silenciosamente sua taxa de erro real geral. A correção de Bonferroni aperta o nível de confiança de cada comparação individual para que o risco combinado entre todas ainda corresponda ao nível de confiança originalmente escolhido, ao custo de precisar de um tamanho de amostra maior por variante.

Por que o tamanho de amostra necessário é muito maior do que eu esperava?

Detectar pequenos efeitos de forma confiável é inerentemente caro em termos de tamanho de amostra; o tamanho necessário cresce aproximadamente com o inverso do quadrado do efeito que você está tentando detectar, então cortar o MDE pela metade aproximadamente quadruplica o tamanho de amostra necessário. Essa é uma restrição estatística real, não uma falha no cálculo; é a mesma compensação que toda plataforma de teste A/B enfrenta.

Como a estimativa de duração do teste é calculada?

Ele divide o tamanho total de amostra necessário entre todas as variantes pela sua contagem de visitantes diários (dividida conforme seu tráfego realmente se divide entre as variantes) e arredonda para o dia inteiro mais próximo. É uma estimativa de planejamento que assume tráfego estável e consistente; a duração real do teste pode ser maior se o tráfego cair ou se você também quiser considerar ciclos semanais no comportamento do usuário.

Que teste estatístico isso assume que será usado para analisar os resultados?

Ele assume um teste z de duas proporções padrão comparando taxas de conversão, a abordagem mais comum para testes A/B típicos que medem um resultado binário como "converteu ou não". Se você estiver medindo uma métrica contínua, como receita ou tempo na página, uma fórmula diferente de tamanho de amostra baseada na variância dessa métrica se aplicaria.

Ferramentas relacionadas