WMW

Calculadora de Significância de Teste A/B

Free

Verifique se um resultado de teste A/B é estatisticamente significativo, com valor p, escore z, e um intervalo de confiança do aumento.

Funciona inteiramente no seu navegador. Seus números nunca são enviados a lugar nenhum.

Controle (A)

Variante (B)

Usa um teste z de duas proporções padrão para comparar as duas taxas de conversão.

Atividade recente

Visível para todos. Últimos 20 usos de todos os visitantes, mais recentes primeiro.

Ainda sem atividade. Seja o primeiro.

Comentários (0)

Achou esta ferramenta útil? Deixe um comentário, compartilhe uma dica ou nos diga como podemos melhorá-la.

Comentários de convidados são revisados antes da publicação. Entrar para publicar instantaneamente.

Ainda sem comentários. Seja o primeiro a compartilhar sua opinião!

O que esta ferramenta faz

Esta calculadora de significância de teste A/B informa se a diferença entre as taxas de conversão de um controle e uma variante é estatisticamente significativa, ou poderia plausivelmente ser ruído aleatório. Digite as contagens de visitantes e conversões para cada grupo, e ela executa um teste z de duas proporções padrão para produzir um valor p, escore z, e um veredito claro de significativo/não significativo.

Além do veredito, mostra tanto a diferença absoluta em pontos percentuais quanto o aumento relativo, mais um intervalo de confiança para a diferença subjacente real, para que você tenha uma noção da faixa de resultados plausíveis, não apenas uma única resposta de aprovado/reprovado.

Problemas que resolve

Perguntas frequentes

O que "estatisticamente significativo" realmente significa aqui?

Significa que a diferença observada entre as taxas de conversão do seu controle e variante é improvável de ter acontecido apenas por acaso, no nível de confiança escolhido. Não significa que o efeito seja grande ou praticamente importante; uma diferença real e minúscula pode ser estatisticamente significativa com visitantes suficientes, enquanto uma diferença que parece grande em uma amostra pequena pode não ser.

Por que meu teste mostrou uma grande diferença nas taxas mas voltou como "não significativo"?

Essa é a clássica armadilha de amostra pequena: com poucos visitantes, o ruído aleatório sozinho pode facilmente produzir oscilações que parecem grandes na taxa de conversão e que desaparecem com mais dados. O valor p leva em conta o tamanho da amostra, não apenas o tamanho da diferença; uma diferença de 10% contra 30% em 10 visitantes cada carrega muito menos evidência do que as mesmas porcentagens em 10.000 visitantes cada.

O que é um valor p?

É a probabilidade de observar uma diferença pelo menos tão grande entre os dois grupos se na verdade não houvesse diferença real entre eles (a "hipótese nula"). Um valor p pequeno (abaixo do seu limite de significância, como 0,05 para 95% de confiança) significa que os dados observados seriam improváveis sob essa suposição de nenhuma diferença, o que é evidência, não prova, de que existe uma diferença real.

O que o intervalo de confiança do aumento me diz?

É uma faixa de valores plausíveis para a diferença real na taxa de conversão entre variante e controle, não apenas uma única estimativa pontual. Se o intervalo não cruzar o zero, isso se alinha com um resultado significativo; se cruzar o zero (significando que "nenhuma diferença" é um resultado plausível), isso se alinha com um não significativo, e a largura do intervalo reflete quão precisa é a estimativa.

Devo parar meu teste assim que ele se tornar significativo?

Geralmente não; isso é chamado de "espionagem" (peeking) e infla sua taxa real de falso positivo além do nível de confiança escolhido, porque verificar repetidamente dá ao ruído aleatório mais chances de cruzar o limiar de significância. Decida um tamanho de amostra ou duração com antecedência (uma calculadora de tamanho de amostra ajuda nisso) e verifique os resultados apenas quando isso for alcançado, em vez de parar no momento em que você vê significância.

Que teste isso usa, e ele corresponde ao que minha ferramenta de teste A/B reporta?

Ele usa um teste z de duas proporções padrão, a mesma abordagem subjacente que a maioria das plataformas de teste A/B usa para métricas de conversão binárias. Os números exatos podem diferir ligeiramente entre ferramentas dependendo de correções de continuidade, suposições unicaudais vs bicaudais, ou métodos bayesianos que algumas plataformas usam em vez disso, então trate isso como uma verificação cruzada sólida de propósito geral em vez de esperar um valor p idêntico em cada plataforma.

Ferramentas relacionadas