WMW

Calculateur de Taille d'Échantillon pour Test A/B

Free

Découvrez combien de visiteurs par variante votre test A/B nécessite, avec prise en charge de plusieurs variantes (corrigées par Bonferroni) et une estimation de la durée du test.

Fonctionne entièrement dans votre navigateur. Vos chiffres ne sont jamais envoyés où que ce soit.

Référence et effet

Paramètres du test

Plus de 2 variantes appliquent une correction de Bonferroni pour maintenir le taux d'erreur global au niveau de confiance choisi sur toutes les comparaisons par paires avec le contrôle.

Estimer la durée du test (facultatif)

Activité récente

Visible par tous. Les 20 dernières utilisations de tous les visiteurs, les plus récentes en premier.

Pas encore d'activité. Soyez le premier.

Commentaires (0)

Cet outil vous a-t-il été utile ? Laissez un commentaire, partagez une astuce, ou dites-nous comment nous pourrions l'améliorer.

Les commentaires des invités sont vérifiés avant publication. Se connecter pour publier instantanément.

Pas encore de commentaires. Soyez le premier à partager votre avis !

Ce que fait cet outil

Ce calculateur de taille d'échantillon de test A/B détermine le nombre de visiteurs par variante nécessaires avant de lancer un test, en fonction de votre taux de conversion de référence, du plus petit effet que vous souhaitez détecter de manière fiable, de votre niveau de confiance souhaité et de la puissance statistique. Il utilise la formule standard du test z à deux proportions qui sous-tend la plupart des plateformes de test A/B.

Au-delà d'un calcul de base à 2 variantes, il prend en charge le test de plus d'une variante contre un contrôle en appliquant automatiquement une correction de Bonferroni, de sorte que le risque global de faux positif sur toutes les comparaisons corresponde toujours à votre niveau de confiance choisi plutôt que d'augmenter silencieusement. Un champ optionnel de trafic quotidien estime également approximativement le nombre de jours nécessaires pour le test.

Problèmes résolus

Questions fréquentes

Qu'est-ce que l'effet minimal détectable (MDE) ?

C'est la plus petite différence réelle entre votre contrôle et votre variante que vous souhaitez réellement que le test puisse détecter. La régler trop bas (à la recherche d'améliorations minimes) exige une taille d'échantillon énorme, tandis que la régler trop haut signifie que le test pourrait manquer une amélioration réellement significative mais plus petite. Le mode absolu ajoute des points de pourcentage directement à la référence (10 % + 2pp = 12 %) ; le mode relatif met la référence à l'échelle par un pourcentage (10 % x 1,20 = 12 %).

Que contrôlent réellement le niveau de confiance et la puissance statistique ?

Le niveau de confiance contrôle votre tolérance à un faux positif, déclarer un gagnant alors qu'il n'y a réellement aucune différence (un niveau de confiance de 95 % signifie 5 % de chances que cela se produise). La puissance statistique contrôle votre tolérance à un faux négatif, manquer une réelle différence pourtant présente (une puissance de 80 % signifie 80 % de chances de détecter correctement l'effet s'il existe, 20 % de chances de le manquer).

Pourquoi tester plus de 2 variantes nécessite-t-il une correction ?

Chaque comparaison supplémentaire avec le contrôle est une chance de plus qu'un faux positif passe inaperçu, donc tester plus de variantes au même niveau de confiance par comparaison augmente silencieusement votre taux d'erreur global réel. La correction de Bonferroni resserre le niveau de confiance de chaque comparaison individuelle afin que le risque combiné sur l'ensemble corresponde toujours à votre niveau de confiance initialement choisi, au prix d'une taille d'échantillon plus grande par variante.

Pourquoi la taille d'échantillon requise est-elle bien plus grande que prévu ?

Détecter de petits effets de manière fiable est intrinsèquement coûteux en termes de taille d'échantillon, la taille requise croît à peu près avec l'inverse du carré de l'effet que vous essayez de détecter, donc diviser le MDE par deux quadruple approximativement la taille d'échantillon nécessaire. Il s'agit d'une réelle contrainte statistique, pas d'un défaut du calcul, c'est le même compromis auquel chaque plateforme de test A/B est confrontée.

Comment l'estimation de la durée du test est-elle calculée ?

Il divise la taille d'échantillon totale nécessaire sur toutes les variantes par votre nombre de visiteurs quotidiens (réparti selon la façon dont votre trafic est réellement divisé entre les variantes) et arrondit au jour entier supérieur. C'est une estimation de planification supposant un trafic stable et constant ; la durée réelle du test peut être plus longue si le trafic baisse ou si vous souhaitez aussi tenir compte des cycles hebdomadaires du comportement des utilisateurs.

Quel test statistique ce calculateur suppose-t-il pour analyser les résultats ?

Il suppose un test z à deux proportions standard comparant les taux de conversion, l'approche la plus courante pour les tests A/B typiques mesurant un résultat binaire comme « converti ou non ». Si vous mesurez plutôt une métrique continue, comme le revenu ou le temps passé sur la page, une formule de taille d'échantillon différente basée sur la variance de cette métrique s'appliquerait.

Outils similaires