WMW

A/B-Test-Stichprobengrößenrechner

Free

Finde heraus, wie viele Besucher pro Variante dein A/B-Test benötigt, mit Unterstützung für mehrere Varianten (Bonferroni-korrigiert) und einer Schätzung der Testdauer.

Läuft vollständig in Ihrem Browser. Ihre Zahlen werden niemals hochgeladen.

Basiswert & Effekt

Testparameter

Bei mehr als 2 Varianten wird eine Bonferroni-Korrektur angewendet, um die Gesamtfehlerrate über alle paarweisen Vergleiche mit der Kontrolle auf dem gewählten Konfidenzniveau zu halten.

Testdauer schätzen (optional)

Letzte Aktivität

Für alle sichtbar. Die letzten 20 Nutzungen aller Besucher, neueste zuerst.

Noch keine Aktivität. Seien Sie der Erste.

Kommentare (0)

Fanden Sie dieses Tool nützlich? Hinterlassen Sie einen Kommentar, teilen Sie einen Tipp oder sagen Sie uns, wie wir es verbessern können.

Gastkommentare werden vor der Veröffentlichung geprüft. Anmelden um sofort zu veröffentlichen.

Noch keine Kommentare. Seien Sie der Erste, der seine Meinung teilt!

Was dieses Tool macht

Dieser A/B-Test-Stichprobengrößenrechner ermittelt, wie viele Besucher pro Variante du vor der Durchführung eines Tests benötigst, basierend auf deiner Basis-Konversionsrate, dem kleinsten Effekt, den du zuverlässig erkennen möchtest, deinem gewünschten Konfidenzniveau und der statistischen Power. Er verwendet die standardmäßige Zwei-Stichproben-z-Test-Formel, die den meisten A/B-Testing-Plattformen zugrunde liegt.

Über eine einfache 2-Varianten-Berechnung hinaus unterstützt er das Testen von mehr als einer Variante gegen eine Kontrolle, indem automatisch eine Bonferroni-Korrektur angewendet wird, sodass das Gesamtrisiko für Fehlalarme über alle Vergleiche hinweg weiterhin deinem gewählten Konfidenzniveau entspricht, anstatt still anzusteigen. Ein optionales Feld für den täglichen Traffic schätzt zudem ungefähr, wie viele Tage der Test laufen müsste.

Probleme, die es löst

Häufig gestellte Fragen

Was ist der minimal nachweisbare Effekt (MDE)?

Es ist der kleinste reale Unterschied zwischen deiner Kontrolle und Variante, den der Test tatsächlich erkennen können soll. Wird er zu klein angesetzt (Jagd nach winzigen Verbesserungen), erfordert das eine riesige Stichprobengröße, während er zu groß angesetzt bedeutet, dass der Test eine wirklich bedeutsame, aber kleinere Verbesserung übersehen könnte. Der absolute Modus addiert Prozentpunkte direkt zur Basis (10 % + 2pp = 12 %); der relative Modus skaliert die Basis um einen Prozentsatz (10 % x 1,20 = 12 %).

Was steuern Konfidenzniveau und statistische Power eigentlich?

Das Konfidenzniveau steuert deine Toleranz für einen Fehlalarm (falsch positiv) – einen Gewinner zu erklären, obwohl es wirklich keinen Unterschied gibt (ein Konfidenzniveau von 95 % bedeutet eine Wahrscheinlichkeit von 5 % dafür). Die statistische Power steuert deine Toleranz für einen falsch negativen Fehler – einen tatsächlich vorhandenen realen Unterschied zu übersehen (80 % Power bedeutet eine 80%ige Wahrscheinlichkeit, den Effekt korrekt zu erkennen, falls er existiert, und eine 20%ige Wahrscheinlichkeit, ihn zu übersehen).

Warum benötigt das Testen von mehr als 2 Varianten eine Korrektur?

Jeder zusätzliche Vergleich mit der Kontrolle ist eine weitere Chance für einen unbemerkten Fehlalarm, sodass das Testen weiterer Varianten beim gleichen Konfidenzniveau pro Vergleich deine wahre Gesamtfehlerrate still erhöht. Die Bonferroni-Korrektur verschärft das Konfidenzniveau für jeden einzelnen Vergleich, sodass das kombinierte Risiko über alle hinweg weiterhin deinem ursprünglich gewählten Konfidenzniveau entspricht, auf Kosten einer größeren benötigten Stichprobengröße pro Variante.

Warum ist die erforderliche Stichprobengröße viel größer als erwartet?

Kleine Effekte zuverlässig zu erkennen ist von Natur aus teuer in Bezug auf die Stichprobengröße – die erforderliche Größe wächst ungefähr mit dem inversen Quadrat des Effekts, den du zu erkennen versuchst, sodass eine Halbierung des MDE die benötigte Stichprobengröße etwa vervierfacht. Dies ist eine reale statistische Einschränkung, kein Fehler in der Berechnung, es ist der gleiche Kompromiss, dem jede A/B-Testing-Plattform gegenübersteht.

Wie wird die Schätzung der Testdauer berechnet?

Es teilt die insgesamt benötigte Stichprobengröße über alle Varianten durch deine tägliche Besucherzahl (aufgeteilt so, wie dein Traffic tatsächlich auf die Varianten verteilt ist) und rundet auf den nächsten vollen Tag auf. Es handelt sich um eine Planungsschätzung, die einen stetigen, gleichmäßigen Traffic annimmt; die tatsächliche Testdauer kann länger ausfallen, wenn der Traffic einbricht oder wenn du auch wöchentliche Zyklen im Nutzerverhalten berücksichtigen möchtest.

Welchen statistischen Test setzt dies für die Analyse der Ergebnisse voraus?

Es wird ein standardmäßiger Zwei-Stichproben-z-Test zum Vergleich von Konversionsraten angenommen, der gängigste Ansatz für typische A/B-Tests, die ein binäres Ergebnis wie „konvertiert oder nicht“ messen. Wenn du stattdessen eine kontinuierliche Kennzahl misst, wie Umsatz oder Verweildauer, würde eine andere Stichprobengrößenformel basierend auf der Varianz dieser Kennzahl gelten.

Verwandte Tools