A/B-Test-Signifikanz-Rechner

Tragen Sie Besucher und Conversions von Variante A und B ein: Der A/B-Test-Signifikanz-Rechner zeigt, ob der Unterschied statistisch signifikant ist, wie groß der Uplift ist, das Konfidenzintervall und wie viele Besucher je Variante für ein belastbares Ergebnis nötig wären.

Quelle: NIST/SEMATECH e-Handbook of Statistical Methods, 7.3.3: comparing two proportions (pooled z-test). Stand: .

Meine ToolboxDeine Eingaben werden nur in diesem Browser gespeichert.

Ergebnis

Ergebnis
Signifikant bei 95 %: B konvertiert besser als A (p = 0,0171).
Conversion-Rate A
2 %
Conversion-Rate B
2,5 %
Uplift B gegenüber A
25 %
p-Wert (zweiseitig)
p = 0,0171 · z = 2,38
Konfidenzintervall der Differenz
+0,09 bis +0,91 Prozentpunkte (95 %)
Nötige Besucher je Variante (80 % Power)
13.809
Statistische Auswertung ohne Gewähr. Test nicht vorzeitig beenden, sobald p unter 5 % fällt – die Stichprobe vorher festlegen.

So wird gerechnet

So wird die Signifikanz berechnet

Der Rechner nutzt den Zwei-Stichproben-z-Test für Anteile: Conversion-Raten pA = Conversions ÷ Besucher, gemeinsamer Anteil p = (cA + cB) ÷ (nA + nB) und z = (pB − pA) ÷ √(p(1 − p)(1/nA + 1/nB)). Der zweiseitige p-Wert ist die Wahrscheinlichkeit, einen mindestens so großen Unterschied rein zufällig zu sehen.

Beispiel

BesucherConversionsRate
A10.0002002,00 %
B10.0002502,50 %

Uplift 25 %, z = 2,38, p = 0,0171: bei 95 % Konfidenz signifikant. Die Differenz liegt mit 95 % Sicherheit zwischen +0,09 und +0,91 Prozentpunkten.

Wie viele Besucher braucht ein A/B-Test?

n je Variante = (z1−α/2·√(2p̄(1 − p̄)) + z1−β·√(pA(1 − pA) + pB(1 − pB)))² ÷ (pB − pA)². Um 2,0 % gegen 2,5 % mit 95 % Konfidenz und 80 % Power zu erkennen, braucht man rund 13.800 Besucher je Variante; für 2,0 % gegen 2,2 % schon rund 80.700.

Typische Fehler

Häufige Fragen

Wann ist ein A/B-Test signifikant?

Wenn der p-Wert unter dem gewählten Niveau liegt, üblich 5 % (95 % Konfidenz). Dann ist es unwahrscheinlich, dass der Unterschied nur Zufall ist.

Wie berechnet man die Signifikanz eines A/B-Tests?

Mit dem z-Test für zwei Anteile: z = Differenz der Conversion-Raten ÷ Standardfehler; aus z folgt der p-Wert. Der Rechner erledigt beides.

Wie lange muss ein A/B-Test laufen?

Bis die vorher berechnete Besucherzahl je Variante erreicht ist, mindestens aber eine volle Woche, damit Wochentagseffekte ausgeglichen werden.

Was bedeutet Uplift?

Die relative Verbesserung von B gegenüber A: (Rate B − Rate A) ÷ Rate A. 2,5 % statt 2,0 % sind 25 % Uplift.

Was ist Power beim A/B-Test?

Die Wahrscheinlichkeit, einen tatsächlich vorhandenen Effekt auch zu erkennen. Üblich sind 80 %; der Rechner nutzt diesen Wert für die nötige Besucherzahl.

Quellen und Rechtsgrundlagen

Stand:

Passende Werkzeuge