Metriken und Analytik
Experimente: A/A, A/B, Leistung
A/A- und A/B-Tests für das Produkt: Hypothese, Leistung, Stichprobengröße, Dauer, Metriken und typische Analysefehler.
A/B-Tests beantworten eine enge kausale Frage mit korrekter Randomisierung, anstatt den Wert der Idee überhaupt zu bestätigen. Vor dem Start notieren Sie den minimalen signifikanten Effekt, die grundlegende Metrik, Leitplanken, die Randomisierungseinheit und die Stoppregel; Danach überprüfen Sie die Qualität der Daten und die praktische, nicht nur statistische, Signifikanz.
Experimente: A/A, A/B, Leistung
Block: Metriken und Analysen
Experimente sind ein Werkzeug, um Entscheidungen über Daten zu treffen, nicht nur mit Ressourcen zu erraten, sondern auch eine Hypothese an realen Benutzern zu testen, und immer drei Dinge im Auge zu behalten: Sind Gruppen vor dem Start unterschiedlich (A / A), ist Ihr Experiment wirklich zuverlässig (A / B), und können Sie den gewünschten Effekt (die Kraft des Tests) fangen.
Schlüsselbegriffe
- A/A-Prüfung
- A/B-Prüfung
- Prüfleistung
- Mindest-Distinct-Effekt (MDE)
- Signifikanz (p-Wert)
- Vertraulichkeit (Vertrauensgrad)
- Probenumfang
- Konversionsmetriken
- Kontrollgruppe
- Die Versuchsgruppe
Grundlegende Definitionen
Was sind A/A und A/B Tests?
A/B-Test ist eine Möglichkeit, zwei Versionen eines Produkts, Features oder Prozesses zu vergleichen: “A” (Kontrolle) und “B” (neue Variante). Zwei Gruppen von Benutzern erhalten zufällig unterschiedliche Versionen. Im Laufe der Zeit betrachten Sie den Unterschied in Ihrer Zielmetrik, wie z.B. Konvertierung, und entscheiden, ob es sich um eine neue Funktionalität oder eine Zufälligkeit handelt. Der A/A-Test ist ein Sonderfall, bei dem beide Gruppen genau das gleiche Produkt erhalten, und er bestätigt nicht die Hypothese, er testet das System der Experimente: ist alles zufällig, werden die Metriken richtig gezählt.
Beispiel:
Nehmen wir an, Sie möchten ein neues Button-Design testen. In A/B rollen Sie die alten und neuen Buttons für 50 Prozent der Besucher aus, Sie vergleichen Conversions. Davor führen Sie einen A/A-Test durch, und 100 Prozent der Benutzer sehen das alte Design, sie fallen in verschiedene Gruppen, und wenn das System meldet, dass die Konvertierung stark auseinandergegangen ist, ist etwas schief gelaufen: Das Benutzer-Sharing-Schema funktioniert mit einem Fehler.
Warum ist es wichtig, die Macht zu überprüfen
Power ist die Wahrscheinlichkeit, dass der Test den wirklichen Effekt fängt, wenn er ist, wenn die Leistung niedrig ist, riskiert selbst ein gutes Experiment, nichts zu entdecken. Die Leistung hängt von der Stichprobengröße, dem minimalen erkennbaren Effekt (MDE), der Datenstreuung und dem Signifikanzniveau ab.
Beispiel:
Wenn Sie wissen möchten, ob eine neue Onboarding-Seite die Conversion von 10 auf 10,5 Prozent erhöht, wenn Sie nur wenige Teilnehmer haben, geht dieser Unterschied im Rauschen verloren, und Sie können die gewünschte Stichprobengröße im Voraus mit einem Stromrechner berechnen.
Wie man läuft: Schritt-für-Schritt-Logik
A/A-Test: Systemtest
Führen Sie einen Test mit zwei identischen Gruppen durch, um sicherzustellen:
- Randomisierungsarbeiten
- Keine System Bugs
- Es gibt keine unerwartete Streuung in den Daten Wenn das Ergebnis einen signifikanten Unterschied zeigt, suchen Sie nach Verteilungsfehlern, Fehlern und nicht berücksichtigten Variablen.
A/B-Test: Erstellen eines zuverlässigen Experiments
Erstellen Sie eine Hypothese und wählen Sie die Metrik, die Sie erwarten, zu ändern. Bestimmen Sie den minimal unterscheidbaren Effekt (welcher Unterschied ist für Sie wichtig). Die Stichprobengröße und -leistung wurden mit Statsig oder Google Sample Size Calculator berechnet. Führen Sie eine einheitliche Zufallsverteilung der Teilnehmer durch. Überwachen Sie den Fortschritt des Tests, schauen Sie nicht zu früh auf Zwischenzahlen (Vermeidung des Fehlers des Übertrainings). Analysieren Sie erst nach Abschluss des Experiments, sonst riskieren Sie Fehler in den Schlussfolgerungen.
Beispiel:
Fintech-Produkte testen häufig Landing Pages, ändern das Angebot, farblichen CTA, treiben den Traffic auf zwei Versionen, bevor der A/B-Test gestartet wird, müssen Sie ein A/A durchführen, um sicherzustellen, dass sich die A1- und A2-Gruppen in den wichtigsten Metriken (Alter, Land, Kartenhaltung) nicht unterscheiden, noch bevor sich der Inhalt ändert.
Typische Fehler und Anti-Muster
Fehlinterpretation der Ergebnisse
Machen Sie keinen Fehler: p-Wert und Augen-zu-Augen-Unterschiede sind nicht dasselbe. Kleine Unterschiede sind zufällig, wenn Macht nicht genug ist.
Unzureichender Probenumfang
Ich beeilte mich, den Test zu beenden, was ein hohes Risiko für einen falschen Effekt darstellt, und der p-Wert bedeutet nichts, wenn der Test kurz und die Gruppen klein sind.
Beispiel:
In einer Small Business-Kampagne testen 300 Benutzer einen neuen Wagen und bis zum Ende der Woche p-Wert 0,04, aber der Gewinn ist zufällig: keine Macht, die Schlussfolgerung ist falsch.
Intervention im Experiment
Die Logik der Verteilung der Teilnehmer hat sich geändert, die Werbekampagne hat begonnen, der große Kunde ist weg, der Vergleich wird abgewertet und Experimente sollten so weit wie möglich vor solchen Einflüssen geschützt werden.
Arbeiten mit Metriken und Schlussfolgerungen
Wie man Metriken auswählt
Der Test ist so konzipiert, dass er gut definierte Metriken hat, und die Metrik muss sensibel, geschäftsrelevant und nicht manipulierbar sein.
Beispiel:
Für den Online-Handel ist das wichtige Kriterium der Umsatz pro Nutzer, nicht nur die Konvertierung in eine Bestellung, und oft werden zwei gleichzeitig überprüft: primär (Konvertierung), sekundär (durchschnittliche Überprüfung).
Richtige Schlussfolgerungen
Konzentrieren Sie sich nicht auf einmalige Bursts. ziehen Sie immer Schlussfolgerungen aus dem endgültigen Datenabschnitt (wie eine Woche später), um saisonale Schwankungen und externes Rauschen zu entfernen.
Wo man Benchmarks und Rechner bekommt
Empfehlungen und nützliche Ressourcen
Es gibt keine universellen Zeichen für Leistungszahlen und Minimaleffektberechnungen. Bewerten Sie Ihre Nische. Sehen Sie sich die Branchenberichte von Statista oder Data.ai für Conversion-Benchmarks an.
FAQ
Wie man A/A-Test von A/B-Test unterscheidet, wenn man ihn ausführt
A/A-Test: Beide Gruppen sehen das Gleiche. Führen Sie, wenn Sie ein neues Experiment-Framework implementieren, das metrische System ändern oder den ersten Test auf einer neuen Plattform durchführen. A/B wird immer benötigt, wenn Sie die Hypothese der Veränderung testen.
Warum, wenn A / A einen Unterschied macht, ist das System kaputt
Wenn das A / A-Ergebnis einen signifikanten Unterschied zeigt - Ihr Verteilungssystem ist nicht zufällig, betrachten Sie den Test als unzuverlässig.
Wie man die Leistung des Tests berechnet
Verwenden Sie Online-Rechner wie Statsig, geben Sie Ihre erwartete Conversion, den minimalen sinnvollen Effekt, den Signifikanzgrad und die gewünschte Stichprobengröße ein.
Was als gute Macht gilt
Das häufigste Ziel ist 80 Prozent oder höher, was bedeutet, dass, wenn es einen Effekt der richtigen Größenordnung gibt, 4 von 5 dieser Tests es erkennen werden.
Was ist die “ehrlichste” Metrik?
Suchen Sie nach Metriken, die direkt mit dem Nutzerverhalten oder dem Umsatz zusammenhängen: E-Commerce ist die Konvertierung in Kauf und durchschnittliche Überprüfung; SaaS ist die Aktivierung oder Aufbewahrung von Funktionen.
Kann ich den Test vorzeitig abbrechen, wenn er klar ist?
Das Ende des Experiments verzerrt vorzeitig den p-Wert und erhöht das Risiko falsch positiver Ergebnisse.