Google empfiehlt für Werbeexperimente eine klare Hypothese, eine Variable und ein oder zwei vorab gewählte Erfolgsmetriken. Diese Grundsätze gelten auch für einen Landingpage-Vergleich, selbst wenn ein anderes Experimentierwerkzeug eingesetzt wird.
Die Statistik ist dabei kein grünes Siegel. Sie beschreibt Unsicherheit unter bestimmten Annahmen. Randomisierung, saubere Zuteilung, vollständige Messung und eine unveränderte Testumgebung sind Voraussetzungen dafür, dass das berechnete Intervall überhaupt sinnvoll interpretiert werden kann.
Für kleine Coaching-Angebote ist die ehrliche Grenze besonders wichtig: Wenige Buchungen erlauben meist nur große Effekte zuverlässig zu erkennen. Ein feiner Unterschied kann geschäftlich interessant sein und statistisch trotzdem unentscheidbar bleiben.
Hypothese
1. Formuliere eine prüfbare Ursache – keine Wunschrichtung
„Variante B wird besser konvertieren“ ist keine brauchbare Hypothese. Es fehlt der Grund. Eine prüfbare Form lautet: „Wenn die Gesprächserwartung direkt vor dem CTA konkret benannt wird, verändert sich der Anteil bestätigter Buchungen, weil weniger Unsicherheit über Ablauf und Passung bleibt.“
Die Formulierung benennt Zielgruppe, Mechanismus, Änderung und Primärmetrik. Sie verspricht kein Ergebnis. Vor dem Start ergänzt du, welcher Unterschied geschäftlich relevant wäre und welche Entscheidung bei keinem erkennbaren Unterschied folgt.
Nutze vorhandene Hinweise für die Hypothese: wiederkehrende Fragen, Formularabbrüche, Gesprächsnotizen oder Klickpfade. Ein A/B-Test soll eine begründete Unsicherheit prüfen, nicht Ideen zufällig durchs System schicken.
Halte die ursprüngliche Formulierung unverändert im Protokoll. Neue Erklärungen nach dem Ergebnis können als Folgefragen notiert werden, dürfen aber nicht so dargestellt werden, als seien sie vorher geplant gewesen.
Isolation
2. Verändere genau einen entscheidenden Baustein
Wenn die Hypothese die Erwartung vor dem CTA betrifft, ändert Variante B nur diesen Erwartungsblock. Headline, Trafficquelle, Preis, Formular, Testimonials und technischer Aufbau bleiben gleich. Dadurch wird die Ursache interpretierbarer.
Die offene Frage bestimmt den Baustein. Sinnvolle Kandidaten können Headline, Problem-Einstieg, Angebotsdarstellung, Platzierung eines passenden Testimonials, CTA-Erwartung, Formularlänge oder Terminbuchung sein. Du wählst daraus genau den Punkt, für den es einen nachvollziehbaren Hinweis gibt.
Manchmal besteht eine fachlich zusammengehörige Änderung aus mehreren Textzeilen. Das ist weiterhin ein Baustein, wenn alle Zeilen denselben Mechanismus umsetzen. Dokumentiere den gesamten Unterschied mit Screenshot oder Version, damit später nicht unbemerkt weitere Anpassungen hinzukommen.
Ein größerer Seitenentwurf gegen den bisherigen Stand ist ein Paket-Test. Er kann beantworten, welches Gesamtpaket unter den Testbedingungen besser abschneidet, aber nicht, ob Headline, Bild oder Formular dafür verantwortlich war. Kennzeichne diesen Unterschied offen.
Während des Tests werden keine parallelen Änderungen an Kampagne, Zielgruppe oder Buchungsweg vorgenommen, soweit das kontrollierbar ist. Unvermeidbare Eingriffe kommen mit Datum ins Protokoll und können einen Neustart erforderlich machen.
Halte auch den Einstieg zur Landingpage stabil. Eine Google-Suche, ein YouTube-Video, eine Anzeige und eine E-Mail wecken unterschiedliche Erwartungen. Wenn diese Quellen ungeplant zwischen A und B verteilt oder während des Tests stark verändert werden, lässt sich die Seitenaussage schwerer einordnen.
Primärmetrik
3. Wähle eine Kennzahl, die die Entscheidung tatsächlich trägt
Die Primärmetrik muss zur Hypothese passen. Ein Test der Gesprächserwartung sollte nicht allein über Buttonklicks entscheiden, wenn die geschäftliche Handlung eine bestätigte Buchung ist. Klicks können als Diagnosewert sichtbar bleiben.
Definiere Zähler und Nenner exakt. „Buchungsrate“ kann bestätigte Buchungen pro Sitzung, pro Person oder pro CTA-Klick bedeuten. Diese Varianten beantworten unterschiedliche Fragen. Für Randomisierung auf Personenebene sollte die Auswertung dieselbe Einheit respektieren.
Lege zusätzlich höchstens wenige Schutzmetriken fest: No-Show-Anteil, Anteil qualifizierter Gespräche oder technische Fehlerrate. Sie verhindern, dass eine Variante wegen mehr Buchungen übernommen wird, obwohl sie an anderer Stelle klar schadet.
Wähle die Primärmetrik vor den Daten. Wenn sie sich als fehlerhaft erweist, wird der Test abgebrochen oder als ungültig markiert. Eine günstigere Ersatzmetrik nachträglich zum Gewinner zu erklären, ist keine saubere Auswertung.
Metrik-Steckbrief:
- Name und geschäftliche Bedeutung
- Zähler und Nenner
- Randomisierungs- und Auswertungseinheit
- technischer Auslöser
- bekannte Messlücken
- Schutzmetriken und Grenzwerte
Kleinster Effekt
4. Definiere die kleinste relevante Veränderung
Ein Test kann mit genug Daten winzige Unterschiede erkennen. Das heißt nicht, dass jeder winzige Unterschied eine Umsetzung rechtfertigt. Lege deshalb eine kleinste relevante Veränderung fest: den Effekt, bei dem Nutzen, Aufwand und Risiko eine Entscheidung tatsächlich ändern.
Dieser Wert wird nicht aus dem späteren Ergebnis abgeleitet. Er entsteht aus Geschäftskontext: aktuelles Volumen, Wert einer qualifizierten Anfrage, Umsetzungsaufwand und mögliche Nachteile. Ohne belastbare Basis bleibt die Annahme ausdrücklich vorläufig.
Je kleiner der gewünschte erkennbare Effekt, desto größer wird typischerweise die notwendige Stichprobe. Eine niedrige Ausgangsrate verschärft das Problem. Deshalb können Seiten mit wenigen monatlichen Buchungen meist nur große Veränderungen in vertretbarer Zeit untersuchen.
Setze den kleinsten Effekt nicht künstlich hoch, nur damit ein Rechner eine kleine Stichprobe ausgibt. Dann planst du einen Test, der praktisch relevante kleinere Veränderungen gar nicht erkennen kann.
Stichprobe
5. Plane die Stichprobe aus Annahmen, nicht aus einer Pauschalzahl
Es gibt keine universelle Mindestzahl, die für jede Landingpage reicht. Für einen Vergleich von Anteilen hängen Stichprobe und Präzision von Ausgangsrate, kleinstem relevanten Effekt, gewünschtem Signifikanzniveau, Teststärke, ein- oder zweiseitiger Fragestellung und Zuteilungsverhältnis ab.
NIST zeigt für Anteilstests, wie Signifikanzniveau, Teststärke, Ausgangsanteil und zu erkennende Differenz in die Stichprobengröße eingehen. Die Formeln setzen Annahmen voraus und ersetzen keine fachkundige Planung bei wichtigen Geschäftsentscheidungen.
Verwende eine konservative Ausgangsrate aus einem passenden historischen Zeitraum. Wenn Tracking, Traffic oder Angebot inzwischen verändert wurden, ist diese Basis unsicher. Plane einen Puffer für Datenverlust und technische Ausschlüsse, ohne nachträglich unerwünschte Fälle selektiv zu entfernen.
Dokumentiere geplante Stichprobe pro Variante und erwartete Dauer. Wenn die Dauer mehrere Monate beträgt, können Saisonalität und Umfeld die Stabilität erschweren. Dann ist ein formaler A/B-Test möglicherweise nicht das passende Werkzeug.
Zuteilung
6. Prüfe Randomisierung und tatsächliches Split-Verhältnis
A und B müssen vergleichbare Gruppen erhalten. Lege fest, ob Personen, Sitzungen oder ein anderes Merkmal randomisiert werden. Für Landingpages ist eine stabile Personenzuteilung oft leichter zu interpretieren, weil dieselbe Person nicht bei jedem Aufruf eine andere Variante sehen soll.
Kontrolliere das beobachtete Verhältnis gegen den geplanten Split. Ein deutlicher Sample Ratio Mismatch, also eine unerwartete Abweichung, kann auf Zuteilungs-, Lade-, Tracking- oder Ausschlussfehler hinweisen. Microsoft Research beschreibt SRM als Warnsignal, das vor der Ergebnisinterpretation untersucht werden muss.
Vergleiche auch wichtige Trafficmerkmale: Gerät, Quelle, Land und Kampagne, soweit geplant und datenschutzkonform erfasst. Randomisierung erzeugt nicht in jeder kleinen Stichprobe perfekte Gleichheit, aber systematische Unterschiede können einen Implementierungsfehler zeigen.
Wenn Variante B langsamer lädt oder ihr Tracking ausfällt, kann die Messung selbst den Vergleich verzerren. Deshalb gehören technische Fehler- und Performancewerte zu den Schutzmetriken.
Stopregel
7. Lege fest, wann der Test endet – bevor der Graph attraktiv aussieht
Eine einfache Stopregel kombiniert geplante Mindeststichprobe und Mindestdauer. Die Dauer sollte relevante Geschäftszyklen abdecken, etwa verschiedene Wochentage. Zusätzlich definierst du technische Abbruchgründe wie Zuteilungsfehler, kaputtes Formular oder unvollständige Conversion-Messung.
Wiederholtes Nachsehen mit klassischer Signifikanzanalyse und Stoppen beim ersten günstigen Zwischenstand kann die Fehlerwahrscheinlichkeit erhöhen. Microsoft Research behandelt dieses Problem als optional stopping und zeigt, dass die statistische Methode zur Monitoring- und Stopstrategie passen muss.
Wenn laufendes Monitoring geschäftlich nötig ist, braucht ihr ein dafür geeignetes sequenzielles oder bayesianisches Verfahren mit vorab festgelegter Regel. Ein gewöhnlicher Rechner plus tägliches Gewinner-Peeking ist kein Ersatz.
Stoppe nicht automatisch, wenn die Mindeststichprobe erreicht ist, aber ein technischer Fehler vorliegt. Der Test kann ungültig sein. Und verlängere nicht still so lange, bis das gewünschte Ergebnis erscheint; jede Abweichung von der Planung wird dokumentiert.
Stopregel enthält:
- Mindeststichprobe je Variante
- Mindestdauer und vollständige Geschäftszyklen
- geplante Zwischenanalysen
- zulässige statistische Methode
- technische Abbruchgründe
- Umgang mit verspäteten Conversions
Unsicherheit
8. Lies Effekt und Konfidenzintervall gemeinsam
Ein beobachteter Unterschied ist eine Schätzung. Ein Konfidenzintervall zeigt einen Bereich von mit den Daten vereinbaren Effektwerten unter den Annahmen des Verfahrens. Breite Intervalle bedeuten geringe Präzision.
Wenn ein Intervall sowohl einen geschäftlich relevanten Vorteil als auch einen Nachteil umfasst, ist die Entscheidung unsicher. „Nicht statistisch signifikant“ beweist nicht, dass beide Varianten gleich sind. Der Test kann schlicht zu wenig Information für den relevanten Effekt enthalten.
Auch ein enges Intervall um einen winzigen Effekt kann gegen eine Umsetzung sprechen, wenn Aufwand oder Schutzmetriken schlechter sind. Statistik entscheidet nicht allein; sie beschreibt den erwartbaren Bereich, auf dessen Grundlage eine Geschäftsregel angewendet wird.
NIST weist darauf hin, dass Näherungen bei kleinen Stichproben oder wenigen Ereignissen ungenau sein können. Nutze geeignete exakte oder robuste Methoden und hole bei wichtigen Entscheidungen fachkundige Unterstützung.
Entscheidung
9. Definiere vier mögliche Ausgänge statt nur Gewinner und Verlierer
Ein Test kann vier sinnvolle Ausgänge haben. Erstens: B zeigt einen relevanten Vorteil und Schutzmetriken bleiben innerhalb der Grenzen – B wird übernommen. Zweitens: B zeigt einen relevanten Nachteil – B wird verworfen. Drittens: der Effekt ist klein genug eingegrenzt, dass beide praktisch ähnlich sind – A bleibt wegen geringerer Änderungskosten. Viertens: das Intervall bleibt zu breit – keine belastbare Entscheidung.
Schreibe diese Logik vor dem Start mit konkreten Schwellen. Berücksichtige auch technische Qualität und Leadqualität. Mehr Buchungen rechtfertigen keine Übernahme, wenn No-Shows oder unpassende Gespräche den vorher festgelegten Grenzwert überschreiten.
Bei „unklar“ wird nicht automatisch die optisch bevorzugte Variante gewählt. Entscheide vorher, ob der Test mit größerer Stichprobe wiederholt, die Hypothese verworfen oder eine qualitative Untersuchung gestartet wird.
Diese vierte Möglichkeit ist für kleinere Unternehmen zentral. Sie schützt vor Scheingenauigkeit und macht sichtbar, wann der aktuelle Traffic eine Frage nicht beantworten kann.
Qualität
10. Trenne Buchungsmenge und Anfragequalität
Eine Landingpage kann die Buchungsrate erhöhen und zugleich mehr falsche Erwartungen erzeugen. Deshalb bleibt bestätigte Buchung eine mögliche Primärmetrik, während Teilnahme, No-Show und fachliche Passung als Schutz- oder Folgemetriken betrachtet werden.
Die Qualitätsdefinition muss vorab feststehen und in beiden Varianten gleich angewendet werden. Nutze wenige respektvolle Kategorien wie passend, noch nicht bereit, falsches Thema oder nicht erschienen. Nachträgliches Umsortieren nach Kenntnis der Variante gefährdet die Vergleichbarkeit.
Bei langer Verzögerung zwischen Buchung und Qualitätsbewertung endet die Datenerfassung nicht am letzten Landingpage-Aufruf. Plane ein Nachlauf-Fenster, damit beide Varianten dieselbe Chance auf vollständige Rückmeldung haben.
Wenn nur sehr wenige qualifizierte Gespräche entstehen, ist ihre Rate unsicher. Berichte absolute Zahlen und Intervall. Erfinde keine Wirkung aus einzelnen Fällen.
Niedriger Traffic
11. Wann ein A/B-Test nicht das richtige Werkzeug ist
Wenn die geplante Stichprobe bei aktuellem Traffic viele Monate benötigt, kann ein paralleler Test mehr Verwirrung als Klarheit erzeugen. Angebot, Saison, Kampagnen und Marktbedingungen bleiben über so lange Zeit selten unverändert.
Nutze dann qualitative Wege: beobachtete Formularfehler, strukturierte Gespräche, wiederkehrende Fragen, Verständlichkeitstest oder eine klare redaktionelle Überarbeitung. Diese Methoden liefern keine kausale Prozentzahl, können aber offensichtliche Reibung schneller sichtbar machen.
Ein direkt korrigierter Fehler braucht keinen A/B-Test. Wenn ein CTA nicht erklärt, was nach dem Klick passiert, kann die fehlende Information ergänzt und die Wirkung anschließend beobachtet werden. Teste nur zwei fachlich vertretbare Varianten.
Du kannst außerdem eine größere, geschäftlich relevante Änderung prüfen, die mit weniger Daten erkennbar wäre. Das ist keine Einladung, den kleinsten Effekt künstlich hochzusetzen; es ist eine andere Hypothese.
Protokoll
12. Dokumentiere Abweichungen und lerne auch ohne Gewinner
Das Abschlussprotokoll enthält Hypothese, Varianten, Start und Ende, geplante und tatsächliche Stichprobe, Zuteilungsprüfung, Primärmetrik, Effekt mit Unsicherheit, Schutzmetriken, Abweichungen und Entscheidung. Rohzahlen gehören neben Raten.
Notiere technische Vorfälle, Kampagnenänderungen und Ausfallzeiten. Ein scheinbar neutraler Test kann wertvoll sein, wenn er einen Messfehler oder eine unbrauchbare Hypothese sichtbar macht.
Bewahre auch verworfene Tests auf. Sie verhindern, dass dieselbe Idee Monate später ohne neue Begründung erneut gestartet wird. Folgefragen werden klar als neue Hypothesen getrennt.
Ein Testprotokoll ist damit kein Erfolgsalbum. Es ist ein Entscheidungsarchiv, das zeigt, was tatsächlich geplant, gemessen und mit welcher Unsicherheit bewertet wurde.