Kontakt

Anja von Erfolgsladys

Kostenloses Erfolgsgespräch

Ich kläre mit dir, wo du gerade stehst und welcher nächste Schritt dir mehr Anfragen bringt.

Erfolgsgespräch buchen

Kurzantwort: Was braucht ein belastbarer Landingpage-A/B-Test?

Ein belastbarer A/B-Test braucht vor dem Start eine konkrete Hypothese, genau eine isolierte Änderung, eine Primärmetrik, eine geplante Stichprobe und eine schriftliche Stop-/Entscheidungsregel. Die Stichprobe hängt von Ausgangsrate, kleinster relevanter Veränderung, Signifikanzniveau und Teststärke ab. Kleine Unterschiede bei wenigen Conversions bleiben unsicher; ein vorläufig höherer Wert ist noch kein Gewinner.

Du öffnest das Experiment-Dashboard und Variante B liegt vorne. Das fühlt sich nach einer klaren Antwort an. Wenn aber erst wenige Buchungen zusammengekommen sind, kann der Vorsprung morgen verschwunden sein. Ein A/B-Test beginnt deshalb nicht beim farbigen Graphen, sondern bei der Entscheidung, die du mit den Daten später wirklich treffen willst.

Für eine Coach-Landingpage kann die Frage lauten, ob eine klarere Erwartung vor dem Gespräch den Anteil bestätigter Buchungen verändert. Du benennst die vermutete Ursache, veränderst genau diesen Punkt und legst vorher fest, welche Messgröße zählt. Der Rest der Seite bleibt möglichst gleich.

Allgemeine Text-, CTA- und Strukturideen gehören zur Landingpage-Optimierung. Diese Seite ist enger: Randomisierung, Messplan, Stichprobe, Unsicherheit, Stopregel und dokumentierte Entscheidung. Es werden keine Testergebnisse oder Anja-Cases erfunden.

Warum ein früher Vorsprung noch kein Testergebnis ist

Conversion-Raten schwanken. Wenn Variante B in einem frühen Zwischenstand vorne liegt, kann der Unterschied durch Zufall, ungleiche Trafficquellen, Wochentage oder eine fehlerhafte Zuteilung entstehen. Wer bei jedem Zwischenstand stoppt, erhöht das Risiko einer falschen Entscheidung.

Ein zweites Problem ist die fehlende Isolation. Werden Headline, Bild, Seitenlänge und Formular gleichzeitig geändert, vergleichst du zwei Pakete. Das kann als größerer Variantenvergleich bewusst geplant sein, beantwortet aber nicht, welche einzelne Änderung den Unterschied verursacht hat.

Das dritte Problem ist eine nachträglich gewählte Gewinnerkennzahl. Wenn Klickrate, Scrolltiefe, Buchung und Leadqualität gleichzeitig betrachtet werden, findet sich fast immer irgendwo ein positiver Ausschlag. Eine Primärmetrik muss deshalb vorab feststehen; weitere Werte dienen als Schutz- oder Diagnosemetriken.

Ein sauberer Test darf mit „keine belastbare Entscheidung“ enden. Das ist kein Scheitern. Es verhindert, dass ein unsicherer Ausschlag als Wissen verkauft wird.

Ein Ergebnis ist nicht belastbar, wenn:

  • die Hypothese erst nach Sichtung der Daten formuliert wurde
  • mehrere zentrale Elemente unkontrolliert wechseln
  • die Primärmetrik nachträglich ausgewählt wird
  • bei einem attraktiven Zwischenstand vorzeitig gestoppt wird
  • Zuteilung und Trafficzusammensetzung nicht geprüft sind
  • wenige Conversions als präziser Unterschied interpretiert werden

Das A/B-Testprotokoll in acht Schritten

Schreibe jeden Schritt vor dem Start. Nachträgliche Änderungen werden als Abweichung dokumentiert, nicht still überschrieben.

Frage Hypothese Änderung Metrik Stichprobe Zuteilung Stopregel Entscheidung
1

Entscheidungsfrage

Welche konkrete Unsicherheit soll kleiner werden, und welche Handlung folgt aus einem positiven, negativen oder unklaren Ergebnis?

2

Hypothese

Formuliere Ursache, Änderung, Zielgruppe und erwartete Richtung ohne ein Ergebnis vorwegzunehmen.

3

Isolierte Änderung

Definiere exakt, was in B anders ist und welche Bestandteile in A und B identisch bleiben.

4

Primärmetrik

Wähle eine Messgröße, die zur Entscheidung passt, etwa bestätigte Buchungen pro zugeteilter Person.

5

Stichprobenplan

Plane aus Ausgangsrate, kleinster relevanter Veränderung, Signifikanzniveau und Teststärke; nutze fachkundige Statistik oder ein transparentes Werkzeug.

6

Randomisierung

Lege Einheit und Split fest, verhindere Variantenwechsel derselben Person und prüfe die tatsächliche Zuteilung.

7

Stopregel

Bestimme Mindeststichprobe, Mindestdauer, Umgang mit technischen Fehlern und zulässige Zwischenanalysen vorab.

8

Entscheidungsregel

Definiere übernehmen, beibehalten, verwerfen oder erneut testen anhand Effekt, Unsicherheit und Schutzmetriken.

Von der Hypothese zur nachvollziehbaren Entscheidung

Google empfiehlt für Werbeexperimente eine klare Hypothese, eine Variable und ein oder zwei vorab gewählte Erfolgsmetriken. Diese Grundsätze gelten auch für einen Landingpage-Vergleich, selbst wenn ein anderes Experimentierwerkzeug eingesetzt wird.

Die Statistik ist dabei kein grünes Siegel. Sie beschreibt Unsicherheit unter bestimmten Annahmen. Randomisierung, saubere Zuteilung, vollständige Messung und eine unveränderte Testumgebung sind Voraussetzungen dafür, dass das berechnete Intervall überhaupt sinnvoll interpretiert werden kann.

Für kleine Coaching-Angebote ist die ehrliche Grenze besonders wichtig: Wenige Buchungen erlauben meist nur große Effekte zuverlässig zu erkennen. Ein feiner Unterschied kann geschäftlich interessant sein und statistisch trotzdem unentscheidbar bleiben.

Vor dem Start müssen feststehen:

  • Entscheidungsfrage und prüfbarer Mechanismus
  • eine isolierte Änderung
  • Primärmetrik mit Zähler und Nenner
  • Schutzmetriken und Ausschlussregeln
  • Ausgangsrate und kleinster relevanter Effekt
  • geplante Stichprobe und Mindestdauer
  • Randomisierungs- und Auswertungseinheit
  • Stopregel und statistische Methode
  • Entscheidung für Vorteil, Nachteil, Gleichwertigkeit und unklar
Prozessgrafik: A/B-Test mit Hypothese, Metrik, Stopregel und Entscheidung
Ein belastbarer A/B-Test beginnt mit Hypothese, Primärmetrik und Entscheidung, nicht mit einem frühen Gewinnergefühl.
Hypothese

1. Formuliere eine prüfbare Ursache – keine Wunschrichtung

„Variante B wird besser konvertieren“ ist keine brauchbare Hypothese. Es fehlt der Grund. Eine prüfbare Form lautet: „Wenn die Gesprächserwartung direkt vor dem CTA konkret benannt wird, verändert sich der Anteil bestätigter Buchungen, weil weniger Unsicherheit über Ablauf und Passung bleibt.“

Die Formulierung benennt Zielgruppe, Mechanismus, Änderung und Primärmetrik. Sie verspricht kein Ergebnis. Vor dem Start ergänzt du, welcher Unterschied geschäftlich relevant wäre und welche Entscheidung bei keinem erkennbaren Unterschied folgt.

Nutze vorhandene Hinweise für die Hypothese: wiederkehrende Fragen, Formularabbrüche, Gesprächsnotizen oder Klickpfade. Ein A/B-Test soll eine begründete Unsicherheit prüfen, nicht Ideen zufällig durchs System schicken.

Halte die ursprüngliche Formulierung unverändert im Protokoll. Neue Erklärungen nach dem Ergebnis können als Folgefragen notiert werden, dürfen aber nicht so dargestellt werden, als seien sie vorher geplant gewesen.

Isolation

2. Verändere genau einen entscheidenden Baustein

Wenn die Hypothese die Erwartung vor dem CTA betrifft, ändert Variante B nur diesen Erwartungsblock. Headline, Trafficquelle, Preis, Formular, Testimonials und technischer Aufbau bleiben gleich. Dadurch wird die Ursache interpretierbarer.

Die offene Frage bestimmt den Baustein. Sinnvolle Kandidaten können Headline, Problem-Einstieg, Angebotsdarstellung, Platzierung eines passenden Testimonials, CTA-Erwartung, Formularlänge oder Terminbuchung sein. Du wählst daraus genau den Punkt, für den es einen nachvollziehbaren Hinweis gibt.

Manchmal besteht eine fachlich zusammengehörige Änderung aus mehreren Textzeilen. Das ist weiterhin ein Baustein, wenn alle Zeilen denselben Mechanismus umsetzen. Dokumentiere den gesamten Unterschied mit Screenshot oder Version, damit später nicht unbemerkt weitere Anpassungen hinzukommen.

Ein größerer Seitenentwurf gegen den bisherigen Stand ist ein Paket-Test. Er kann beantworten, welches Gesamtpaket unter den Testbedingungen besser abschneidet, aber nicht, ob Headline, Bild oder Formular dafür verantwortlich war. Kennzeichne diesen Unterschied offen.

Während des Tests werden keine parallelen Änderungen an Kampagne, Zielgruppe oder Buchungsweg vorgenommen, soweit das kontrollierbar ist. Unvermeidbare Eingriffe kommen mit Datum ins Protokoll und können einen Neustart erforderlich machen.

Halte auch den Einstieg zur Landingpage stabil. Eine Google-Suche, ein YouTube-Video, eine Anzeige und eine E-Mail wecken unterschiedliche Erwartungen. Wenn diese Quellen ungeplant zwischen A und B verteilt oder während des Tests stark verändert werden, lässt sich die Seitenaussage schwerer einordnen.

Primärmetrik

3. Wähle eine Kennzahl, die die Entscheidung tatsächlich trägt

Die Primärmetrik muss zur Hypothese passen. Ein Test der Gesprächserwartung sollte nicht allein über Buttonklicks entscheiden, wenn die geschäftliche Handlung eine bestätigte Buchung ist. Klicks können als Diagnosewert sichtbar bleiben.

Definiere Zähler und Nenner exakt. „Buchungsrate“ kann bestätigte Buchungen pro Sitzung, pro Person oder pro CTA-Klick bedeuten. Diese Varianten beantworten unterschiedliche Fragen. Für Randomisierung auf Personenebene sollte die Auswertung dieselbe Einheit respektieren.

Lege zusätzlich höchstens wenige Schutzmetriken fest: No-Show-Anteil, Anteil qualifizierter Gespräche oder technische Fehlerrate. Sie verhindern, dass eine Variante wegen mehr Buchungen übernommen wird, obwohl sie an anderer Stelle klar schadet.

Wähle die Primärmetrik vor den Daten. Wenn sie sich als fehlerhaft erweist, wird der Test abgebrochen oder als ungültig markiert. Eine günstigere Ersatzmetrik nachträglich zum Gewinner zu erklären, ist keine saubere Auswertung.

Metrik-Steckbrief:

  • Name und geschäftliche Bedeutung
  • Zähler und Nenner
  • Randomisierungs- und Auswertungseinheit
  • technischer Auslöser
  • bekannte Messlücken
  • Schutzmetriken und Grenzwerte
Kleinster Effekt

4. Definiere die kleinste relevante Veränderung

Ein Test kann mit genug Daten winzige Unterschiede erkennen. Das heißt nicht, dass jeder winzige Unterschied eine Umsetzung rechtfertigt. Lege deshalb eine kleinste relevante Veränderung fest: den Effekt, bei dem Nutzen, Aufwand und Risiko eine Entscheidung tatsächlich ändern.

Dieser Wert wird nicht aus dem späteren Ergebnis abgeleitet. Er entsteht aus Geschäftskontext: aktuelles Volumen, Wert einer qualifizierten Anfrage, Umsetzungsaufwand und mögliche Nachteile. Ohne belastbare Basis bleibt die Annahme ausdrücklich vorläufig.

Je kleiner der gewünschte erkennbare Effekt, desto größer wird typischerweise die notwendige Stichprobe. Eine niedrige Ausgangsrate verschärft das Problem. Deshalb können Seiten mit wenigen monatlichen Buchungen meist nur große Veränderungen in vertretbarer Zeit untersuchen.

Setze den kleinsten Effekt nicht künstlich hoch, nur damit ein Rechner eine kleine Stichprobe ausgibt. Dann planst du einen Test, der praktisch relevante kleinere Veränderungen gar nicht erkennen kann.

Stichprobe

5. Plane die Stichprobe aus Annahmen, nicht aus einer Pauschalzahl

Es gibt keine universelle Mindestzahl, die für jede Landingpage reicht. Für einen Vergleich von Anteilen hängen Stichprobe und Präzision von Ausgangsrate, kleinstem relevanten Effekt, gewünschtem Signifikanzniveau, Teststärke, ein- oder zweiseitiger Fragestellung und Zuteilungsverhältnis ab.

NIST zeigt für Anteilstests, wie Signifikanzniveau, Teststärke, Ausgangsanteil und zu erkennende Differenz in die Stichprobengröße eingehen. Die Formeln setzen Annahmen voraus und ersetzen keine fachkundige Planung bei wichtigen Geschäftsentscheidungen.

Verwende eine konservative Ausgangsrate aus einem passenden historischen Zeitraum. Wenn Tracking, Traffic oder Angebot inzwischen verändert wurden, ist diese Basis unsicher. Plane einen Puffer für Datenverlust und technische Ausschlüsse, ohne nachträglich unerwünschte Fälle selektiv zu entfernen.

Dokumentiere geplante Stichprobe pro Variante und erwartete Dauer. Wenn die Dauer mehrere Monate beträgt, können Saisonalität und Umfeld die Stabilität erschweren. Dann ist ein formaler A/B-Test möglicherweise nicht das passende Werkzeug.

Zuteilung

6. Prüfe Randomisierung und tatsächliches Split-Verhältnis

A und B müssen vergleichbare Gruppen erhalten. Lege fest, ob Personen, Sitzungen oder ein anderes Merkmal randomisiert werden. Für Landingpages ist eine stabile Personenzuteilung oft leichter zu interpretieren, weil dieselbe Person nicht bei jedem Aufruf eine andere Variante sehen soll.

Kontrolliere das beobachtete Verhältnis gegen den geplanten Split. Ein deutlicher Sample Ratio Mismatch, also eine unerwartete Abweichung, kann auf Zuteilungs-, Lade-, Tracking- oder Ausschlussfehler hinweisen. Microsoft Research beschreibt SRM als Warnsignal, das vor der Ergebnisinterpretation untersucht werden muss.

Vergleiche auch wichtige Trafficmerkmale: Gerät, Quelle, Land und Kampagne, soweit geplant und datenschutzkonform erfasst. Randomisierung erzeugt nicht in jeder kleinen Stichprobe perfekte Gleichheit, aber systematische Unterschiede können einen Implementierungsfehler zeigen.

Wenn Variante B langsamer lädt oder ihr Tracking ausfällt, kann die Messung selbst den Vergleich verzerren. Deshalb gehören technische Fehler- und Performancewerte zu den Schutzmetriken.

Stopregel

7. Lege fest, wann der Test endet – bevor der Graph attraktiv aussieht

Eine einfache Stopregel kombiniert geplante Mindeststichprobe und Mindestdauer. Die Dauer sollte relevante Geschäftszyklen abdecken, etwa verschiedene Wochentage. Zusätzlich definierst du technische Abbruchgründe wie Zuteilungsfehler, kaputtes Formular oder unvollständige Conversion-Messung.

Wiederholtes Nachsehen mit klassischer Signifikanzanalyse und Stoppen beim ersten günstigen Zwischenstand kann die Fehlerwahrscheinlichkeit erhöhen. Microsoft Research behandelt dieses Problem als optional stopping und zeigt, dass die statistische Methode zur Monitoring- und Stopstrategie passen muss.

Wenn laufendes Monitoring geschäftlich nötig ist, braucht ihr ein dafür geeignetes sequenzielles oder bayesianisches Verfahren mit vorab festgelegter Regel. Ein gewöhnlicher Rechner plus tägliches Gewinner-Peeking ist kein Ersatz.

Stoppe nicht automatisch, wenn die Mindeststichprobe erreicht ist, aber ein technischer Fehler vorliegt. Der Test kann ungültig sein. Und verlängere nicht still so lange, bis das gewünschte Ergebnis erscheint; jede Abweichung von der Planung wird dokumentiert.

Stopregel enthält:

  • Mindeststichprobe je Variante
  • Mindestdauer und vollständige Geschäftszyklen
  • geplante Zwischenanalysen
  • zulässige statistische Methode
  • technische Abbruchgründe
  • Umgang mit verspäteten Conversions
Unsicherheit

8. Lies Effekt und Konfidenzintervall gemeinsam

Ein beobachteter Unterschied ist eine Schätzung. Ein Konfidenzintervall zeigt einen Bereich von mit den Daten vereinbaren Effektwerten unter den Annahmen des Verfahrens. Breite Intervalle bedeuten geringe Präzision.

Wenn ein Intervall sowohl einen geschäftlich relevanten Vorteil als auch einen Nachteil umfasst, ist die Entscheidung unsicher. „Nicht statistisch signifikant“ beweist nicht, dass beide Varianten gleich sind. Der Test kann schlicht zu wenig Information für den relevanten Effekt enthalten.

Auch ein enges Intervall um einen winzigen Effekt kann gegen eine Umsetzung sprechen, wenn Aufwand oder Schutzmetriken schlechter sind. Statistik entscheidet nicht allein; sie beschreibt den erwartbaren Bereich, auf dessen Grundlage eine Geschäftsregel angewendet wird.

NIST weist darauf hin, dass Näherungen bei kleinen Stichproben oder wenigen Ereignissen ungenau sein können. Nutze geeignete exakte oder robuste Methoden und hole bei wichtigen Entscheidungen fachkundige Unterstützung.

Entscheidung

9. Definiere vier mögliche Ausgänge statt nur Gewinner und Verlierer

Ein Test kann vier sinnvolle Ausgänge haben. Erstens: B zeigt einen relevanten Vorteil und Schutzmetriken bleiben innerhalb der Grenzen – B wird übernommen. Zweitens: B zeigt einen relevanten Nachteil – B wird verworfen. Drittens: der Effekt ist klein genug eingegrenzt, dass beide praktisch ähnlich sind – A bleibt wegen geringerer Änderungskosten. Viertens: das Intervall bleibt zu breit – keine belastbare Entscheidung.

Schreibe diese Logik vor dem Start mit konkreten Schwellen. Berücksichtige auch technische Qualität und Leadqualität. Mehr Buchungen rechtfertigen keine Übernahme, wenn No-Shows oder unpassende Gespräche den vorher festgelegten Grenzwert überschreiten.

Bei „unklar“ wird nicht automatisch die optisch bevorzugte Variante gewählt. Entscheide vorher, ob der Test mit größerer Stichprobe wiederholt, die Hypothese verworfen oder eine qualitative Untersuchung gestartet wird.

Diese vierte Möglichkeit ist für kleinere Unternehmen zentral. Sie schützt vor Scheingenauigkeit und macht sichtbar, wann der aktuelle Traffic eine Frage nicht beantworten kann.

Qualität

10. Trenne Buchungsmenge und Anfragequalität

Eine Landingpage kann die Buchungsrate erhöhen und zugleich mehr falsche Erwartungen erzeugen. Deshalb bleibt bestätigte Buchung eine mögliche Primärmetrik, während Teilnahme, No-Show und fachliche Passung als Schutz- oder Folgemetriken betrachtet werden.

Die Qualitätsdefinition muss vorab feststehen und in beiden Varianten gleich angewendet werden. Nutze wenige respektvolle Kategorien wie passend, noch nicht bereit, falsches Thema oder nicht erschienen. Nachträgliches Umsortieren nach Kenntnis der Variante gefährdet die Vergleichbarkeit.

Bei langer Verzögerung zwischen Buchung und Qualitätsbewertung endet die Datenerfassung nicht am letzten Landingpage-Aufruf. Plane ein Nachlauf-Fenster, damit beide Varianten dieselbe Chance auf vollständige Rückmeldung haben.

Wenn nur sehr wenige qualifizierte Gespräche entstehen, ist ihre Rate unsicher. Berichte absolute Zahlen und Intervall. Erfinde keine Wirkung aus einzelnen Fällen.

Niedriger Traffic

11. Wann ein A/B-Test nicht das richtige Werkzeug ist

Wenn die geplante Stichprobe bei aktuellem Traffic viele Monate benötigt, kann ein paralleler Test mehr Verwirrung als Klarheit erzeugen. Angebot, Saison, Kampagnen und Marktbedingungen bleiben über so lange Zeit selten unverändert.

Nutze dann qualitative Wege: beobachtete Formularfehler, strukturierte Gespräche, wiederkehrende Fragen, Verständlichkeitstest oder eine klare redaktionelle Überarbeitung. Diese Methoden liefern keine kausale Prozentzahl, können aber offensichtliche Reibung schneller sichtbar machen.

Ein direkt korrigierter Fehler braucht keinen A/B-Test. Wenn ein CTA nicht erklärt, was nach dem Klick passiert, kann die fehlende Information ergänzt und die Wirkung anschließend beobachtet werden. Teste nur zwei fachlich vertretbare Varianten.

Du kannst außerdem eine größere, geschäftlich relevante Änderung prüfen, die mit weniger Daten erkennbar wäre. Das ist keine Einladung, den kleinsten Effekt künstlich hochzusetzen; es ist eine andere Hypothese.

Protokoll

12. Dokumentiere Abweichungen und lerne auch ohne Gewinner

Das Abschlussprotokoll enthält Hypothese, Varianten, Start und Ende, geplante und tatsächliche Stichprobe, Zuteilungsprüfung, Primärmetrik, Effekt mit Unsicherheit, Schutzmetriken, Abweichungen und Entscheidung. Rohzahlen gehören neben Raten.

Notiere technische Vorfälle, Kampagnenänderungen und Ausfallzeiten. Ein scheinbar neutraler Test kann wertvoll sein, wenn er einen Messfehler oder eine unbrauchbare Hypothese sichtbar macht.

Bewahre auch verworfene Tests auf. Sie verhindern, dass dieselbe Idee Monate später ohne neue Begründung erneut gestartet wird. Folgefragen werden klar als neue Hypothesen getrennt.

Ein Testprotokoll ist damit kein Erfolgsalbum. Es ist ein Entscheidungsarchiv, das zeigt, was tatsächlich geplant, gemessen und mit welcher Unsicherheit bewertet wurde.

Freigabecheckliste für einen Landingpage-A/B-Test

Der Test startet erst, wenn Planung, Technik und Entscheidung nachvollziehbar dokumentiert sind.

  • Die Hypothese nennt Ursache, Änderung, Zielgruppe und erwartete Richtung.
  • Variante B verändert genau einen dokumentierten Baustein.
  • Primärmetrik, Zähler, Nenner und Auswertungseinheit stehen fest.
  • Schutzmetriken für Technik und Anfragequalität sind definiert.
  • Ausgangsrate und kleinster relevante Effekt sind begründet.
  • Stichprobe wurde mit Signifikanzniveau und Teststärke geplant.
  • Randomisierung verhindert unkontrollierte Variantenwechsel.
  • Das geplante Split-Verhältnis kann gegen den Ist-Wert geprüft werden.
  • Mindestdauer und Mindeststichprobe sind vorab festgelegt.
  • Zwischenanalysen und statistische Methode passen zusammen.
  • Technische Abbruchgründe und Conversion-Nachlauf sind dokumentiert.
  • Die Entscheidungsregel enthält ausdrücklich den Ausgang unklar.
  • Es existieren keine erfundenen oder vorweggenommenen Testergebnisse.
  • Kannibalisierungshinweis: Diese Seite behandelt A/B-Tests für Coach-Landingpages; allgemeine Strukturfehler, Texte und Tools werden nur als mögliche Testobjekte verlinkt.
  • Interne Link-Idee: Von hier auf /landingpage-struktur-fehler-coach/ für Testhypothesen und auf /landingpage-texte-coach/ für Copy-Varianten verlinken.

Wie ich A/B-Tests für Coaches einordne

Am Anfang steht für mich die Entscheidung, die nach dem Test tatsächlich getroffen werden kann. Erst danach entstehen zwei Varianten. Wenn der vorhandene Traffic diese Entscheidung in realistischer Zeit nicht tragen kann, sage ich das lieber vorher.

Bei Coach-Angeboten trenne ich Buchungsmenge und Gesprächsqualität. Eine Variante, die mehr Termine erzeugt, ist nicht automatisch stärker, wenn Erwartung, Teilnahme oder Passung schlechter werden.

Das ist eine Arbeitsweise, kein erfundener Erfolgscase. Jeder Test braucht seine eigene Stichprobenplanung, technische Prüfung und dokumentierte Unsicherheit.

  • Hypothese vor Gestaltung
  • eine Änderung pro kausaler Frage
  • Primärmetrik vor dem ersten Ergebnis
  • unklar als zulässige Entscheidung
  • Leadqualität als Schutz vor falschem Wachstum

Häufige Fragen zu A/B-Tests für Coach-Landingpages

Wie viele Aufrufe braucht ein A/B-Test?

Es gibt keine Pauschalzahl. Die Stichprobe hängt von Ausgangsrate, kleinstem relevanten Effekt, Signifikanzniveau, Teststärke und Split ab. Wenige Conversions erlauben meist nur große Unterschiede zuverlässig zu erkennen.

Wie lange sollte ein Landingpage-Test laufen?

Bis geplante Mindeststichprobe und Mindestdauer erreicht sind und verspätete Conversions berücksichtigt wurden. Relevante Wochenzyklen sollten abgedeckt sein. Bei klassischer Analyse darf nicht beim ersten günstigen Zwischenstand gestoppt werden.

Darf ich mehrere Dinge gleichzeitig ändern?

Dann testest du ein Gesamtpaket und kannst die Wirkung nicht einem einzelnen Baustein zuordnen. Für eine kausale Frage veränderst du genau den dokumentierten Mechanismus und hältst den Rest stabil.

Was bedeutet ein nicht signifikantes Ergebnis?

Es beweist nicht automatisch Gleichheit. Das Intervall kann einen relevanten Vorteil und Nachteil zugleich enthalten. Dann ist das Ergebnis unklar oder die Stichprobe für die gewünschte Präzision zu klein.

Kann ich täglich nach dem Gewinner schauen?

Nur wenn die statistische Methode und Stopregel für fortlaufendes Monitoring geplant sind. Klassische Tests beim ersten attraktiven Zwischenstand zu stoppen kann die Fehlerwahrscheinlichkeit erhöhen.

Was mache ich bei wenig Traffic?

Prüfe qualitative Hinweise, behebe offensichtliche Fehler oder teste nur eine größere begründete Veränderung. Ein monatelanger instabiler A/B-Test ist nicht automatisch besser als eine klare redaktionelle Entscheidung.

Offizielle und primäre Quellen zur Experimentplanung

Stand der Prüfung: 16. Juli 2026. Die Quellen erklären Grundsätze und Statistik; sie ersetzen keine fachkundige Planung für ein konkretes Experimentierwerkzeug.

Anja Krüger – Gründerin von Erfolgsladys

Über Anja Krüger

Anja Krüger unterstützt Coaches und Expertinnen dabei, Landingpages, Angebote, Sichtbarkeit und automatisierte Anfragewege klar zu verbinden.

Willst du deine Landingpage nicht blind verändern

Im kostenlosen Training siehst du, wie Sichtbarkeit, Landingpage und Anfrageweg zusammenarbeiten.

Landingpage vertiefen

Anfragen messbar aufbauen

Prüfe, wie Sichtbarkeit, Anfrageweg und Auswertung in einer ruhigeren Reihenfolge zusammengeführt werden.

Kostenloses Training ansehen