Auf einen Blick
Testen Sie eine begründete Veränderung unter möglichst vergleichbaren Bedingungen. Wählen Sie Zielmetrik und Auswertungszeitpunkt vor dem Start und prüfen Sie beide Varianten technisch. Kleine Ergebnisunterschiede oder geringe Fallzahlen erlauben nicht automatisch eine sichere Entscheidung. Dokumentieren Sie auch einen nicht eindeutigen Test.
Die Testfrage muss zum Inhalt passen
Formulieren Sie zuerst eine überprüfbare Annahme. „Ein Vergleich nach Anwendungsfall erleichtert die Produktauswahl und erhöht den Anteil eindeutiger Produktklicks“ ist präziser als „Wir testen ein schöneres Design“. Daraus ergibt sich, welche Stelle sich ändern soll und welche Kennzahl die Frage beantwortet. Ein Test der gesamten Marke braucht einen anderen Rahmen als der Vergleich zweier Einstiege.
Ein eigenes Modellbeispiel: Ein Shop für Rucksäcke zeigt in Variante A drei Modelle nach Preis. Variante B ordnet dieselben Modelle nach Tageswanderung, Pendeln und Reise. Produkte, Preise, Versandzeit und Empfängerregeln bleiben gleich. Die Frage betrifft damit die Auswahlhilfe. Wird gleichzeitig ein Rabatt ergänzt, ist nicht mehr erkennbar, ob die neue Orientierung oder das Angebot den Unterschied verursacht hat.
Die Zielmetrik vor dem Start festlegen
Wählen Sie die Kennzahl, die zur Hypothese passt: eindeutige Klicks für Orientierung, passende Bestellungen für Kaufwirkung oder abgeschlossene Anmeldungen für eine Formularfrage. Öffnungen können durch Datenschutzfunktionen beeinflusst werden. Nutzen Sie sie deshalb nicht ungeprüft als Beweis für echte Aufmerksamkeit. Legen Sie zusätzlich Grenzen fest, etwa auffällige Abmeldungen oder Beschwerden.
Klaviyo erläutert im Leitfaden zur statistischen Signifikanz, wie Kampagnentests bewertet werden. Prüfen Sie im konkreten Test die verwendete Gewinnmetrik und die ausgewiesene Sicherheit. Die wirtschaftliche Bedeutung ist eine weitere Frage: Ein kleiner relativer Vorteil kann praktisch wenig verändern. Bewerten Sie deshalb absolute Werte, Nenner und Aufwand gemeinsam, anstatt nur die farbig hervorgehobene Variante zu übernehmen.
Varianten vergleichbar und technisch gleichwertig machen
Kontrollieren Sie beide Fassungen mit derselben Sorgfalt. Inhalt, Preise, Zielseiten und Personalisierung müssen funktionieren. Ein kaputter Link in Variante A macht den Test zu einer Fehlerbeobachtung, nicht zu einem fairen Vergleich. Prüfen Sie Smartphone, Desktop, dunkle Darstellung und fehlende Profilwerte. Die jeweilige Veränderung sollte in der empfangenen Nachricht genauso erscheinen wie geplant.
Benennen Sie die Varianten verständlich und speichern Sie den Testplan. Notieren Sie Hypothese, geänderte Stelle, Zielgruppe, erwartete Richtung und Auswertungszeitpunkt. Verändern Sie laufende Fassungen nicht unbemerkt. Wenn eine Korrektur nötig ist, dokumentieren Sie den Eingriff und entscheiden Sie, ob die vorhandenen Ergebnisse noch vergleichbar sind. Ein nachvollziehbarer Neustart kann besser sein als ein vermischter Testverlauf.
Kampagnentest und Flowtest unterscheiden
Eine Kampagne erreicht ihre Zielgruppe zu einem geplanten Anlass. Ein Flowtest sammelt Beobachtungen über laufend eintretende Kontakte. Der Klaviyo-Leitfaden zum Testen einer Flow-Mail beschreibt die entsprechenden Funktionen. Kontrollieren Sie dabei, ob Sie nur eine Nachricht oder zusätzlich ganze Pfade und Wartezeiten verändern.
Bei Flows kann die Zusammensetzung der eintretenden Personen über die Zeit wechseln. Ein Sale, eine neue Anmeldequelle oder ein geänderter Checkout beeinflusst die Daten. Legen Sie daher einen passenden Beobachtungszeitraum fest und dokumentieren Sie wichtige Paralleländerungen. Prüfen Sie die Entscheidung erst, wenn beide Varianten vergleichbare Gelegenheiten hatten. Ein schneller Klickvorteil muss nicht bedeuten, dass später auch passende Käufe entstehen.
Kleine Stichproben und frühes Beenden vermeiden
Zwei zusätzliche Käufe können einen großen prozentualen Abstand erzeugen, wenn die Ausgangszahl klein ist. Stellen Sie deshalb die absoluten Ereignisse neben die Rate. Werten Sie nicht fortlaufend so lange aus, bis kurzfristig die gewünschte Variante vorne liegt. Definieren Sie vorab, wann der Test bewertet werden soll und wie mit einem nicht eindeutigen Ergebnis umgegangen wird.
Bei wenig Volumen kann ein breiterer inhaltlicher Unterschied informativer sein als eine minimale Farbänderung. Auch qualitative Rückmeldungen können beim Verständnis helfen, müssen aber als solche gekennzeichnet werden. Ein Test ohne klare Entscheidung ist kein Fehlschlag. Er zeigt, dass die vorhandenen Daten die Änderung noch nicht ausreichend tragen. Dann kann die einfachere oder leichter pflegbare Variante eine vernünftige redaktionelle Wahl sein.
Die Ergebnisse mit stabilen Messregeln lesen
Vergleichen Sie dieselben Nenner und abgeschlossene Zeitfenster. Berücksichtigen Sie Attributionsregeln, automatische Interaktionen und unterschiedliche Bestellwerte. Wenn die Zielmetrik Klicks war, bleibt das die primäre Testfrage; ein zufällig höherer Einzelwarenkorb darf nachträglich nicht ohne Begründung zum neuen Entscheidungskriterium werden. Zusätzliche Kennzahlen helfen bei der Einordnung, ersetzen aber nicht den Plan.
Notieren Sie Ergebnis, Unsicherheit und die daraus folgende Maßnahme. Beispielsweise: Die Anwendungsordnung zeigte keinen belastbaren Klickvorteil, vereinfacht aber die Beratung und bleibt daher als redaktionelle Entscheidung erhalten. Diese Aussage ist präziser als eine unbewiesene Steigerungsbehauptung. Bei einem klaren Ergebnis kontrollieren Sie nach der Übernahme die tatsächliche Variante und ihre Links erneut.
Checkliste für den nächsten A/B-Test
- Eine konkrete Hypothese beschreibt Problem und erwartete Veränderung.
- Varianten unterscheiden sich an einer nachvollziehbaren Stelle.
- Zielmetrik, Nenner und Auswertungszeitpunkt sind festgelegt.
- Beide empfangenen Nachrichten und Zielseiten wurden geprüft.
- Paralleländerungen an Zielgruppe, Angebot oder Tracking sind dokumentiert.
- Absolute Zahlen, Unsicherheit und wirtschaftliche Bedeutung werden bewertet.
Bewahren Sie auch Tests ohne eindeutigen Gewinner auf. Die Dokumentation verhindert, dass dasselbe Team eine frühere Annahme erneut als neue Erkenntnis behandelt. Gute Experimente liefern nachvollziehbare Entscheidungen und zeigen die Grenzen der vorhandenen Daten.
Quellen und weiterführende Dokumentation
Produktdokumentation und Primärquellen zu den beschriebenen Schritten. Redaktioneller Quellenstand: 5. Oktober 2026.