Ein Creative-Testing-System für UA bei mobilen Apps und Games ist der Loop, der aus einem Batch neuer Anzeigen einen Gewinner macht, dem Sie vertrauen können, und aus diesem Gewinner wieder den nächsten Batch. Ich baue und betreibe diesen Loop innerhalb der Kampagnen, die ich einkaufe, sodass dieselbe Person, die den Spend liest, auch die nächste Version schreibt.
Diese Seite ist für einen Growth- oder UA-Lead, dessen Creative-Testing sich zufällig anfühlt, oder dessen Team viele Anzeigen produziert und wenig daraus lernt. Sie erklärt, was das System ist, was es braucht, und wo UGC und KI-Footage hineinpassen. Die erste Stufe der Methode ist Schritt für Schritt aufgeschrieben, und Ad Production macht die Anzeigen; diese Seite ist das System, das entscheidet, was als Nächstes produziert wird.
Die Plattformfakten auf dieser Seite wurden am 23. und 24. September 2026 gegen die Dokumentation von Google, Meta und TikTok geprüft.
Warum fühlt sich Creative-Testing zufällig an?
Creative-Testing für mobile Apps und Games fühlt sich zufällig an, wenn ein Team seine Anzeigen innerhalb einer laufenden Kampagne vergleicht und die Plattform, nicht der Test, entscheidet, wer was sieht. Meta, Google und TikTok lenken Budget zu den Anzeigen, von denen ihre Modelle die beste Leistung erwarten, sodass der frühe Spitzenreiter den Spend bekommt und der Rest nie eine faire Stichprobe erhält. Was zurückkommt, ist ein Ranking der Ausspielung, nicht der Ideen. Wer pro Version drei Dinge ändert, dem trägt nichts in die nächste Runde. Der Zufall steckt im Aufbau.
Gordon, Zettelmeyer, Bhargava und Chapsky haben fünfzehn Facebook-Experimente mit beobachtungsbasierten Schätzungen verglichen und festgestellt, dass die Schätzungen das Experiment oft nicht reproduzieren konnten, weshalb ein Dashboard-Gewinner nicht automatisch ein echter ist. Deshalb ist der erste Blick auf ein großes Batch nur eine Vorauswahl: die Elimination-Runde lässt jede Anzeige gemeinsam in einer eigenen Install-Kampagne starten und liest den Spend, und das Urteil wartet auf den Umsatz. Als ich die fünf Anzeigen entfernte, die Meta weiter skalierte, brachte der Algorithmus sechs neue Creatives über einen Zielwert, den diese fünf nie erreicht hatten.
Warum iterieren wir bei Creative nicht schnell genug?
Ein UA-Team für mobile Apps oder Games iteriert bei Ad-Creative meist deshalb nicht schnell genug, weil im Loop eine Übergabe eingebaut ist. Die Person, die sieht, dass eine Anzeige müde wird, schreibt ein Briefing, das Briefing wartet auf ein Studio, das Studio rät anhand eines Portfolios, und die nächste Version kommt an, wenn der Gewinner schon verblasst ist. Der Creative-Nachschub ist die Engstelle, und der Flaschenhals darin ist die Entscheidung, was als Nächstes produziert wird, nicht die Produktionsgeschwindigkeit. Schnelle Iteration heißt, dass die Person, die die Spend-Verteilung liest, auch die nächste Version des Gewinners schreibt, ohne Briefing oder Account Manager dazwischen.
Genau so führe ich es: Jede Runde endet mit einem schriftlichen Befund, die nächsten Ideen kommen daraus, Gewinner werden zu Versionen und Verlierer werden nicht noch einmal produziert. Bei Horse Racing Solitaire liefen 175 Anzeigen in fünf Monaten durch einen Account, vierzehn davon unter £1,00 pro Install. Als die Anzeigen eines externen Studios mit einem Briefing, aber ohne den Account, dazukamen, senkte Meta dessen Budgetanteil über 22 Tage von 30% auf 4,5%. Ad Production produziert zuerst Testversionen und stellt nur den Gewinner fertig.
Wie baut man ein Creative-Testing-System?
Ein Creative-Testing-System für App- und Game-UA hat fünf Teile. Zwei Testebenen: Konzepte, die sich stark unterscheiden und als ganze Ideen anhand von Käufen beurteilt werden, und Versionen eines Konzepts, bei denen eine benannte Variable gegenüber einer Kontrollversion geändert wird, sodass ein Sieg auch etwas lehrt. Eine Struktur, die jeder Anzeige denselben Start gibt: Testversionen in einer eigenen Install-Kampagne, jede Anzeige gemeinsam gestartet, Spend als Screening-Signal gelesen, Budgets unangetastet. Eine Entscheidungsregel, festgelegt vor dem Start: die Metrik, die Spend-Grenze, das Auswertungsfenster, was als nicht eindeutig gilt. Ein Protokoll jeder Anzeige mit der getesteten Variable und der Entscheidung. Und ein Produktionsarm, der nur die Gewinner neu produziert.
Die ersten drei sind die Art, wie ich Accounts mit mehr Versionen führe, als sich mit Käufen validieren lassen; kleinere Batches gehen direkt ins Kauf-Testing, und die Elimination-Runde ist mit der Budget-Rechnung aufgeschrieben. Die meisten Teams lassen das Protokoll aus: Die Runde erfasst Spend, Installs, frühes Verhalten und Entscheidung jeder Anzeige, und das Protokoll braucht zusätzlich die geänderte Variable und die nächste Hypothese. Die Regel kommt zuerst: Johari, Koomen, Pekelis und Walsh haben gezeigt, dass wiederholtes Prüfen eines Tests und das Stoppen beim ersten signifikanten Ergebnis falsch positive Resultate begünstigt. Ich lese das Urteil am Umsatz ab, denn derselbe IPM und derselbe CPI können eine Install-zu-Kauf-Rate von 5% oder 20% verbergen.
| Plattform | Was sie bietet | Wie man es liest |
|---|---|---|
| Meta | A/B-Test: eine Variable, eine messbare Hypothese, eine Zielgruppe, die keine andere Kampagne nutzt, 7 bis 30 Tage | Die Ausspielung innerhalb jeder Gruppe wird weiterhin optimiert: welche Anzeige besser abschneidet, so wie Meta sie ausspielt |
| TikTok | Split Test: zuerst die Hypothese, eine spürbar unterschiedliche Variable, mindestens 80% geschätzte Power, 7 bis 30 Tage, keine Änderungen während der Laufzeit | Weder Smart Creative noch Automate Creative unterstützt Split Tests; Smart Creative pausiert Anzeigen, die es als ermüdet einstuft |
| Google App Campaigns | Gerichtetes Experiment: ein Attribut pro Test für ein klares Ergebnis, begrenzt auf bestimmte Setups von Google App Campaigns, Enddatum standardmäßig nach 14 Tagen, keine feste Budget- oder Laufzeitregel | Assets werden zu Anzeigen kombiniert und relativ zueinander bewertet, nicht als isolierte Einblendungen |
Wo passen UGC und KI-Content in ein Creative-Testing-System?
UGC und KI-Content sind Formate, die man innerhalb eines Creative-Testing-Systems für Apps und Games testet, keine Antworten darauf. Ein Creator mit dem eigenen Handy liest sich eher wie ein Beitrag als wie eine Anzeige, und bei einer App ist der Hook meist jemand, der das Problem in eigenen Worten benennt, bevor überhaupt etwas gezeigt wird. KI-Footage hat keinen Dreh dahinter, deshalb kann sie drei Einstiegszeilen vor ein echtes Publikum bringen, bevor überhaupt jemand filmt. Keines gewinnt automatisch: Die Evidenz für Creator-Empfehlungen variiert je nach Creator, Produkt und Plattform, und die Evidenz zu Anzeigen, die mit KI erstellt wurden, ist noch früh und misst Engagement, nicht Zahler.
KI-Footage findet die Behauptung, ein Creator filmt die Behauptung, die gewonnen hat, und Gameplay- oder App-Aufnahmen führen überall dort, wo das Produkt sich von selbst verkauft; der Befund aus dem Account entscheidet über die Mischung. Bei EatBetter war Creator-Content, der als Paid geschaltet wurde, der Motor hinter dem Wachstum von 10.000 $ auf 180.000 $ monatlich wiederkehrendem Umsatz in zwei Monaten. Barari, Eisend und Jains Review von 135 Experimenten fand, dass Creator-Empfehlungen Engagement und Kaufabsicht im Durchschnitt steigern; Kapoor und Kumars Feldexperiment fand, dass personalisiertes generatives Video das Engagement unter den Bestandskunden eines Händlers steigerte, ohne Personalisierung und KI voneinander zu trennen, und maß nichts zu Installs. Siehe UGC-Anzeigen für Apps und KI-UGC-Anzeigen.
Was macht ein Spezialist, der Creative-Testing-Systeme baut?
Ein Spezialist, der Creative-Testing-Systeme für mobile Apps und Games baut, richtet den Loop ein, betreibt ihn und lässt ihn weiterlaufen. Das heißt, Konzepte aus dem zu schreiben, was der Account bereits belohnt hat, zu entscheiden, welche Variable jede Version testet, den Test so zu strukturieren, dass jede Anzeige denselben Start bekommt, Spend statt Vanity-Metriken zu lesen, Verlierer abzuschalten, bevor sie Budget fressen, und den Befund zu schreiben, mit dem die nächste Runde beginnt. Es heißt auch, das interne Team zu trainieren, denn ein System in einem einzigen Kopf ist kein System. Jedes Asset zu produzieren ist ein anderer Job.
Ich habe das innerhalb eines UA-Retainers gemacht, wo die Anzeigen in den Kampagnen, die ich führe, getestet werden; bei der Deutschen Telekom, wo ich den internen Creative-Testing-Prozess aufgebaut und das Team trainiert habe, UA eigenständig zu fahren; und über Ad Production, wo der Befund zusammen mit den Anzeigen zurückkommt. Der Creative-Nachschub ist in den meisten Accounts, die ich öffne, die bindende Engstelle, weshalb der Growth Audit liest, was getestet wurde, was ungetestet live ging, und ob Spend oder Vanity-Metriken die Gewinner auswählen.
Warum Creative-Testing und Performance-Marketing von einer Person kaufen?
Creative-Testing und Performance-Marketing aus einer Hand schließen die Übergabe, an der das meiste Creative-Learning verloren geht. Die Person, die die Spend-Verteilung liest, schreibt das nächste Konzept. Die Person, die das Conversion-Signal festgelegt hat, weiß, warum eine billige Install-Anzeige gegen eine teurere verlor, die Zahler brachte. Verteilt man diese Aufgaben auf ein Studio, eine Agentur und einen Buyer, reicht jeder den anderen ein Dokument weiter, das immer älter ist als die Daten. Ein einziger Verantwortlicher ist schneller, und der Befund ist ehrlich, weil dieselbe Person für den ROAS geradesteht.
Bei einem Retainer kaufe ich die Media ein, verantworte das Signal und führe den Creative-Loop, und mein Netzwerk produziert die Anzeigen, sobald Produktion Teil des Auftrags ist. Auf einem Subscription-Account erklärten Konzept und Variante 25,2% der Streuung im ROAS über 917 Anzeigen, und Sprache 4,8%, ein Befund, den man nur bekommt, wenn Creative-Protokoll und Umsatz bei derselben Person liegen. Signal Engineering kommt zuerst, weil ein Test-Loop auf kaputten Daten die falschen Gewinner nur schneller findet; Paid UA für Mobile Games und für Subscription-Apps zeigen, wie sich der Loop je nach Produkt unterscheidet.
Für wen es ist
- Subscription-Apps und Mobile Games, die rund 100.000 $ pro Monat in Paid UA investieren, oder dafür finanziert sind
- Teams, die viel Creative produzieren und nicht sagen können, welche Anzeige gewonnen hat oder warum
- Games, deren Top-Anzeige ermüdet ist und deren nächstes Batch keinen Testplan hat
- Teams, die für Creative ein externes Studio genutzt haben und es mit einem Testing-System vergleichen wollen
Was Sie bekommen
- Der Test-Loop, eingerichtet in Ihrem Werbekonto: Testversionen in einer eigenen Install-Kampagne, jede Anzeige gemeinsam gestartet, Spend entscheidet, Gewinner werden richtig neu produziert
- Creative-Briefings und Asset-Strategie, verantwortet von mir, mit den Anzeigen produziert von meinem Netzwerk, sobald Sie Kreativproduktion dazubuchen
- Ein schriftlicher Befund am Ende jeder Runde: was gewonnen hat, was verloren hat, was als Nächstes produziert wird
- Wöchentliche Zahlen gegen Ziele, und die Creative-Iterationsrate als eine der Kennzahlen, an denen ich mich selbst messen lasse
- Dokumentation, die Ihr Team behält, und das Training, um den Prozess ohne mich zu fahren
Häufige Fragen
Warum fühlt sich unser Creative-Testing zufällig an?
Creative-Testing fühlt sich zufällig an, wenn Sie Anzeigen innerhalb einer Kampagne vergleichen, die die Plattform optimiert, sodass der frühe Spitzenreiter den Spend bekommt und der Rest nie eine faire Stichprobe erhält. Der Fix liegt im Aufbau: eine eigene Install-Kampagne, jede Anzeige gemeinsam gestartet, Spend als Screening-Signal, die Entscheidungsregel festgelegt vor dem Start. Die Elimination-Runde ist genau dieser Aufbau.
Warum iterieren wir bei Ad-Creative nicht schnell genug?
Ein UA-Team iteriert meist deshalb langsam, weil zwischen der Person, die die Zahlen sieht, und der Person, die die nächste Anzeige macht, eine Übergabe liegt, und das Briefing altert, während es wartet. Ich schreibe die nächste Version aus dem Befund der letzten Runde, ohne Briefing oder Account Manager dazwischen. 175 Anzeigen durch einen Account in fünf Monaten ist dieses Tempo.
Wie baut man ein Creative-Testing-System?
Konzepttests von Versionstests trennen, in einer Struktur testen, die jeder Anzeige denselben Start gibt, Metrik und Spend-Grenze vor dem Start festlegen, jede Anzeige mit der getesteten Variable und der Entscheidung protokollieren, und nur die Gewinner neu produzieren. Die Testwerkzeuge der Plattformen helfen dabei; keines ersetzt eine Hypothese oder ein am Umsatz abgelesenes Urteil.
Gehören UGC und KI-Content in ein Creative-Testing-System?
Ja, als Formate zum Testen, nicht als Antworten. KI-Footage testet, welche Behauptung zieht, bevor jemand filmt, ein Creator vor der Kamera skaliert eher, wenn die Reaktion das Produkt verkauft, und Gameplay- oder App-Aufnahmen führen dort, wo das Produkt sich von selbst verkauft. Wofür KI-UGC-Anzeigen taugen ist eine eigene Seite.
Was macht ein Spezialist, der Creative-Testing-Systeme baut?
Liest den Account, schreibt Konzepte aus dem, was er bereits belohnt hat, entscheidet, was jede Version testet, strukturiert den Test, liest den Spend, schaltet Verlierer ab, schreibt den Befund, mit dem die nächste Runde beginnt, und trainiert Ihr Team, es selbst zu fahren. Bei der Deutschen Telekom hieß das, den internen Creative-Testing-Prozess aufzubauen und zu übergeben.
Sollte eine Person Creative-Testing und Performance-Marketing zusammen machen?
Bei den Spend-Größenordnungen, in denen ich arbeite, ja. Die Spend-Verteilung, das Conversion-Signal und die Budgetentscheidung fließen ins nächste Konzept, und wer das auf ein Studio, eine Agentur und einen Buyer verteilt, schiebt jeweils ein Dokument dazwischen. Was ein Fractional Head of UA verantwortet führt Kanäle, Messung und Creative-Testing als einen einzigen Job.
Wie lange dauert es, bis man einen Creative-Gewinner ausrufen kann?
Die Elimination-Runde liest nach ein paar Tagen Ausspielung oder bei einer vor dem Start festgelegten Spend-Grenze aus, je nachdem, was zuerst eintritt. Ob der Gewinner Zahler bringt, dauert so lange, wie Ihr Umsatz zum Reifen braucht, und wie viele Käufe ein ROAS braucht, bevor er etwas bedeutet, hängt vom Account ab.
Quellen
- What are best practices for A/B tests for Meta ads? Meta Business Help Center. Eine Variable testen, von einer messbaren Hypothese ausgehen, eine Zielgruppe nutzen, die keine andere laufende Kampagne verwendet, und mindestens 7 und höchstens 30 Tage laufen lassen. Im Browser gelesen am 24. September 2026.
- Split Test Best Practices TikTok Business Help Center, zuletzt aktualisiert im Januar 2026. Zuerst die Hypothese, eine spürbar unterschiedliche Variable, mindestens 80% geschätzte Power, 7 bis 30 Tage, keine Änderungen während der Laufzeit. Produktempfehlungen, keine statistischen Konstanten. Geprüft am 23. September 2026.
- About Smart Creative TikTok Business Help Center, zuletzt aktualisiert im November 2025. Pausiert Creatives, die es als ermüdet einstuft, und unterstützt keine Split Tests. Die Einstufung der Ermüdung ist nicht unabhängig validiert. Geprüft am 23. September 2026.
- About Automate Creative TikTok Business Help Center, zuletzt aktualisiert im September 2026. Symphony-AI-Variationen Ihrer Assets; Split Testing wird nicht unterstützt. Geprüft am 23. September 2026.
- Set up a directional experiment for App campaigns Google Ads Help. Ein Attribut pro Test, wenn ein klares Ergebnis gewünscht ist, ein Enddatum standardmäßig nach 14 Tagen, keine strikte universelle Budget- oder Laufzeitregel, und die führende Gruppe kann sich während der Testlaufzeit ändern. Aktuell begrenzt auf bestimmte Setups für App Campaigns und Video. Kein Aktualisierungsdatum angegeben. Geprüft am 23. September 2026.
- About asset reporting for App campaigns Google Ads Help. Eine Anzeige kann mehrere Assets enthalten, und die Bewertungen sind relativ, sodass Asset-Zeilen keine isolierten Expositionstests sind. Geprüft am 23. September 2026.
- A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at Facebook Gordon, Zettelmeyer, Bhargava und Chapsky, Marketing Science, 2019. Fünfzehn US-Facebook-Experimente, 500 Millionen Nutzerbeobachtungen und 1,6 Milliarden Impressions. Zwei Autoren waren Facebook-Mitarbeiter; nicht app-spezifisch.
- Always Valid Inference: Continuous Monitoring of A/B Tests Johari, Koomen, Pekelis und Walsh, Operations Research, 2022. Das wiederholte Prüfen eines Tests mit festem Zeithorizont und das Stoppen bei Signifikanz begünstigt falsch positive Resultate. Allgemeine Web-Experimente; finanziert von Optimizely, das die Methode implementiert hat.
- A meta-analysis of the effectiveness of social media influencers: Mechanisms and moderation Barari, Eisend und Jain, Journal of the Academy of Marketing Science, online 2025. 71 Papers, 135 experimentelle Studien, 571 Effektstärken. Die Ergebnisgrößen sind Engagement und Kaufabsicht, nicht App-Installs oder LTV, und die Effekte variieren je nach Creator, Produkt und Plattform.
- Frontiers: Generative AI and Personalized Video Advertisements Kapoor und Kumar, Marketing Science, 2025. Ein WhatsApp-Feldexperiment mit 21.328 Bestandskunden eines indischen Händlers; personalisiertes generatives Video steigerte das Engagement um etwa 6 bis 9 Prozentpunkte. Personalisierung, Video und KI-Urheberschaft werden nicht getrennt identifiziert, und die Ergebnisgröße ist Engagement, nicht Installs oder Umsatz.