Fünf Runden ChatGPT Ads: was wir nach jeder Messung geändert haben
Wir haben für einen kleinen Kaffeeshop die ersten ChatGPT-Anzeigen geschaltet und nach jeder Messung genau eine Sache geändert. Fünf Runden, fünf Anpassungen, offen aufgeschrieben, auch die zwei, bei denen der Fehler bei uns lag. Kein Fazit, ein Arbeitsstand.
Über ChatGPT Ads wird viel geschrieben und wenig gemessen. Die verfügbaren Zahlen stammen fast alle von OpenAI selbst, von Agenturen mit Interesse an großen Budgets, oder aus Pilotphasen mit Marken, die einen Einkaufsvorteil hatten. Was fehlt, ist der langweilige Fall: ein normaler deutscher Onlineshop, ein dreistelliges Monatsbudget, ein paar Tage Laufzeit, und dann die Frage, was man daraus eigentlich lernt.
Diesen Fall haben wir. Die Zahlen unten stammen aus einer laufenden Kampagne, nicht aus einer Fallstudie. Dieser Text ist deshalb kein Ergebnisbericht, sondern die Beschreibung eines Arbeitszyklus: messen, die Ursache suchen, eine Sache ändern, wieder messen. Jede Anpassung ist bereits gemacht, und bei jeder steht, was sie gebracht hat.
Der erste Zwischenstand vorweg, damit klar ist, worauf die Anpassungen einzahlen: Der Kanal, für den niemand bezahlt hat, konvertiert bisher um ein Vielfaches besser als der, für den wir jetzt zahlen.
Was die Kampagne gemacht hat
Eine Anzeigengruppe, sechzehn Kaffeeprodukte, Optimierung auf Klicks, Tagesbudget 15 Euro. Stand nach fünf Tagen:
Kennzahl | Wert |
|---|---|
Einblendungen | 4.281 |
Klicks | 99 |
Klickrate | 2,31 Prozent |
Klickpreis | 0,57 Euro |
Ausgaben | rund 56 Euro |
Bestellungen | 0 |
Zwei Einordnungen dazu, bevor jemand die letzte Zeile groß macht.
Die Klickrate von 2,31 Prozent liegt deutlich über den Zahlen, die für ChatGPT Ads herumgereicht werden. Adthena kam in der Pilotphase auf 0,91 Prozent, Similarweb für das erste Quartal 2026 auf 0,68 Prozent im Schnitt und 1,57 Prozent bei den Top-Marken. Ein kleiner Shop mit ordentlich geschriebenen Anzeigen liegt also nicht automatisch hinten. Auch der Klickpreis von 0,57 Euro ist unauffällig.
Und die null Bestellungen sind bei 99 Klicks statistisch nichts. Bei einer für den Shop üblichen Konversionsrate von ein bis zwei Prozent wäre der Erwartungswert ein bis zwei Bestellungen. Null ist davon nicht weit weg.
Der Vergleich, der wehtut
Im selben Zeitfenster lief Google Shopping weiter. Über die Kaffeeprodukte gefiltert, 1. bis 2. September: 3 Klicks, 1,49 Euro Kosten, 1 Bestellung.
Das sind lächerlich kleine Zahlen, und genau deshalb taugen sie nicht als Beweis. Was sie aber zeigen: Der Klickpreis liegt in derselben Größenordnung, zwischen 0,31 und 0,88 Euro. Es ist also kein Preisproblem. Der Unterschied liegt woanders.
Interessanter wird es, wenn man den dritten Kanal danebenlegt, den niemand gebucht hat.
Der Kanal, der schon vorher lief
Wir haben in der Shop-Analytik über 30 Tage nach der Herkunft aufgeschlüsselt. Nicht im Anzeigenmanager, sondern in Shopify, also dort, wo die Bestellungen tatsächlich entstehen. Absolute Sitzungs- und Bestellzahlen nennen wir hier nicht, die Verhältnisse zueinander sind ohnehin die Aussage.
Herkunft | Anteil an allen Sitzungen | Konversionsrate | im Vergleich |
|---|---|---|---|
chatgpt.com, organisch | unter 1 Prozent | 4,12 Prozent | Ausgangswert |
Google-Suche | rund 15 Prozent | 0,44 Prozent | 9,4-mal schlechter |
Direkteinstieg | rund 70 Prozent | 0,23 Prozent | 17,9-mal schlechter |
Der organische ChatGPT-Verkehr konvertiert also rund **zehnmal besser als die Google-Suche** und rund achtzehnmal besser als der Direkteinstieg. Er macht dabei weniger als ein Prozent aller Sitzungen aus, verteilt sich gleichmäßig über den Monat, ohne Ausschläge, und niemand hat dafür etwas getan.
Zur Einordnung der Belastbarkeit, ohne die Zahlen selbst zu nennen: Die Sitzungen aus ChatGPT bewegen sich im dreistelligen Bereich, die daraus entstandenen Bestellungen im niedrigen zweistelligen. Das ist keine große Stichprobe. Der Abstand zu den anderen Kanälen ist aber so deutlich, dass er nicht am Zufall liegen kann, zumal die Vergleichskanäle auf einer um ein bis zwei Größenordnungen breiteren Basis stehen.
Eine Beobachtung dazu, die den Kanal noch einmal anders einordnet: Ein Teil dieser Bestellungen waren Espressomaschinen, keine Kaffeepackungen. Der Warenkorb aus dem ChatGPT-Verkehr lag also deutlich über dem, was eine gewöhnliche Kaffeebestellung ausmacht. Wer eine Maschine für den Preis eines Gebrauchtwagens kauft, recherchiert vorher lange, und offenbar zunehmend dort.
Das ist die eigentliche Nachricht. Wer über ChatGPT auf den Shop kommt, hat den Vergleich schon hinter sich. Er ist nicht am Anfang seiner Suche, sondern am Ende. Genau diese Vorqualifizierung ist das, was der Kanal leistet, und sie entsteht ohne Anzeige.
Ein Punkt, der die Zahlen relativiert: das ist eine Nische
Der Shop verkauft Bio-Spezialitätenkaffee und professionelle Kaffeemühlen. Das ist kein Massenmarkt, und das verändert die Auktion. In einem dünn besetzten Segment entsteht der Preis nicht aus Wettbewerb, sondern aus dem, was die Plattform als Mindestgebot ansetzt. Man sieht das an der Gebotsempfehlung des Anzeigenmanagers selbst: Für eine auf Bestellungen optimierte Kampagne markierte er 250 Euro je Bestellung noch rot mit dem Hinweis, das Gebot sei womöglich zu niedrig für eine zuverlässige Auslieferung, und erst 260 Euro grün als „starkes Angebot". Bei einem Warenkorb im niedrigen zweistelligen Bereich ist das eine Ansage.
Wer als einer der Ersten in einem schmalen Segment wirbt, zahlt also nicht weniger, weil weniger Konkurrenz da ist, sondern potenziell mehr, weil es keinen Marktpreis gibt, an dem sich die Plattform orientieren müsste. Das ist der Teil des First-Mover-Vorteils, über den selten geschrieben wird.
Wir haben unsere eigenen Anzeigen gesucht und nicht gefunden
Mehrfach, mit verschiedenen Formulierungen, aus verschiedenen Sitzungen: Wir haben ChatGPT Fragen gestellt, bei denen unsere Anzeigen hätten erscheinen müssen. Erschienen sind sie nicht. Was erschien, waren organische Treffer auf unsere eigenen Seiten.
Zwei Lesarten, und beide sind interessant. Die unangenehme: Die Auslieferung ist so dünn, dass man die eigene Kampagne im Alltag nicht antrifft. Die erfreulichere, und es ist die, über die wir uns tatsächlich gefreut haben: Die Arbeit an Produktdaten und Auffindbarkeit trägt. Der Shop steht in den Antworten, ohne dass eine Anzeige dafür nötig wäre.
Für die Bewertung des Kanals heißt das: Der bezahlte Platz ersetzt den organischen nicht, er liegt daneben, und im Zweifel ist der organische der, den man tatsächlich zu sehen bekommt.
Wie wir die Kampagne anpassen
Fünf Tage sind kein Urteil, und wir behandeln sie auch nicht als eines. Was wir stattdessen tun, ist ein Zyklus, der immer gleich läuft: messen, die Ursache suchen, genau eine Sache ändern, wieder messen. Wer zwei Dinge gleichzeitig ändert, weiß hinterher nicht, welches gewirkt hat.
Fünf Durchgänge sind bis hierhin gelaufen. Sie sind der eigentliche Inhalt dieses Artikels.
Erster Durchgang: den Kampagnentyp der Messung anpassen, nicht umgekehrt. Die naheliegende Wahl wäre eine auf Bestellungen optimierte Kampagne gewesen. Wir haben auf Klicks optimiert, und zwar aus einem Grund, der sich später als richtig herausstellte: Eine auf Bestellungen optimierte Steuerung braucht ein Bestellsignal, das zurückkommt. Solange nicht bewiesen ist, dass es zurückkommt, optimiert die Plattform ins Leere und kauft trotzdem ein.
Zweiter Durchgang: die Messung reparieren, bevor man den Zahlen glaubt. Der Anzeigenmanager zählte 23 abgerechnete Klicks, in der Shop-Analytik kamen im selben Zeitraum 3 Sitzungen mit passender Kennzeichnung an. Wir haben die Differenz nicht wegerklärt, sondern das eigene Conversion-Skript geprüft und darin einen Fehler gefunden. Behoben am fünften Tag. Die Folge ist unbequem: Die Zahlen davor sind rückwirkend nicht mehr lesbar, wir zählen ab dem Fix neu. Der Fehler war unserer, nicht der der Plattform.
Ein Teil einer solchen Differenz ist immer normal: Abbrüche vor dem Laden, Blocker, Zuordnungsfenster. Der größere Teil war es hier nicht. Die Lehre daraus ist unbequem, aber allgemein: Wer eine Kampagne startet, bevor die Messung nachweislich Bestellungen zurückmeldet, kauft Verkehr, den er nicht bewerten kann.
Dritter Durchgang: den Feed nachzählen, nicht hochladen und hoffen. Zweimal geliefert, zweimal weniger angekommen, 16 Zeilen ergaben 13 angenommene Produkte, 19 Zeilen ergaben 15. Statt es hinzunehmen haben wir die Dateien Zeile für Zeile gegen die Spezifikation geprüft. Ein Teil erklärt sich über den Verfügbarkeitsstatus. Der Rest führte zu etwas anderem: Wir haben dabei drei echte Datenfehler im eigenen Katalog gefunden, darunter zwei Artikel, die die Kennnummer eines fremden Produkts trugen, und einen, dessen Adresse noch auf ein Vorgängermodell zeigte. Alle drei behoben, Feeds neu gebaut und erneut geprüft, danach null Feldfehler und alle Produktadressen erreichbar. Der Anzeigenmanager hat diese Fehler nie gemeldet. Sie sind nur aufgefallen, weil jemand die Differenz nachgerechnet hat. Wer den Feed hochlädt und die Zahl nicht nachzählt, bewirbt weniger Produkte, als er denkt, und merkt es nie.
Vierter Durchgang: an der Sperre vorbeibauen statt gegen sie. Das Gebot darf das Tagesbudget nicht überschreiten, und der Kampagnentyp lässt sich nachträglich nicht wechseln. Beides sind harte Grenzen, keine Einstellungsfragen, und die erste kostet mehr, als sie klingt: Wer auf Bestellungen optimiert, gibt dort keinen Klickpreis ein, sondern den Preis pro Bestellung. Bei einem Warenkorb im vierstelligen Bereich sind 250 Euro je Bestellung eine vernünftige Vorgabe. Nur verlangt die Plattform dann auch 250 Euro Tagesbudget, also 7.500 im Monat als Obergrenze.
Die Anpassung war deshalb keine Änderung an der bestehenden Kampagne, sondern eine zweite daneben, auf Bestellungen optimiert, mit einem Budget, das zum Gebot passt. Die erste läuft unverändert weiter, damit der Vergleich seine Grundlinie behält.
Fünfter Durchgang: das Sortiment erweitern, und dabei den nächsten Fehler finden. Für einen zweiten Test haben wir einen Feed über die Kaffeemühlen gebaut, getrennt für Deutschland und die Schweiz. Getrennt deshalb, weil die Preise sich zwischen den Märkten unterscheiden und ein gemeinsamer Feed für einen der beiden Märkte falsch gewesen wäre. Beim Bauen kam heraus, dass ein Großteil der Produkte einer Marke unter der Schweizer Adresse gar nicht existiert. Auch das hätte man nie erfahren, ohne jede einzelne Adresse abzurufen.
Was daneben läuft
Der organische Kanal ist der stärkste, den der Shop hat. Also geht ein Teil der Arbeit dorthin, und zwar mit demselben Zyklus. Beim Nachmessen der eigenen Produktseiten kam heraus, dass die Kundenbewertungen zwar sichtbar auf der Seite stehen, in der maschinenlesbaren Auszeichnung aber überhaupt nicht vorkamen. Die Produktbeschreibung war bei 800 Zeichen mitten im Wort abgeschnitten, und ausgerechnet der Teil, der die Eignung beschreibt, fiel weg. Von über dreißig gepflegten Produktangaben standen sechs im Markup.
Das sind keine Anzeigenthemen. Sie entscheiden aber darüber, ob ein Modell den Shop überhaupt in eine Antwort aufnehmen kann, und sie kosten nichts außer Arbeit.
Die Frage, die wir mitnehmen
Wir haben in der Kampagne einen Conversion-Wert hinterlegt. Bei einer auf Bestellungen optimierten Steuerung ist genau das die Zahl, an der sich die Plattform beim Einkauf orientiert. Die offene Frage lautet, ob sie diesen Wert am Ende ausschöpft, ob also der tatsächliche Preis je Bestellung gegen die Vorgabe läuft statt darunter zu bleiben. Wer den Wert hoch ansetzt, damit überhaupt ausgeliefert wird, könnte genau damit den Preis definieren, den er zahlt.
Das ist keine rhetorische Frage. Sie ist der Grund, warum die zweite Kampagne mit einer bewusst gesetzten Vorgabe läuft und nicht mit einer geschätzten.
Was wir bis hierhin mitnehmen
Wir hören mit den Anzeigen nicht auf, dafür ist die Datenlage zu dünn. Aber die Reihenfolge, in der wir arbeiten, hat sich umgedreht.
Der bezahlte Kanal ist bisher messbar schlechter als der Verkehr, neben dem er steht. Er kostet Geld, liefert Klicks in normaler Qualität und bisher keine belegte Bestellung. Der organische Kanal daneben ist der beste, den der Shop hat, konvertiert zehnmal besser als die Google-Suche und hat nie eine Rechnung geschrieben. Als wir nach den eigenen Anzeigen gesucht haben, war es der, den wir gefunden haben.
Was ihn speist, ist keine Anzeige, sondern Auffindbarkeit: vollständige Produktdaten, maschinenlesbare Auszeichnung, Antworten auf die Fragen, die vor dem Kauf wirklich gestellt werden. Wer beides gegeneinander abwägt, sollte zuerst das billigere und wirksamere in Ordnung bringen. Anzeigen kann man danach immer noch schalten, dann aber mit einer Messung, die funktioniert, und einem Vergleichswert, der etwas taugt.
Die Kampagne läuft weiter, und der Zyklus auch. Wir versprechen an dieser Stelle keine Zahl zu einem Stichtag. Was wir stattdessen tun, ist jede Anpassung aufzuschreiben, auch die, die nichts gebracht hat. Das ist die Form, in der dieser Kanal derzeit überhaupt beurteilbar ist: nicht als Bilanz, sondern als Protokoll.
Methodik und Grenzen: Alle Zahlen stammen aus einem einzelnen deutschen Onlineshop im Bereich Spezialitätenkaffee, über einen Zeitraum von fünf Tagen (Anzeigen) beziehungsweise 30 Tagen (Herkunftsanalyse). Die Anzeigenwerte kommen aus dem OpenAI Ads Manager, die Sitzungs- und Kaufzahlen aus Shopifys eigener Auswertung, der Google-Vergleich aus Google Ads mit Merchant-Center-Feed. Es handelt sich um ein Nischensegment, die Auktionsdynamik ist dort eine andere als in einem Massenmarkt. Eine einzelne Konversion ist keine Kennzahl, und 99 Klicks sind kein Urteil über einen Kanal. Was die Zahlen belastbar zeigen, sind Größenordnungen und die Richtung, nicht der Endstand. Sie sind ein Zwischenstand in einem laufenden Zyklus und werden fortgeschrieben, sobald eine Anpassung etwas daran ändert.
Stell deine Frage zu Klariton.
Gegroundet in Klaritons eigenem Wissen, belegt statt erfunden.
Klariton ist eine Answer-Engine-Optimization-Plattform. Sie ergänzt deine bestehende Shop- oder Website, ohne etwas zu ersetzen oder Daten zu migrieren. Aus deinem eigenen Wissen entstehen geprüfte, quellenbasierte Antworten (BIQs), die AI-Assistenten und deine Besucher direkt nutzen.
Produkttexte, FAQs, Datenblätter, dein CMS oder Shop-Katalog. Klariton verarbeitet dein Material read-only und baut daraus belegte Antworten. Deine Daten werden nicht zum Modell-Training verwendet.
Alle AI-Aufrufe laufen EU-gehostet. Personenbezogene Daten werden vor jedem Aufruf pseudonymisiert. Klariton greift read-only auf deine Quellen zu und speichert keine Klartext-Kundendaten.
Jede Antwort ist quellenbelegt und durchläuft ein Review-Gate. Nichts wird ungeprüft veröffentlicht. Safe Guard überwacht veröffentlichte Antworten laufend gegen dein Material und meldet veraltete oder schwache Aussagen.
Nein. Klariton integriert sich in deine bestehende Seite, ohne Systemwechsel oder Migration. Ein Embed genügt, dein CMS bleibt die Quelle der Wahrheit.
Die Pläne skalieren mit Touchpoints und Antwortvolumen. Der AI-Visibility-Check ist kostenlos und ohne Anmeldung. Für den Rest sprich uns einfach an.
Wie sichtbar ist deine Marke für AI?
Der kostenlose AI-Visibility-Check zeigt dir in unter einer Minute, wie AI-Assistenten deinen Shop heute sehen.