Zwanzig Websites, zweihundert Köder: eine Studie zeigt, wer deine Inhalte wirklich liest
Ein Forschungsteam hat markierte Inhalte ausgelegt und danach 22 KI-Systeme gefragt, ob sie diese Inhalte kennen. Das Ergebnis widerlegt zwei Annahmen, die in fast jeder Bot-Diskussion vorkommen: dass ein Sperren nachträglich hilft, und dass der Bot, der liest, für dasselbe Unternehmen arbeitet, das später antwortet.
Wir haben in diesem Magazin mehrfach geschrieben, dass ein User-Agent eine Behauptung ist und kein Ausweis. Das war bisher eine begründete Vermutung aus dem eigenen Anfrageweg. Jetzt gibt es dazu eine Messung, und sie ist unangenehmer als die Vermutung.
Steven Seiden, Triss Ren, Caroline Zhang, Taein Kim, Enze Liu und Emily Wenger haben im Mai 2026 die Arbeit Identifying AI Web Scrapers Using Canary Tokens veröffentlicht, überarbeitet im September 2026. Der Aufbau ist so einfach, dass ihn jeder Shop nachbauen kann, und genau das macht ihn interessant.
Der Aufbau
Das Team hat 20 Websites ins Netz gestellt, jede mit 10 Kanarienvogel-Tokens. Ein solcher Token ist ein einzigartiger, sonst bedeutungsloser Inhalt: eine erfundene Bezeichnung, ein Zahlencode, ein Satz, den es nirgendwo sonst gibt. Entscheidend ist, dass jeder Besucher eine eigene Variante ausgeliefert bekommt. Wer die Seite abruft, nimmt damit unbemerkt eine Seriennummer mit.
Danach kommt der zweite Teil, und der ist der eigentliche Trick: Man fragt anschließend die KI-Systeme nach dem Thema der Testseite. Taucht in der Antwort eine dieser Seriennummern auf, ist bewiesen, welcher Abruf hinter dieser Antwort steckt. Nicht vermutet, bewiesen.
Über die Laufzeit sahen die Testseiten im Schnitt 592 verschiedene Kombinationen aus User-Agent und Netzbetreiber pro Seite. Für zwanzig Seiten ohne jedes Publikum, ohne Werbung, ohne Verlinkung ist das eine Hausnummer. Der maschinelle Anteil am Verkehr ist keine Randnotiz mehr.
Befund 1: Der Leser ist oft nicht der Anbieter
Für 18 der 22 getesteten Systeme konnte das Team den User-Agent bestimmen. Die erwartbaren Zuordnungen waren dabei: ChatGPT über OAI-SearchBot, Copilot über Bingbot, Gemini über Googlebot, Perplexity über PerplexityBot.
Bemerkenswert sind die anderen. 10 der 18 Systeme griffen auf Scraper fremder Suchmaschinen zurück, ohne dass diese Beziehung öffentlich dokumentiert wäre. Das Paper nennt unter anderem Qwen und Perplexity, die Inhalte zurückgaben, welche über Googlebot eingesammelt worden waren.
Und eine ganze Gruppe kam überhaupt nicht als Bot: ERNIE, Grok, Solar, Qwen und Kimi lieferten Inhalte zurück, die unter gewöhnlichen Browser-Kennungen eingesammelt wurden, also Chrome, Safari, Firefox, Edge.
Das hat eine unmittelbare praktische Folge. Wer seine robots.txt oder seine Firewall gegen eine Liste bekannter KI-Bots pflegt, arbeitet mit einer Liste, die den Vorgang nicht abbildet. Der Abruf, der später zur Antwort führt, sieht in deinem Logfile aus wie ein Mensch mit Chrome.
Befund 2: Nachträgliches Sperren wirkt nicht
Das Team hat anschließend geblockt und gemessen, was das ändert. Ergebnis: 12 Systeme lieferten die Inhalte in beiden Sperr-Varianten weiter aus. Genau ein System hörte damit auf, Duck.ai.
Noch deutlicher wird es beim letzten Punkt: Viele Chatbots gaben die Inhalte der Testseiten auch eine Woche nach deren Abschaltung noch aus. Die Seiten existierten nicht mehr, die Antworten schon.
Das ist die Stelle, an der man das eigene mentale Modell korrigieren muss. Eine Sperre ist kein Rückholknopf. Sie regelt bestenfalls, was ab heute neu hineingeht. Was gelesen wurde, ist gelesen, liegt in Zwischenspeichern und in Modellgewichten und kommt zurück, ohne dass dein Server noch einmal gefragt wird.
Was das für einen Shop oder ein mittelständisches Unternehmen bedeutet
Drei Dinge, und keines davon ist eine Sperrliste.
Erstens: Zugangskontrolle ist die falsche Frage. Wenn zehn von achtzehn Systemen ihre Inhalte über Dritte beziehen und fünf davon unter normalen Browser-Kennungen unterwegs sind, ist die Vorstellung, man könne den Zufluss regeln, nicht haltbar. Die belastbare Frage lautet nicht, wer darf lesen, sondern was findet, wer liest. Ein unvollständiger Produktdatensatz wird genauso weitergereicht wie ein vollständiger, nur mit schlechterem Ergebnis für dich.
Zweitens: Messen kannst du selbst, und zwar günstig. Der Aufbau der Studie ist kein Forschungsgerät. Ein eindeutiger, sonst nirgends vorkommender Ausdruck auf einer eigenen Seite, ein paar Wochen Geduld, dann die Frage an die Assistenten. Wenn der Ausdruck zurückkommt, weißt du, dass die Seite gelesen und verwertet wird, und du weißt es unabhängig von jeder Bot-Liste. Wir halten das für die ehrlichste verfügbare Methode, die eigene Sichtbarkeit zu prüfen, weil sie nicht auf Selbstauskunft beruht.
Drittens: Das Zeitfenster ist enger als gedacht. Wenn Inhalte nach dem Einsammeln über Wochen weiter ausgegeben werden, wirkt jede Korrektur an deinen Daten mit Verzögerung, und jeder Fehler ebenso. Ein falscher Preis, eine veraltete Verfügbarkeit, eine unvollständige Produktbeschreibung: Das steht dann eine Weile in Antworten, auf die du keinen Zugriff mehr hast. Wer seine strukturierten Daten erst pflegt, wenn er ein Problem sieht, hat es bereits mehrere Wochen ausgeliefert.
Was die Studie nicht sagt
Zwei Einschränkungen, damit die Zahlen nicht größer gemacht werden, als sie sind.
Die Testseiten waren eigens angelegt und ohne echtes Publikum. Die 592 Kombinationen pro Seite beschreiben also den maschinellen Grundverkehr einer neuen Seite, nicht die Zusammensetzung des Verkehrs auf einem eingeführten Shop. Auf einer Seite mit echten Besuchern verschiebt sich das Verhältnis.
Und die Zuordnung beweist, welcher Abruf hinter einer Antwort steckt, nicht ob der Inhalt ins Training eingeflossen ist oder erst im Moment der Frage geholt wurde. Für die praktische Folgerung macht das wenig Unterschied, für die rechtliche Bewertung sehr wohl.
Der Punkt, auf den es hinausläuft
Die Diskussion über KI-Crawler wird meist als Abwehrthema geführt: Wie halte ich sie raus, wie viel kostet mich der Verkehr, welche Liste pflege ich. Diese Studie zeigt, dass die Abwehrseite die schwächere Hälfte ist. Sperren wirken kaum, Kennungen sind unzuverlässig, Zwischenspeicher überleben die Abschaltung.
Was bleibt, ist die andere Hälfte, und die ist gestaltbar: dafür zu sorgen, dass das, was eingesammelt wird, deiner Sache dient. Vollständige Produktdaten, saubere strukturierte Auszeichnung, Antworten auf die Fragen, die Kunden wirklich stellen. Das ist keine Sicherheitsmaßnahme, das ist die einzige Stellschraube, die nachweislich noch dir gehört.
Quelle: Steven Seiden, Triss Ren, Caroline Zhang, Taein Kim, Enze Liu, Emily Wenger: Identifying AI Web Scrapers Using Canary Tokens, arXiv:2605.13706, eingereicht 13. Mai 2026, überarbeitet 3. September 2026. arxiv.org/abs/2605.13706
Verwandte Artikel in diesem Magazin: „Ein User-Agent ist eine Behauptung: das Bot-Kompendium", „Jemand benutzt die Namen der KI-Crawler", „Wenn Bots die Regeln umgehen: Warum AI-Crawler zur Governance-Frage werden"
Stell deine Frage zu Klariton.
Gegroundet in Klaritons eigenem Wissen, belegt statt erfunden.
Klariton ist eine Answer-Engine-Optimization-Plattform. Sie ergänzt deine bestehende Shop- oder Website, ohne etwas zu ersetzen oder Daten zu migrieren. Aus deinem eigenen Wissen entstehen geprüfte, quellenbasierte Antworten (BIQs), die AI-Assistenten und deine Besucher direkt nutzen.
Produkttexte, FAQs, Datenblätter, dein CMS oder Shop-Katalog. Klariton verarbeitet dein Material read-only und baut daraus belegte Antworten. Deine Daten werden nicht zum Modell-Training verwendet.
Alle AI-Aufrufe laufen EU-gehostet. Personenbezogene Daten werden vor jedem Aufruf pseudonymisiert. Klariton greift read-only auf deine Quellen zu und speichert keine Klartext-Kundendaten.
Jede Antwort ist quellenbelegt und durchläuft ein Review-Gate. Nichts wird ungeprüft veröffentlicht. Safe Guard überwacht veröffentlichte Antworten laufend gegen dein Material und meldet veraltete oder schwache Aussagen.
Nein. Klariton integriert sich in deine bestehende Seite, ohne Systemwechsel oder Migration. Ein Embed genügt, dein CMS bleibt die Quelle der Wahrheit.
Die Pläne skalieren mit Touchpoints und Antwortvolumen. Der AI-Visibility-Check ist kostenlos und ohne Anmeldung. Für den Rest sprich uns einfach an.
Wie sichtbar ist deine Marke für AI?
Der kostenlose AI-Visibility-Check zeigt dir in unter einer Minute, wie AI-Assistenten deinen Shop heute sehen.