Stille GPTBot-Blockaden am Cloudflare-Edge erkennen und einordnen
Ein neuer Leitfaden zeigt, wie Cloudflare KI-Crawler am Edge blockiert – und wie Website-Betreiber das erkennen und einordnen können.
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- OpenAI setzt GPTBot und OAI-SearchBot als getrennte Crawler ein; robots.txt-Einträge für beide sind unabhängig voneinander.
- GPTBot sammelt Trainingsdaten, OAI-SearchBot dient der ChatGPT-Suche.
- Cloudflare bietet seit Juli 2025 beim Hinzufügen neuer Domains eine Abfrage, ob KI-Crawler erlaubt werden sollen, sowie Tools zum Blockieren, Vergebühren und Messen von KI-Crawlern.
- Cloudflare hat einen "Easy Button" zum Blockieren aller AI-Bots im Bereich Security > Bots.
- Cloudflare-spezifische Header wie cf-ray, cf-cache-status oder server: cloudflare zeigen an, dass die Antwort vom Cloudflare-Edge stammt; ein Status ungleich 200 deutet auf einen Cloudflare-Block hin.
- Ein direkter Test gegen die Origin-IP (unter Umgehung von Cloudflare) kann einen Cloudflare-Block bestätigen: Liefert Origin 200, Cloudflare aber 403, liegt der Block bei Cloudflare.
So entlarven Sie stille GPTBot-Blockaden am Cloudflare-Edge
Ein neuer Leitfaden beschreibt einen bislang wenig beachteten Fehlerpfad: Cloudflare kann den GPTBot von OpenAI bereits am Edge blockieren, bevor die Anfrage den Origin-Server erreicht. Die Blockade wirkt unabhängig von der robots.txt; selbst wenn dort `Allow` für GPTBot steht, lehnt die Web Application Firewall die Anfrage ab.
Das zentrale Erkennungsmerkmal sind Cloudflare-spezifische Antwort-Header. Enthält eine Antwort die Felder `cf-ray`, `cf-cache-status` oder `server: cloudflare`, stammt sie vom Cloudflare-Edge und nicht vom Origin. Liegt der HTTP-Status dann nicht bei 200, ist Cloudflare die Schicht, die blockiert. Diese Diagnose erlaubt es, stille Blockaden von Problemen in der robots.txt oder auf dem Origin-Server zu unterscheiden. Der Leitfaden empfiehlt, zuerst robots.txt und Origin-Antworten zu prüfen, bevor Einstellungen in Cloudflare geändert werden. So wird vermieden, dass Website-Betreiber fälschlich ihre eigenen Serverregeln anpassen, obwohl der Block am Edge liegt.
Die Diagnose ist besonders relevant, weil viele Betreiber nach der Veröffentlichung einer Site lediglich die robots.txt anpassen und dann wochenlang keine Crawler-Treffer in den Logs sehen. Der Leitfaden zeigt, dass die Ursache fast nie die robots.txt ist, sondern eine Edge-Sicherheitsregel. Weil automatisierte Crawler interaktive Browser-Challenges nicht lösen können, scheitert der Abruf still; in den Server-Logs erscheint kein Treffer. Ein zusätzlicher Test besteht darin, den `X-Robots-Tag`-Header der Antwort zu prüfen: Auch dieser kann Crawler ausschließen, obwohl die robots.txt etwas anderes sagt. Wer alle drei Ebenen – robots.txt, Edge-Header und Origin-Antwort – systematisch durchgeht, findet die tatsächliche Blockadestelle zuverlässig.
Origin-Test per cURL: Edge-Block vom Server-Block unterscheiden
Um einen Cloudflare-Block von einem Origin-Block zu unterscheiden, schlägt der Leitfaden einen direkten Test gegen die Origin-IP vor, der Cloudflare umgeht. Dazu wird ein cURL-Aufruf mit dem User-Agent des GPTBot ausgeführt, etwa: `curl -I -s -A 'Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.2; +https://openai.com/gptbot)' https://yourdomain.com`. Entscheidend ist der HTTP-Status. Liefert der Origin-Server bei direkter Anfrage 200, Cloudflare aber 403, ist der Block bei Cloudflare bestätigt. Vorher sollten robots.txt und der `X-Robots-Tag`-Header geprüft werden, um andere Ursachen auszuschließen.
Der Test funktioniert, weil Cloudflare als Proxy vor dem Origin sitzt. Bei einer direkten Verbindung zur Origin-IP entfallen Edge-Regeln wie Super Bot Fight Mode oder Rate-Limiting. Wenn der Origin den Bot durchlässt, Cloudflare ihn jedoch ablehnt, liegt die Ursache nicht an der eigenen Serverkonfiguration. Der Leitfaden weist darauf hin, dass OpenAI, Anthropic und Perplexity dynamische IP-Subnetze verwenden, die sich häufig ändern. Eine WAF, die den Crawler nicht sofort per Reverse-DNS oder vertrauenswürdiger ASN verifizieren kann, antwortet mit 403 oder einer JavaScript-Challenge. Ein automatisierter Crawler kann eine interaktive Browser-Challenge nicht lösen und bricht den Abruf ab.
Für den Test gegen die Origin-IP ist es wichtig, den tatsächlichen A-Record der Domain zu kennen und nicht versehentlich wieder über Cloudflare zu gehen. Wer die Origin-IP nicht kennt, kann sie über historische DNS-Daten oder den Hosting-Provider ermitteln. Alternativ lässt sich der Test mit einem `Host`-Header und der direkten IP ausführen, etwa `curl -I -s -H 'Host: yourdomain.com' -A 'GPTBot/1.2' http://ORIGIN_IP/`. Liefert dieser Aufruf 200, während der Aufruf über die Cloudflare-URL 403 liefert, ist der Edge-Block eindeutig belegt. Diese Methode ist besonders wertvoll, weil sie ohne Zugriff auf das Cloudflare-Dashboard auskommt und sich in Monitoring-Skripte einbauen lässt.
Cloudflares KI-Crawler-Steuerung: Vom Signup-Dialog bis zum Easy Button
Cloudflare hat die Steuerung von KI-Crawlern seit Juli 2025 schrittweise ausgebaut. Beim Hinzufügen neuer Domains fragt der Anbieter seitdem ab, ob KI-Crawler erlaubt werden sollen. Cloudflare bezeichnet dies als bewusste Entscheidung statt eines stillen Freifahrtscheins. Parallel startete eine Pay-Per-Crawl-Beta, mit der Betreiber Crawler bepreisen können, und das Analysetool AI Crawl Control (vormals AI Audit) zur Messung von Crawler-Zugriffen.
Für das Blockieren gibt es einen sogenannten Easy Button: Im Cloudflare-Dashboard unter Security > Bots lässt sich der Schalter `AI Scrapers and Crawlers` aktivieren, der alle bekannten KI-Bots blockiert. Technisch funktioniert dieser Button wie eine vordefinierte Bot-Management-Regel, die auf einer von Cloudflare gepflegten Signatur-Datenbank basiert. Sobald der Schalter aktiv ist, gleicht Cloudflare jeden eingehenden Request gegen diese Datenbank ab – erkannte KI-Crawler werden verworfen, ohne dass der Betreiber eigene WAF-Regeln schreiben muss. Cloudflare aktualisiert die Signaturen automatisch, sobald neue Bots identifiziert werden. Das Feature steht auch Kunden des Free-Tarifs zur Verfügung.
Daneben können Super Bot Fight Mode oder aggressives Rate-Limiting Crawler mit dynamischen IPs per 403 oder JavaScript-Challenge still blockieren. Super Bot Fight Mode kann Anfragen anhand von Bot-Score-Kategorien blockieren. Wer in diesen Kategorien eine Challenge oder einen Block konfiguriert, trifft damit auch KI-Crawler, deren IPs nicht per Reverse-DNS oder ASN verifiziert werden können. Aggressives Rate-Limiting wiederum zählt Anfragen pro IP und Zeitfenster; Crawler, die viele Seiten in kurzer Zeit abrufen, überschreiten die Schwelle und werden blockiert. Beide Mechanismen greifen am Edge, bevor eine Anfrage den Origin erreicht, und wirken unabhängig von robots.txt. Website-Betreiber, die solche Schutzfunktionen aktiviert haben, ohne an GPTBot zu denken, können daher unbeabsichtigt die Sichtbarkeit in KI-gestützten Suchdiensten verlieren.
Die drei Steuerungswege – Blockieren, Bepreisen, Messen – lösen unterschiedliche Probleme: Blockieren ist Durchsetzung, Pay Per Crawl ist Monetarisierung, AI Crawl Control ist Messung. Verwechslungen führen dazu, dass Betreiber blockieren oder bepreisen, ohne die tatsächlichen Crawler-Zugriffe zu messen.
Widerspruch: Blockiert Cloudflare still oder nur auf Wunsch?
Die Quellenlage ist nicht widerspruchsfrei. Einerseits beschreibt ein Fachbeitrag, dass Cloudflare seit dem 1. Juli 2025 jede neue Domain beim Signup fragt, ob KI-Crawler erlaubt werden sollen; neue Domains starteten damit nicht in einem stillen Freifahrtschein. Andererseits heißt es in einem anderen Leitfaden, Cloudflare-Bot-Schutz könne KI-Crawler ohne Wissen des Betreibers blockieren, unabhängig von robots.txt. Beide Aussagen schließen sich nicht aus, weil sie unterschiedliche Cloudflare-Features betreffen. Die Signup-Abfrage gilt für neue Domains und die zentrale KI-Crawler-Steuerung. Super Bot Fight Mode, Rate-Limiting oder der Easy Button können dagegen auch bei bestehenden Domains oder durch spezifische Einstellungen greifen, ohne dass der Betreiber den Zusammenhang zu GPTBot erkennt. Der Widerspruch zeigt, dass pauschale Aussagen über Cloudflares Verhalten irreführend sind: Wer nur die Signup-Abfrage kennt, übersieht mögliche stille Blocks durch Bot-Schutzregeln; wer nur die Edge-Blockade betrachtet, unterschätzt die bewusste Auswahlmöglichkeit.
Hinzu kommt, dass viele Betreiber den Easy Button oder Super Bot Fight Mode aktivieren, um generischen Spam oder bösartige Bots abzuwehren, ohne zu realisieren, dass dieselben Regeln auch legitime KI-Crawler treffen. Die Signup-Abfrage ist eine einmalige Entscheidung, während die Bot-Schutz-Features dauerhaft im Hintergrund laufen und bei jeder Anfrage greifen. Deshalb ist die Unterscheidung zwischen „gewollter Blockade“ und „stiller Blockade“ in der Praxis oft eine Frage der Perspektive: Der Betreiber hat eine Schutzfunktion eingeschaltet, aber nicht verstanden, dass sie auch GPTBot betrifft.
Warum die Unterscheidung zwischen GPTBot und OAI-SearchBot entscheidend ist
OpenAI setzt zwei getrennte Crawler ein: GPTBot sammelt Trainingsdaten für generative KI-Modelle, OAI-SearchBot bedient die ChatGPT-Suche und liefert Zitationen. Die robots.txt-Einträge für beide sind unabhängig voneinander. Ein Betreiber kann OAI-SearchBot erlauben, um in ChatGPT-Suchergebnissen zu erscheinen, und gleichzeitig GPTBot verbieten, um die Nutzung für das Training auszuschließen. Wer beide blockiert oder den falschen Crawler sperrt, verliert Sichtbarkeit, ohne das Trainingsziel zu erreichen.
Die Relevanz zeigt sich in Zahlen: In einer Stichprobe vom 13. Juni 2026 blockierten 35 von 107 untersuchten Top-Sites mindestens einen OpenAI-Crawler. Das Reuters Institute ermittelte, dass bis Ende 2023 rund 48 Prozent führender Nachrichtenseiten in zehn Ländern OpenAI-Crawler blockierten. Auch die CDN-Ebene unterscheidet sich: Fastly blockiert KI-Crawler hart, Cloudflare stellt Challenges, CloudFront lässt sie durch. Diese Unterschiede sind technisch bedingt: Fastly setzt standardmäßig eine strikte Bot-Management-Policy um, die bekannte KI-Crawler sofort ablehnt, ohne eine Challenge auszuliefern. Cloudflare bevorzugt dagegen JavaScript-Challenges, um zwischen echten Nutzern und Bots zu unterscheiden – ein automatisierter Crawler scheitert an der Challenge, während ein menschlicher Besucher sie lösen kann. CloudFront wiederum hat ohne explizit konfigurierte WAF-Regeln keine aktive Bot-Erkennung und leitet Anfragen standardmäßig an den Origin weiter. Für Website-Betreiber und SEO-Verantwortliche bedeutet das: Wer nur auf robots.txt achtet, übersieht Edge-Blocks. Wer GPTBot und OAI-SearchBot nicht auseinanderhält, riskiert, aus der ChatGPT-Suche zu verschwinden, obwohl er Trainingsdaten freigeben wollte – oder umgekehrt.
OpenAI weist zudem darauf hin, dass bei erlaubten Bots unter Umständen nur ein Crawl für beide Zwecke genutzt wird, um doppeltes Crawlen zu vermeiden. Das ändert nichts an der getrennten Steuerung, unterstreicht aber, dass die Entscheidung pro Crawler bewusst getroffen werden sollte. Wer seine Sichtbarkeit in KI-Suchdiensten erhalten will, muss daher nicht nur die robots.txt korrekt pflegen, sondern auch sicherstellen, dass Edge-Sicherheitsregeln den OAI-SearchBot nicht versehentlich blockieren. Ein regelmäßiger cURL-Test mit beiden User-Agents – GPTBot und OAI-SearchBot – gegen die eigene Domain ist der einfachste Weg, solche stillen Blockaden frühzeitig zu erkennen.


