KI-Crawler in der robots.txt: GPTBot & Co. steuern
GPTBot blockieren, KI-Suche erlauben: alle wichtigen KI-Crawler mit User-Agent, Zweck und Wirkung, dazu geprüfte robots.txt-Vorlagen und typische Stolperfallen.
Um KI-Training zu verhindern, ohne in ChatGPT, Claude oder Perplexity unsichtbar zu werden, sperrst du in der robots.txt nur die Trainings-Crawler (etwa GPTBot, ClaudeBot, Google-Extended) und lässt die Such-Bots (OAI-SearchBot, Claude-SearchBot, PerplexityBot) zu.
Inhalt
Training-Bots vs. Such-Bots vs. Nutzer-Abrufe
Die meisten KI-Anbieter betreiben inzwischen mehrere Crawler mit unterschiedlichen Aufgaben. Wer pauschal „alle KI-Bots“ aussperrt, verliert oft mehr, als er schützt. Man kann drei Gruppen unterscheiden:
1. Trainings-Crawler
Sie sammeln Inhalte, die in das Training zukünftiger Sprachmodelle einfließen können. Beispiele: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl, dessen Datensätze von vielen KI-Firmen genutzt werden). Sperrst du sie, landen deine künftigen Inhalte laut Anbieterangaben nicht mehr in deren Trainingsdaten. Auf deine Sichtbarkeit in KI-Suchen hat das nach den Dokumentationen von OpenAI und Anthropic keinen direkten Einfluss.
Eine Sonderform sind reine Steuerungs-Tokens wie Google-Extended und Applebot-Extended. Hinter ihnen steckt kein eigener Crawler: Google bzw. Apple crawlen weiterhin mit Googlebot bzw. Applebot, werten aber die Regeln für das Extended-Token aus, um zu entscheiden, ob die Inhalte für KI-Training genutzt werden dürfen.
2. Such-Crawler
Sie bauen den Index auf, aus dem KI-Suchen ihre Quellen auswählen und verlinken: OAI-SearchBot für die Suche in ChatGPT, Claude-SearchBot für die Websuche in Claude, PerplexityBot für Perplexity. Blockierst du sie, kann deine Seite in diesen Antworten nicht (oder nur eingeschränkt) als Quelle erscheinen. Bei Google und Microsoft gibt es keinen separaten KI-Such-Crawler: AI Overviews und der KI-Modus basieren auf dem normalen Googlebot-Index, Copilot auf dem Bing-Index.
3. Nutzer-ausgelöste Abrufe
Wenn jemand in ChatGPT, Claude oder Perplexity eine konkrete URL abfragen lässt, ruft ein eigener Agent die Seite in Echtzeit ab: ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User. Hier gibt es einen wichtigen Haken:
Laut Anbieterdokumentation befolgen nutzer-ausgelöste Abrufe die robots.txt teilweise nicht. OpenAI schreibt zu ChatGPT-User, dass robots.txt-Regeln „möglicherweise nicht gelten“, weil die Aktion von einem Menschen ausgelöst wird. Perplexity gibt für Perplexity-User an, dass robots.txt „in der Regel ignoriert“ wird, und Meta formuliert es für meta-externalfetcher ähnlich. Anthropic dagegen beschreibt, dass eine Sperre von Claude-User solche Abrufe verhindert. Verlass dich bei diesen Agents also nicht allein auf die robots.txt.
Die wichtigsten KI-User-Agents
Die folgende Tabelle basiert auf den öffentlichen Dokumentationen der Anbieter (Stand: September 2026). Der Token in der ersten Spalte ist das, was du hinter User-agent: schreibst; Groß- und Kleinschreibung spielt dabei keine Rolle.
| Token | Betreiber | Zweck | Wirkung beim Blockieren |
|---|---|---|---|
GPTBot | OpenAI | Training von Modellen | Kein Training mit deinen Inhalten; ChatGPT-Suche unberührt |
OAI-SearchBot | OpenAI | Index für die Suche in ChatGPT | Seite erscheint nicht mehr als Suchergebnis in ChatGPT |
ChatGPT-User | OpenAI | Abruf auf Anweisung eines Nutzers | Wird laut OpenAI ggf. nicht beachtet |
ClaudeBot | Anthropic | Sammeln von Trainingsdaten | Künftige Inhalte werden vom Training ausgeschlossen |
Claude-SearchBot | Anthropic | Index für die Websuche in Claude | Geringere Sichtbarkeit in Claude-Suchergebnissen |
Claude-User | Anthropic | Abruf auf Anweisung eines Nutzers | Claude kann die Seite für Nutzerfragen nicht abrufen |
PerplexityBot | Perplexity | Index für Perplexity-Suchergebnisse (laut Anbieter kein Training) | Seite wird nicht mehr als Quelle verlinkt |
Perplexity-User | Perplexity | Abruf auf Anweisung eines Nutzers | Wird laut Perplexity in der Regel ignoriert |
Googlebot | Google-Suche inkl. AI Overviews und KI-Modus | Verschwinden aus der Google-Suche – nie für KI-Opt-out verwenden | |
Google-Extended | Steuerungs-Token: Nutzung für Gemini-Training und Grounding | Kein Einfluss auf Google-Suche und Ranking | |
Bingbot | Microsoft | Bing-Suche, Grundlage für Copilot | Verschwinden aus Bing und damit aus Copilot-Antworten |
Applebot | Apple | Suche in Spotlight, Siri, Safari | Weniger Sichtbarkeit in Apple-Diensten |
Applebot-Extended | Apple | Steuerungs-Token: Nutzung für Apples KI-Modelle | Kein Training; Apple-Suche unberührt |
CCBot | Common Crawl | Offenes Web-Archiv, häufig für KI-Training genutzt | Nicht mehr in künftigen Common-Crawl-Datensätzen |
Bytespider | ByteDance | Datensammlung, u. a. für KI-Modelle | Wirksamkeit umstritten, siehe Stolperfallen |
meta-externalagent | Meta | Training von KI-Modellen und Indexierung | Kein Crawling durch diesen Agent |
Amazonbot | Amazon | Produktverbesserung, u. a. Alexa; ggf. KI-Training | Kein Crawling durch diesen Agent |
cohere-ai | Cohere | Datensammlung für KI-Produkte | Kein Crawling durch diesen Agent |
DuckAssistBot | DuckDuckGo | Quellen für KI-Antworten (laut Anbieter kein Training) | Keine Nutzung in DuckAssist-Antworten |
MistralAI-User | Mistral AI | Abruf auf Anweisung eines Nutzers in Le Chat | Mistral ruft die Seite für Nutzeranfragen nicht mehr ab |
Die Liste ist nicht vollständig, und Anbieter führen regelmäßig neue Agents ein – Amazon etwa dokumentiert zusätzlich Amzn-SearchBot und Amzn-User, Meta den nutzer-ausgelösten meta-externalfetcher. Prüfe die offiziellen Dokumentationen der Anbieter, bevor du Regeln für weniger bekannte Bots festlegst.
Vorlagen für deine robots.txt
Alle Vorlagen folgen der Syntax aus RFC 9309: Mehrere User-agent-Zeilen direkt untereinander bilden eine Gruppe, danach folgen die Regeln. Zwischen Gruppen steht eine Leerzeile. Passe die Sitemap-URL an.
Variante A: Alles erlauben
Maximale Sichtbarkeit in klassischen und KI-Suchen, deine Inhalte dürfen auch für Training genutzt werden.
User-agent: *
Allow: /
Sitemap: https://deine-domain.de/sitemap.xml
Variante B: Training sperren, KI-Suche erlauben
Der für die meisten Websites sinnvolle Kompromiss. Such-Bots und Nutzer-Abrufe bleiben erlaubt, weil für sie keine eigene Gruppe existiert und damit die *-Gruppe gilt.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: cohere-ai
Disallow: /
User-agent: *
Allow: /
Disallow: /admin/
Sitemap: https://deine-domain.de/sitemap.xml
Hinweis zu Amazonbot: Amazon nutzt ihn laut eigener Aussage nicht nur für Training, sondern auch zur Produktverbesserung (etwa Alexa). Ob du ihn in die Trainings-Gruppe aufnimmst, ist eine Abwägung.
Variante C: Alle KI-Bots sperren
Achtung: Mit dieser Variante verschwindest du weitgehend aus ChatGPT-Suche, Claude und Perplexity. Google AI Overviews und Copilot sind davon nicht betroffen, solange Googlebot und Bingbot erlaubt bleiben – ein vollständiger Ausschluss aus KI-Antworten ist per robots.txt also ohnehin nicht möglich.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: cohere-ai
User-agent: DuckAssistBot
User-agent: MistralAI-User
Disallow: /
User-agent: *
Allow: /
Sitemap: https://deine-domain.de/sitemap.xml
Stolperfallen
Eine eigene Gruppe ersetzt die *-Gruppe komplett
Der häufigste Fehler: Ein Crawler befolgt nur die spezifischste Gruppe, die zu seinem Namen passt. Regeln aus User-agent: * werden nicht zusätzlich angewendet. Schreibst du also
User-agent: *
Disallow: /admin/
Disallow: /checkout/
User-agent: OAI-SearchBot
Allow: /
darf OAI-SearchBot auch /admin/ und /checkout/ crawlen. Wiederhole gemeinsame Sperren in jeder spezifischen Gruppe.
Disallow: leer vs. Disallow: /
Disallow: ohne Pfad bedeutet „nichts ist gesperrt“. Disallow: / sperrt die komplette Website. Ein einzelnes Zeichen entscheidet über Sichtbarkeit oder Unsichtbarkeit.
Groß- und Kleinschreibung
Der User-Agent-Name ist nicht case-sensitiv, gptbot und GPTBot sind gleichwertig. Die Pfade in Allow und Disallow dagegen schon: /Intern/ sperrt nicht /intern/.
Die CDN- oder WAF-Einstellung überstimmt die robots.txt
Cloudflare fragt seit Juli 2025 bei neuen Domains, ob KI-Crawler zugelassen werden sollen, und bietet eine Blockierung auf Netzwerkebene an. Andere CDNs und Firewalls haben ähnliche Bot-Regeln. Ist dort eine Sperre aktiv, erhalten auch Such-Bots eine Fehlerseite – egal, was in deiner robots.txt steht. Prüfe also bei „unerklärlicher“ KI-Unsichtbarkeit auch die Bot-Einstellungen deines Hosters.
robots.txt ist keine Zugriffskontrolle
Die robots.txt ist eine Bitte, keine technische Sperre. Seriöse Anbieter halten sich an sie, doch es gibt immer wieder Berichte über Crawler, die sie ignorieren – Bytespider wurde in der Vergangenheit häufig genannt. Wer Inhalte wirklich schützen muss, braucht Authentifizierung oder serverseitige Sperren nach User-Agent und IP-Bereich. Die meisten großen Anbieter veröffentlichen dafür ihre IP-Bereiche.
robots.txt und noindex verwechseln
Eine per robots.txt gesperrte URL kann trotzdem im Index auftauchen, wenn andere Seiten auf sie verlinken – nur ohne Inhalt. Umgekehrt sieht ein Crawler ein noindex nur, wenn er die Seite abrufen darf. Willst du eine Seite aus Suchergebnissen entfernen, erlaube das Crawling und setze noindex. Mehr dazu im SEO-Leitfaden.
Änderungen wirken nicht sofort
Crawler speichern die robots.txt zwischen. Google aktualisiert die Kopie in der Regel innerhalb von 24 Stunden, andere Anbieter nennen ähnliche Zeiträume (DuckDuckGo spricht von bis zu 72 Stunden, Amazon von etwa 24 Stunden). Bereits gesammelte Trainingsdaten werden durch eine neue Sperre nicht rückwirkend entfernt.
Die robots.txt ist fehlerhaft oder nicht erreichbar
Liefert /robots.txt einen Serverfehler (5xx), behandeln manche Crawler die ganze Website vorübergehend als gesperrt. Ein 404 wird dagegen als „alles erlaubt“ gewertet. Achte auf Status 200 und den Content-Type text/plain.
Neben der robots.txt kannst du KI-Diensten auch eine inhaltliche Übersicht anbieten: Wie das mit einer llms.txt funktioniert und warum ihr Nutzen noch unbewiesen ist, erklären wir separat. Welche weiteren Faktoren über Zitate entscheiden, liest du in In ChatGPT & AI Overviews zitiert werden.
Der GEO-Check von PageScore wertet deine robots.txt aus und zeigt für jeden KI-Crawler, ob er deine Seite abrufen darf.
Häufige Fragen
Wie blockiere ich GPTBot?
Füge in deine robots.txt eine Gruppe User-agent: GPTBot mit Disallow: / ein. Damit schließt du deine Inhalte vom Training der OpenAI-Modelle aus. Die Suche in ChatGPT nutzt den separaten OAI-SearchBot und ist davon nicht betroffen.
Verschwinde ich aus ChatGPT, wenn ich GPTBot sperre?
Nein. Laut OpenAI steuert GPTBot nur die Nutzung für Modelltraining. Für die Anzeige in ChatGPT-Suchergebnissen ist OAI-SearchBot zuständig. Solange du diesen erlaubst, kannst du weiterhin als Quelle erscheinen.
Beeinflusst Google-Extended meine Sichtbarkeit in AI Overviews?
Nein. Google stellt klar, dass Google-Extended weder die Aufnahme in die Google-Suche noch das Ranking beeinflusst. AI Overviews und der KI-Modus basieren auf dem normalen Googlebot-Crawling. Google-Extended regelt nur die Nutzung für Gemini-Training und Grounding.
Halten sich alle KI-Crawler an die robots.txt?
Nicht immer. Die großen Anbieter dokumentieren, dass ihre Trainings- und Such-Crawler die robots.txt befolgen. Nutzer-ausgelöste Abrufe wie ChatGPT-User oder Perplexity-User können sie laut Anbieter aber ignorieren, und einzelnen Crawlern wird immer wieder Regelverstoß vorgeworfen. Für echten Schutz brauchst du serverseitige Sperren.
Wie lange dauert es, bis eine Sperre wirkt?
Typischerweise bis zu 24 Stunden, bei manchen Anbietern bis zu 72 Stunden, weil Crawler die robots.txt zwischenspeichern. Bereits gesammelte Daten werden nicht rückwirkend gelöscht.
Warum crawlt ein Bot trotz Sperre Bereiche meiner Website?
Häufigste Ursache: Du hast für den Bot eine eigene Gruppe angelegt, aber die Sperren aus der *-Gruppe dort nicht wiederholt. Ein Crawler befolgt nur die Gruppe, die am genauesten zu seinem Namen passt.