Mit der robots.txt steuern Sie einzeln, welche KI-Crawler Ihre Website lesen dürfen. Trainings-Crawler wie GPTBot und ClaudeBot können Sie sperren, ohne die Such-Crawler wie OAI-SearchBot und PerplexityBot auszuschließen; die Einstellungen sind unabhängig voneinander. Wer alle sperrt, wird in diesen KI-Suchen nicht mehr als Quelle gezeigt. Stand: Oktober 2026.
Das Wichtigste in Kürze
- Die Anbieter trennen Crawler nach Zweck: Training (GPTBot, ClaudeBot), Suchindex (OAI-SearchBot, PerplexityBot, Claude-SearchBot) und nutzerausgelöste Abrufe (ChatGPT-User, Perplexity-User, Claude-User).
- Voraussetzung für KI-Suchantworten ist, dass die Such-Crawler zugelassen sind; das Sperren der Trainings-Crawler ist davon unabhängig möglich.
Google-Extendedist kein eigener Crawler, sondern ein robots.txt-Token. Es beeinflusst weder Aufnahme noch Ranking in der Google-Suche.- Typische Fehler: ein
Disallow: /unterUser-agent: *, Gruppen für einzelne Bots, die andere Regeln überschreiben, und Bot-Schutz im CDN oder in der Firewall. - robots.txt wirkt nur bei Crawlern, die sie beachten. Sie ist kein Zugriffsschutz.
Welche KI-Crawler gibt es und was machen sie?
Die folgende Übersicht stützt sich auf die Dokumentation der Anbieter (Stand: Oktober 2026). Bei den Namen kommt es auf den Eintrag hinter User-agent: an; die Groß- und Kleinschreibung spielt dabei keine Rolle.
| Anbieter | Token | Zweck laut Anbieter |
|---|---|---|
| OpenAI | GPTBot |
Inhalte, die für das Training generativer KI-Modelle verwendet werden können |
| OpenAI | OAI-SearchBot |
Anzeige von Websites in den Suchfunktionen von ChatGPT |
| OpenAI | ChatGPT-User |
Aktionen, die Nutzer in ChatGPT auslösen; robots.txt-Regeln gelten dafür laut OpenAI möglicherweise nicht |
| Perplexity | PerplexityBot |
Websites in Perplexity-Suchergebnissen anzeigen und verlinken; beachtet robots.txt; laut Perplexity nicht für KI-Training |
| Perplexity | Perplexity-User |
Seitenabruf, wenn ein Nutzer eine Frage stellt; ignoriert robots.txt im Allgemeinen, weil nutzerausgelöst |
| Anthropic | ClaudeBot |
Sammeln von Inhalten für Training |
| Anthropic | Claude-User |
Abruf von Inhalten, wenn Claude-Nutzer Fragen stellen |
| Anthropic | Claude-SearchBot |
Indexierung von Inhalten zur Verbesserung der Suchergebnisqualität |
Google-Extended |
Steuerung, ob Inhalte für Gemini-Training und für Grounding in Gemini-Apps und Vertex AI genutzt werden | |
| Apple | Applebot-Extended |
Steuerung, ob von Applebot gecrawlte Inhalte für das Training von Apples Basismodellen genutzt werden |
| Common Crawl | CCBot |
Crawler der Organisation Common Crawl, die ein offenes Archiv von Webcrawl-Daten pflegt |
| Meta | meta-externalagent |
Training von KI-Basismodellen oder direkte Indexierung von Inhalten |
Zwei Sonderfälle sind wichtig:
- Google-Extended hat laut Google keinen eigenen User-Agent-String im HTTP-Request. Das Crawling läuft über die bestehenden Google-Crawler; das Token dient nur der Steuerung. Google schreibt, dass es die Aufnahme in die Google-Suche nicht beeinflusst und kein Ranking-Signal ist. Für AI Overviews und AI Mode nennt Google dagegen die Search-Steuerungen
nosnippet,data-nosnippet,max-snippetundnoindex. - Applebot-Extended crawlt selbst nicht. Seiten, die es ausschließen, können laut Apple weiter in Suchergebnissen erscheinen; das Token bestimmt nur, wie die von Applebot gesammelten Daten verwendet werden.
Meta dokumentiert außerdem meta-externalfetcher für Abrufe auf Nutzeranfrage; dieser kann robots.txt-Regeln laut Meta umgehen. Weitere Crawler wie Bytespider (ByteDance) werden häufig genannt. Eine Betreiberdokumentation haben wir dafür nicht geprüft und nehmen sie deshalb nicht in die Beispiele auf. Die Listen sind nicht abschließend; neue Tokens kommen dazu.
Erlauben oder sperren: Was ist die richtige Strategie?
Es geht um eine Abwägung, die nur Sie treffen können.
- Training sperren heißt: Sie signalisieren, dass Ihre Inhalte nicht zum Training genutzt werden sollen. Das ändert nichts daran, ob Suchdienste Sie anzeigen. OpenAI beschreibt die Einstellungen ausdrücklich als voneinander unabhängig.
- Such-Crawler zulassen ist Voraussetzung dafür, in den Antworten der ChatGPT-Suche und von Perplexity vorzukommen. Claude-SearchBot indexiert laut Anthropic Inhalte für die Suche. Wer OAI-SearchBot ausschließt, wird laut OpenAI nicht in Suchantworten gezeigt, kann aber weiter als Navigationslink erscheinen.
- Alles sperren schützt Inhalte maximal vor den kooperativen Crawlern, kostet aber die Sichtbarkeit in KI-Suchen.
Für viele kleine und mittlere Unternehmen, die gefunden werden wollen, ist Variante B weiter unten ein vernünftiger Mittelweg. Eine Garantie auf Nennung folgt aus keiner Variante; mehr dazu im Artikel KI-Sichtbarkeit verbessern.
Welche robots.txt passt? Drei Vorlagen zum Kopieren
Die Datei muss im Hauptverzeichnis der jeweiligen Domain liegen, zum Beispiel https://www.beispiel.de/robots.txt. Anthropic weist darauf hin, dass Regeln für jede Subdomain gesondert gesetzt werden müssen. Ersetzen Sie die Sitemap-URL durch Ihre eigene.
Variante A: Alles erlauben
User-agent: *
Disallow:
Sitemap: https://www.beispiel.de/sitemap.xml
Ein leeres Disallow: erlaubt alles. Enthält Ihre Datei bereits Regeln, etwa für /wp-admin/, behalten Sie diese und lassen die KI-Bots einfach unerwähnt.
Variante B: Such- und Zitier-Crawler erlauben, Trainings-Crawler sperren
# Trainings-Crawler sperren
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
Disallow: /
# Such- und nutzerausgelöste Crawler erlauben
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
Allow: /
# Alle anderen
User-agent: *
Disallow:
Sitemap: https://www.beispiel.de/sitemap.xml
Mehrere User-agent-Zeilen direkt untereinander bilden eine gemeinsame Gruppe, für die die folgenden Regeln gelten. Beachten Sie: meta-externalagent nennt Meta für Training und für die Indexierung; wenn Sie in Metas KI-Angeboten vorkommen wollen, lassen Sie diese Zeile weg. Google-Extended zu sperren ändert nichts an Ihrer Platzierung in der Google-Suche.
Variante C: Alle genannten KI-Crawler sperren
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
Disallow: /
User-agent: *
Disallow:
Der Googlebot der normalen Suche bleibt dabei unberührt. Rechnen Sie aber damit, in den KI-Suchen der betroffenen Anbieter nicht mehr als Quelle zu erscheinen.
Welche Fehler sollten Sie vermeiden?
Disallow: /unterUser-agent: *. Das sperrt alle Crawler, die robots.txt beachten, auch Google. Eine mögliche Ursache ist eine Entwicklungs- oder Staging-Version, die live ging. Bei WordPress erzeugt die Option „Suchmaschinen davon abhalten, diese Website zu indexieren“ seit Version 5.3 einnoindex-Meta-Tag; bis Version 5.2 setzte sie genau diese robots.txt-Regel.- Eine Bot-Gruppe überschreibt die allgemeine Gruppe. Ein Crawler befolgt die Gruppe, die am genauesten zu seinem Namen passt. Steht unter
User-agent: *einDisallow: /intern/und unterUser-agent: GPTBotnurAllow: /, gilt für GPTBot die Sperre von/intern/nicht. Wiederholen Sie bei Bedarf die Regeln in jeder Bot-Gruppe. - Firewall oder CDN blockt trotzdem. Die robots.txt kann den Bot erlauben, während ein Bot-Schutz ihn abweist. Perplexity und OpenAI empfehlen, die Crawler über User-Agent und veröffentlichte IP-Adressbereiche freizugeben. Anthropic warnt, dass reines IP-Blocking keinen verlässlichen Opt-out garantiert.
- Plugins und Hoster setzen Regeln. Prüfen Sie nach Updates oder Hosterwechseln die ausgelieferte Datei, nicht nur die Einstellungen im Backend.
- Erwartung, robots.txt sei Zugriffsschutz. Der Standard (RFC 9309) sagt selbst, dass diese Regeln keine Form der Zugangsberechtigung sind. Nutzerausgelöste Abrufe wie ChatGPT-User, Perplexity-User oder meta-externalfetcher richten sich laut Anbietern nicht zwingend danach. Vertrauliche Inhalte gehören hinter ein Login.
- Zu schnelle Erwartung. Laut OpenAI kann es etwa 24 Stunden dauern, bis eine geänderte robots.txt bei den Systemen ankommt.
Wie testen Sie, ob es funktioniert?
- Öffnen Sie
https://ihre-domain.de/robots.txtim Browser und lesen Sie die Datei vollständig. Sie muss ohne Fehlerseite erreichbar sein. - Prüfen Sie die Gruppen: Steht für jeden gewünschten Bot die richtige Regel, und überschreibt keine Bot-Gruppe eine allgemeine Sperre unbeabsichtigt?
- Der kostenlose KI-Crawler-Check liest Ihre robots.txt und zeigt je Crawler, ob er die Startseite laden darf.
- Testen Sie den Bot-Schutz mit einem Aufruf unter dem Bot-Namen, etwa
curl -I -A "OAI-SearchBot" https://ihre-domain.de/. Eine Fehlerantwort wie 403 deutet auf eine Sperre im Server oder CDN hin. Das prüft nur den User-Agent, nicht die IP-Bereiche. - Werten Sie Server-Logs aus und gleichen Sie Zugriffe mit den IP-Listen der Anbieter ab, etwa
openai.com/searchbot.json,perplexity.com/perplexitybot.jsonoderclaude.com/crawling/bots.json.
Häufige Fragen
Soll ich GPTBot sperren?
Das hängt davon ab, ob Sie Ihre Inhalte vom KI-Training ausnehmen möchten. Laut OpenAI signalisiert das Sperren von GPTBot, dass Inhalte nicht für das Training verwendet werden sollen. Es wirkt unabhängig von OAI-SearchBot, mit dem Sie in ChatGPT-Suchantworten erscheinen können.
Beeinflusst Google-Extended mein Google-Ranking?
Nein. Google stellt klar, dass Google-Extended die Aufnahme in die Google-Suche nicht beeinflusst und kein Ranking-Signal ist. Das Token steuert die Nutzung für Gemini-Training und Grounding in Gemini-Apps und Vertex AI.
Was ist der Unterschied zwischen PerplexityBot und Perplexity-User?
PerplexityBot dient dem Anzeigen und Verlinken von Websites in Suchergebnissen und beachtet die robots.txt. Perplexity-User ruft eine Seite ab, wenn ein Nutzer eine Frage stellt, und ignoriert die robots.txt laut Perplexity im Allgemeinen.
Wie schnell wirkt eine Änderung der robots.txt?
OpenAI nennt für OAI-SearchBot etwa 24 Stunden, bis seine Systeme eine Änderung berücksichtigen. Planen Sie bei anderen Anbietern ähnlich großzügig.
Schützt die robots.txt meine Inhalte wirklich?
Nur vor Crawlern, die sie beachten. Sie ist keine Zugriffskontrolle, und nutzerausgelöste Abrufe können sie umgehen. Wirklich geschützte Inhalte gehören hinter eine Anmeldung.
Quellen
- OpenAI: Overview of OpenAI crawlers – abgerufen am 2026-10-07
- Perplexity: Perplexity Crawlers – abgerufen am 2026-10-07
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler? – abgerufen am 2026-10-07
- Google Search Central: Google's common crawlers – abgerufen am 2026-10-07
- Google Search Central: AI features and your website – abgerufen am 2026-10-07
- Google Search Central: How Google interprets the robots.txt specification – abgerufen am 2026-10-07
- RFC 9309: Robots Exclusion Protocol – abgerufen am 2026-10-07
- Apple: About Applebot – abgerufen am 2026-10-07
- Common Crawl: CCBot – abgerufen am 2026-10-07
- Meta: Web crawlers – abgerufen am 2026-10-07
- WordPress: Settings Reading Screen – abgerufen am 2026-10-07