Zum Inhalt springen
seonautik

GEO

robots.txt für KI-Crawler: GPTBot & Co. erlauben oder sperren

Stand 7. Oktober 2026 · 8 Min. Lesezeit · That Works Media UG (haftungsbeschränkt)

Mit der robots.txt steuern Sie einzeln, welche KI-Crawler Ihre Website lesen dürfen. Trainings-Crawler wie GPTBot und ClaudeBot können Sie sperren, ohne die Such-Crawler wie OAI-SearchBot und PerplexityBot auszuschließen; die Einstellungen sind unabhängig voneinander. Wer alle sperrt, wird in diesen KI-Suchen nicht mehr als Quelle gezeigt. Stand: Oktober 2026.

Das Wichtigste in Kürze

  • Die Anbieter trennen Crawler nach Zweck: Training (GPTBot, ClaudeBot), Suchindex (OAI-SearchBot, PerplexityBot, Claude-SearchBot) und nutzerausgelöste Abrufe (ChatGPT-User, Perplexity-User, Claude-User).
  • Voraussetzung für KI-Suchantworten ist, dass die Such-Crawler zugelassen sind; das Sperren der Trainings-Crawler ist davon unabhängig möglich.
  • Google-Extended ist kein eigener Crawler, sondern ein robots.txt-Token. Es beeinflusst weder Aufnahme noch Ranking in der Google-Suche.
  • Typische Fehler: ein Disallow: / unter User-agent: *, Gruppen für einzelne Bots, die andere Regeln überschreiben, und Bot-Schutz im CDN oder in der Firewall.
  • robots.txt wirkt nur bei Crawlern, die sie beachten. Sie ist kein Zugriffsschutz.

Welche KI-Crawler gibt es und was machen sie?

Die folgende Übersicht stützt sich auf die Dokumentation der Anbieter (Stand: Oktober 2026). Bei den Namen kommt es auf den Eintrag hinter User-agent: an; die Groß- und Kleinschreibung spielt dabei keine Rolle.

Anbieter Token Zweck laut Anbieter
OpenAI GPTBot Inhalte, die für das Training generativer KI-Modelle verwendet werden können
OpenAI OAI-SearchBot Anzeige von Websites in den Suchfunktionen von ChatGPT
OpenAI ChatGPT-User Aktionen, die Nutzer in ChatGPT auslösen; robots.txt-Regeln gelten dafür laut OpenAI möglicherweise nicht
Perplexity PerplexityBot Websites in Perplexity-Suchergebnissen anzeigen und verlinken; beachtet robots.txt; laut Perplexity nicht für KI-Training
Perplexity Perplexity-User Seitenabruf, wenn ein Nutzer eine Frage stellt; ignoriert robots.txt im Allgemeinen, weil nutzerausgelöst
Anthropic ClaudeBot Sammeln von Inhalten für Training
Anthropic Claude-User Abruf von Inhalten, wenn Claude-Nutzer Fragen stellen
Anthropic Claude-SearchBot Indexierung von Inhalten zur Verbesserung der Suchergebnisqualität
Google Google-Extended Steuerung, ob Inhalte für Gemini-Training und für Grounding in Gemini-Apps und Vertex AI genutzt werden
Apple Applebot-Extended Steuerung, ob von Applebot gecrawlte Inhalte für das Training von Apples Basismodellen genutzt werden
Common Crawl CCBot Crawler der Organisation Common Crawl, die ein offenes Archiv von Webcrawl-Daten pflegt
Meta meta-externalagent Training von KI-Basismodellen oder direkte Indexierung von Inhalten

Zwei Sonderfälle sind wichtig:

  • Google-Extended hat laut Google keinen eigenen User-Agent-String im HTTP-Request. Das Crawling läuft über die bestehenden Google-Crawler; das Token dient nur der Steuerung. Google schreibt, dass es die Aufnahme in die Google-Suche nicht beeinflusst und kein Ranking-Signal ist. Für AI Overviews und AI Mode nennt Google dagegen die Search-Steuerungen nosnippet, data-nosnippet, max-snippet und noindex.
  • Applebot-Extended crawlt selbst nicht. Seiten, die es ausschließen, können laut Apple weiter in Suchergebnissen erscheinen; das Token bestimmt nur, wie die von Applebot gesammelten Daten verwendet werden.

Meta dokumentiert außerdem meta-externalfetcher für Abrufe auf Nutzeranfrage; dieser kann robots.txt-Regeln laut Meta umgehen. Weitere Crawler wie Bytespider (ByteDance) werden häufig genannt. Eine Betreiberdokumentation haben wir dafür nicht geprüft und nehmen sie deshalb nicht in die Beispiele auf. Die Listen sind nicht abschließend; neue Tokens kommen dazu.

Erlauben oder sperren: Was ist die richtige Strategie?

Es geht um eine Abwägung, die nur Sie treffen können.

  • Training sperren heißt: Sie signalisieren, dass Ihre Inhalte nicht zum Training genutzt werden sollen. Das ändert nichts daran, ob Suchdienste Sie anzeigen. OpenAI beschreibt die Einstellungen ausdrücklich als voneinander unabhängig.
  • Such-Crawler zulassen ist Voraussetzung dafür, in den Antworten der ChatGPT-Suche und von Perplexity vorzukommen. Claude-SearchBot indexiert laut Anthropic Inhalte für die Suche. Wer OAI-SearchBot ausschließt, wird laut OpenAI nicht in Suchantworten gezeigt, kann aber weiter als Navigationslink erscheinen.
  • Alles sperren schützt Inhalte maximal vor den kooperativen Crawlern, kostet aber die Sichtbarkeit in KI-Suchen.

Für viele kleine und mittlere Unternehmen, die gefunden werden wollen, ist Variante B weiter unten ein vernünftiger Mittelweg. Eine Garantie auf Nennung folgt aus keiner Variante; mehr dazu im Artikel KI-Sichtbarkeit verbessern.

Welche robots.txt passt? Drei Vorlagen zum Kopieren

Die Datei muss im Hauptverzeichnis der jeweiligen Domain liegen, zum Beispiel https://www.beispiel.de/robots.txt. Anthropic weist darauf hin, dass Regeln für jede Subdomain gesondert gesetzt werden müssen. Ersetzen Sie die Sitemap-URL durch Ihre eigene.

Variante A: Alles erlauben

User-agent: *
Disallow:

Sitemap: https://www.beispiel.de/sitemap.xml

Ein leeres Disallow: erlaubt alles. Enthält Ihre Datei bereits Regeln, etwa für /wp-admin/, behalten Sie diese und lassen die KI-Bots einfach unerwähnt.

Variante B: Such- und Zitier-Crawler erlauben, Trainings-Crawler sperren

# Trainings-Crawler sperren
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
Disallow: /

# Such- und nutzerausgelöste Crawler erlauben
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
Allow: /

# Alle anderen
User-agent: *
Disallow:

Sitemap: https://www.beispiel.de/sitemap.xml

Mehrere User-agent-Zeilen direkt untereinander bilden eine gemeinsame Gruppe, für die die folgenden Regeln gelten. Beachten Sie: meta-externalagent nennt Meta für Training und für die Indexierung; wenn Sie in Metas KI-Angeboten vorkommen wollen, lassen Sie diese Zeile weg. Google-Extended zu sperren ändert nichts an Ihrer Platzierung in der Google-Suche.

Variante C: Alle genannten KI-Crawler sperren

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
Disallow: /

User-agent: *
Disallow:

Der Googlebot der normalen Suche bleibt dabei unberührt. Rechnen Sie aber damit, in den KI-Suchen der betroffenen Anbieter nicht mehr als Quelle zu erscheinen.

Welche Fehler sollten Sie vermeiden?

  1. Disallow: / unter User-agent: *. Das sperrt alle Crawler, die robots.txt beachten, auch Google. Eine mögliche Ursache ist eine Entwicklungs- oder Staging-Version, die live ging. Bei WordPress erzeugt die Option „Suchmaschinen davon abhalten, diese Website zu indexieren“ seit Version 5.3 ein noindex-Meta-Tag; bis Version 5.2 setzte sie genau diese robots.txt-Regel.
  2. Eine Bot-Gruppe überschreibt die allgemeine Gruppe. Ein Crawler befolgt die Gruppe, die am genauesten zu seinem Namen passt. Steht unter User-agent: * ein Disallow: /intern/ und unter User-agent: GPTBot nur Allow: /, gilt für GPTBot die Sperre von /intern/ nicht. Wiederholen Sie bei Bedarf die Regeln in jeder Bot-Gruppe.
  3. Firewall oder CDN blockt trotzdem. Die robots.txt kann den Bot erlauben, während ein Bot-Schutz ihn abweist. Perplexity und OpenAI empfehlen, die Crawler über User-Agent und veröffentlichte IP-Adressbereiche freizugeben. Anthropic warnt, dass reines IP-Blocking keinen verlässlichen Opt-out garantiert.
  4. Plugins und Hoster setzen Regeln. Prüfen Sie nach Updates oder Hosterwechseln die ausgelieferte Datei, nicht nur die Einstellungen im Backend.
  5. Erwartung, robots.txt sei Zugriffsschutz. Der Standard (RFC 9309) sagt selbst, dass diese Regeln keine Form der Zugangsberechtigung sind. Nutzerausgelöste Abrufe wie ChatGPT-User, Perplexity-User oder meta-externalfetcher richten sich laut Anbietern nicht zwingend danach. Vertrauliche Inhalte gehören hinter ein Login.
  6. Zu schnelle Erwartung. Laut OpenAI kann es etwa 24 Stunden dauern, bis eine geänderte robots.txt bei den Systemen ankommt.

Wie testen Sie, ob es funktioniert?

  1. Öffnen Sie https://ihre-domain.de/robots.txt im Browser und lesen Sie die Datei vollständig. Sie muss ohne Fehlerseite erreichbar sein.
  2. Prüfen Sie die Gruppen: Steht für jeden gewünschten Bot die richtige Regel, und überschreibt keine Bot-Gruppe eine allgemeine Sperre unbeabsichtigt?
  3. Der kostenlose KI-Crawler-Check liest Ihre robots.txt und zeigt je Crawler, ob er die Startseite laden darf.
  4. Testen Sie den Bot-Schutz mit einem Aufruf unter dem Bot-Namen, etwa curl -I -A "OAI-SearchBot" https://ihre-domain.de/. Eine Fehlerantwort wie 403 deutet auf eine Sperre im Server oder CDN hin. Das prüft nur den User-Agent, nicht die IP-Bereiche.
  5. Werten Sie Server-Logs aus und gleichen Sie Zugriffe mit den IP-Listen der Anbieter ab, etwa openai.com/searchbot.json, perplexity.com/perplexitybot.json oder claude.com/crawling/bots.json.

Häufige Fragen

Soll ich GPTBot sperren?

Das hängt davon ab, ob Sie Ihre Inhalte vom KI-Training ausnehmen möchten. Laut OpenAI signalisiert das Sperren von GPTBot, dass Inhalte nicht für das Training verwendet werden sollen. Es wirkt unabhängig von OAI-SearchBot, mit dem Sie in ChatGPT-Suchantworten erscheinen können.

Beeinflusst Google-Extended mein Google-Ranking?

Nein. Google stellt klar, dass Google-Extended die Aufnahme in die Google-Suche nicht beeinflusst und kein Ranking-Signal ist. Das Token steuert die Nutzung für Gemini-Training und Grounding in Gemini-Apps und Vertex AI.

Was ist der Unterschied zwischen PerplexityBot und Perplexity-User?

PerplexityBot dient dem Anzeigen und Verlinken von Websites in Suchergebnissen und beachtet die robots.txt. Perplexity-User ruft eine Seite ab, wenn ein Nutzer eine Frage stellt, und ignoriert die robots.txt laut Perplexity im Allgemeinen.

Wie schnell wirkt eine Änderung der robots.txt?

OpenAI nennt für OAI-SearchBot etwa 24 Stunden, bis seine Systeme eine Änderung berücksichtigen. Planen Sie bei anderen Anbietern ähnlich großzügig.

Schützt die robots.txt meine Inhalte wirklich?

Nur vor Crawlern, die sie beachten. Sie ist keine Zugriffskontrolle, und nutzerausgelöste Abrufe können sie umgehen. Wirklich geschützte Inhalte gehören hinter eine Anmeldung.

Quellen