Zum Inhalt springen
seonautik

Datenstudie · Oktober 2026

26,4 % von 870 gemessenen .de-Websites sperren mindestens einen KI-Crawler

Von 870 untersuchten Websites sperren 230 (26,4 %) mindestens einen von 10 KI-Crawlern in der robots.txt. 168 (19,3 %) sperren mindestens einen Such- oder Antwort-Crawler. Eine llms.txt haben 66 (7,6 %).

Grundlage: robots.txt der 1.000 meistbesuchten .de-Domains der Tranco-Liste (Liste PY35J, Stand 2026-10-08), abgerufen am 9.10.2026. Bei 130 Domains war die robots.txt nicht abrufbar, sie sind in den Prozentwerten nicht enthalten.

26,4 %
sperren mindestens einen KI-Crawler
19,3 %
sperren mindestens einen Such- oder Antwort-Crawler
7,6 %
haben eine llms.txt

Welche Crawler am häufigsten gesperrt werden

Anteil der Websites, die den jeweiligen KI-Crawler in der robots.txt sperren
CrawlerZweckGesperrtAnteilDavon namentlich
GPTBotOpenAI (Training)Training186
21,4 %
170
CCBotCommon CrawlTraining185
21,3 %
166
BytespiderByteDanceTraining175
20,1 %
156
ClaudeBotAnthropic ClaudeTraining160
18,4 %
143
meta-externalagentMeta AITraining139
16 %
120
Google-ExtendedGoogle Gemini (Training/Grounding)Suche und Antwort136
15,6 %
119
Applebot-ExtendedApple IntelligenceTraining132
15,2 %
113
PerplexityBotPerplexitySuche und Antwort97
11,1 %
90
ChatGPT-UserChatGPT BrowsingSuche und Antwort88
10,1 %
78
OAI-SearchBotChatGPT SearchSuche und Antwort55
6,3 %
44

„Namentlich“ heißt: ein Eintrag in der robots.txt nennt den Crawler ausdrücklich. Der Rest ist durch eine allgemeine Regel gesperrt (User-agent: *). Nur 4 Websites (0,5 %) sperren über diese allgemeine Regel alles.

Unterschied nach Beliebtheit

Anteil der Websites mit mindestens einem gesperrten KI-Crawler nach Rangbereich innerhalb der .de-Domains
Rang unter den .de-DomainsGemessenMindestens ein Crawler gesperrt
1 bis 25022326,5 %
251 bis 50022130,8 %
501 bis 75021824,3 %
751 bis 100020824 %

Was die Zahlen bedeuten

  • Training sperren ist eine legitime Entscheidung. Wer GPTBot oder ClaudeBot sperrt, signalisiert, dass Inhalte nicht für das Training verwendet werden sollen. Das ändert nichts daran, ob Suchdienste die Seite anzeigen.
  • Such- und Antwort-Crawler zu sperren hat eine andere Folge. Wer OAI-SearchBot oder PerplexityBot aussperrt, wird in den KI-Suchen dieser Anbieter nicht als Quelle gezeigt. Bei 168 Websites ist mindestens einer davon gesperrt, oft vermutlich ohne diese Absicht.
  • Die robots.txt wirkt nur bei Crawlern, die sie beachten. Sie ist kein Zugriffsschutz, und Firewalls oder CDN-Regeln können Crawler unabhängig davon blockieren. Das misst diese Studie nicht.

Wie es bei Ihrer Website aussieht, zeigt der kostenlose KI-Crawler-Check. Wie Sie die robots.txt anpassen, steht im Ratgeber robots.txt für KI-Crawler.

Methode und Grenzen

  1. Stichprobe: die ersten 1.000 Domains mit der Endung .de in der Tranco-Liste (Rangliste der meistbesuchten Websites, kombiniert aus mehreren Datenquellen), jeweils die registrierbare Domain.
  2. Abruf: ein Aufruf von https://domain/robots.txt je Domain und ein Aufruf von /llms.txt. Unser Crawler SeonautikBot gibt sich zu erkennen (/bot) und beachtet die robots.txt.
  3. Wertung: Ein KI-Crawler gilt als gesperrt, wenn die robots.txt ihm den Zugriff auf die Startseite („/“) verbietet. Dieselbe Regel nutzt der KI-Crawler-Check im Report. Geprüft werden 10 Crawler: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended, CCBot, Bytespider, meta-externalagent. Als Such- und Antwort-Crawler zählen OAI-SearchBot, ChatGPT-User, PerplexityBot und Google-Extended (ein Steuerelement für Gemini, kein eigener Crawler), als Trainings-Crawler die übrigen.
  4. Keine robots.txt oder eine Fehlerseite im Browserformat bedeutet: keine Einschränkung. Antworten mit Statuscode 4xx werden nach RFC 9309 als „keine Regeln“ gewertet, auch wenn manche Server damit tatsächlich unseren Abruf abweisen. Domains mit Serverfehler, Zeitüberschreitung oder Netzwerkfehler gelten als nicht messbar und werden ausgelassen.
  5. Grenzen: Die Stichprobe zeigt große, viel besuchte Websites und ist nicht repräsentativ für alle deutschen Websites, insbesondere nicht für kleine Unternehmen. Sie misst, was in der robots.txt steht, nicht, ob ein Crawler tatsächlich zugreift. Unterseiten-Regeln werden nicht ausgewertet.

Zitieren und Daten

Die Zahlen dürfen mit Quellenangabe verwendet werden: seonautik.de: KI-Crawler und deutsche Websites, Oktober 2026. https://seonautik.de/studie/ki-crawler-sperren

Rohzahlen je Crawler als CSV herunterladen. Fragen von Redaktionen beantworten wir unter hallo@seonautik.de. Die Studie wird einmal im Monat mit der aktuellen Liste wiederholt.