Datenstudie · Oktober 2026
26,4 % von 870 gemessenen .de-Websites sperren mindestens einen KI-Crawler
Von 870 untersuchten Websites sperren 230 (26,4 %) mindestens einen von 10 KI-Crawlern in der robots.txt. 168 (19,3 %) sperren mindestens einen Such- oder Antwort-Crawler. Eine llms.txt haben 66 (7,6 %).
Grundlage: robots.txt der 1.000 meistbesuchten .de-Domains der Tranco-Liste (Liste PY35J, Stand 2026-10-08), abgerufen am 9.10.2026. Bei 130 Domains war die robots.txt nicht abrufbar, sie sind in den Prozentwerten nicht enthalten.
- 26,4 %
- sperren mindestens einen KI-Crawler
- 19,3 %
- sperren mindestens einen Such- oder Antwort-Crawler
- 7,6 %
- haben eine llms.txt
Welche Crawler am häufigsten gesperrt werden
| Crawler | Zweck | Gesperrt | Anteil | Davon namentlich |
|---|---|---|---|---|
| GPTBotOpenAI (Training) | Training | 186 | 21,4 % | 170 |
| CCBotCommon Crawl | Training | 185 | 21,3 % | 166 |
| BytespiderByteDance | Training | 175 | 20,1 % | 156 |
| ClaudeBotAnthropic Claude | Training | 160 | 18,4 % | 143 |
| meta-externalagentMeta AI | Training | 139 | 16 % | 120 |
| Google-ExtendedGoogle Gemini (Training/Grounding) | Suche und Antwort | 136 | 15,6 % | 119 |
| Applebot-ExtendedApple Intelligence | Training | 132 | 15,2 % | 113 |
| PerplexityBotPerplexity | Suche und Antwort | 97 | 11,1 % | 90 |
| ChatGPT-UserChatGPT Browsing | Suche und Antwort | 88 | 10,1 % | 78 |
| OAI-SearchBotChatGPT Search | Suche und Antwort | 55 | 6,3 % | 44 |
„Namentlich“ heißt: ein Eintrag in der robots.txt nennt den Crawler ausdrücklich. Der Rest ist durch eine allgemeine Regel gesperrt (User-agent: *). Nur 4 Websites (0,5 %) sperren über diese allgemeine Regel alles.
Unterschied nach Beliebtheit
| Rang unter den .de-Domains | Gemessen | Mindestens ein Crawler gesperrt |
|---|---|---|
| 1 bis 250 | 223 | 26,5 % |
| 251 bis 500 | 221 | 30,8 % |
| 501 bis 750 | 218 | 24,3 % |
| 751 bis 1000 | 208 | 24 % |
Was die Zahlen bedeuten
- Training sperren ist eine legitime Entscheidung. Wer GPTBot oder ClaudeBot sperrt, signalisiert, dass Inhalte nicht für das Training verwendet werden sollen. Das ändert nichts daran, ob Suchdienste die Seite anzeigen.
- Such- und Antwort-Crawler zu sperren hat eine andere Folge. Wer OAI-SearchBot oder PerplexityBot aussperrt, wird in den KI-Suchen dieser Anbieter nicht als Quelle gezeigt. Bei 168 Websites ist mindestens einer davon gesperrt, oft vermutlich ohne diese Absicht.
- Die robots.txt wirkt nur bei Crawlern, die sie beachten. Sie ist kein Zugriffsschutz, und Firewalls oder CDN-Regeln können Crawler unabhängig davon blockieren. Das misst diese Studie nicht.
Wie es bei Ihrer Website aussieht, zeigt der kostenlose KI-Crawler-Check. Wie Sie die robots.txt anpassen, steht im Ratgeber robots.txt für KI-Crawler.
Methode und Grenzen
- Stichprobe: die ersten 1.000 Domains mit der Endung .de in der Tranco-Liste (Rangliste der meistbesuchten Websites, kombiniert aus mehreren Datenquellen), jeweils die registrierbare Domain.
- Abruf: ein Aufruf von https://domain/robots.txt je Domain und ein Aufruf von /llms.txt. Unser Crawler SeonautikBot gibt sich zu erkennen (/bot) und beachtet die robots.txt.
- Wertung: Ein KI-Crawler gilt als gesperrt, wenn die robots.txt ihm den Zugriff auf die Startseite („/“) verbietet. Dieselbe Regel nutzt der KI-Crawler-Check im Report. Geprüft werden 10 Crawler: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended, CCBot, Bytespider, meta-externalagent. Als Such- und Antwort-Crawler zählen OAI-SearchBot, ChatGPT-User, PerplexityBot und Google-Extended (ein Steuerelement für Gemini, kein eigener Crawler), als Trainings-Crawler die übrigen.
- Keine robots.txt oder eine Fehlerseite im Browserformat bedeutet: keine Einschränkung. Antworten mit Statuscode 4xx werden nach RFC 9309 als „keine Regeln“ gewertet, auch wenn manche Server damit tatsächlich unseren Abruf abweisen. Domains mit Serverfehler, Zeitüberschreitung oder Netzwerkfehler gelten als nicht messbar und werden ausgelassen.
- Grenzen: Die Stichprobe zeigt große, viel besuchte Websites und ist nicht repräsentativ für alle deutschen Websites, insbesondere nicht für kleine Unternehmen. Sie misst, was in der robots.txt steht, nicht, ob ein Crawler tatsächlich zugreift. Unterseiten-Regeln werden nicht ausgewertet.
Zitieren und Daten
Die Zahlen dürfen mit Quellenangabe verwendet werden: seonautik.de: KI-Crawler und deutsche Websites, Oktober 2026. https://seonautik.de/studie/ki-crawler-sperren
Rohzahlen je Crawler als CSV herunterladen. Fragen von Redaktionen beantworten wir unter hallo@seonautik.de. Die Studie wird einmal im Monat mit der aktuellen Liste wiederholt.