KI-Crawler-Blockade-Report 2026
Welche KI-Crawler sperren Websites aus, und welche lassen sie herein? Gemessen an 1.349 echten robots.txt-Dateien, nicht per Umfrage.
Stichprobe: 1.349 robots.txt-Dateien, von 1.769 gescannten Domains · Scans vom 19.09.2026 bis 22.09.2026 · Neu berechnet am 25.09.2026
Von den 1.349 robots.txt-Dateien, die AIVIS ausgewertet hat, sperren 11,4 % mindestens einen KI-Crawler für die gesamte Website, und 1,4 % sperren alle 13 erfassten Crawler. Die große Mehrheit lässt jeden KI-Crawler frei lesen.
Gesperrt wird vor allem das Modelltraining, weit seltener die Antworten: 11,4 % der Websites sperren mindestens einen Trainings-Crawler, aber nur 5,8 % einen KI-Such-Crawler und 5,6 % die Abrufe, die ein Assistent startet, wenn ein Nutzer ihn bittet, eine Seite zu öffnen. 5,1 % sperren ausschließlich Trainings-Crawler und lassen KI-Suche und Abrufe auf Anfrage offen.
Unter den Branchen mit ausreichend vielen Domains sperrt Nachrichten & Medien am häufigsten (50,9 % der robots.txt-Dateien schließen mindestens einen KI-Crawler aus) und Universitäten am seltensten (0 %).
Sperrquote nach Crawler
Anteil der 1.349 robots.txt-Dateien, die dem jeweiligen Crawler die gesamte Website verbieten.
| Crawler (User-Agent) | Betreiber | Zweck | Gesperrt von |
|---|---|---|---|
CCBot | Common Crawl | Modelltraining | 8,9 % |
Bytespider | ByteDance | Modelltraining | 8,6 % |
GPTBot | OpenAI | Modelltraining | 7,6 % |
ClaudeBot | Anthropic | Modelltraining | 7,3 % |
Google-Extended | Modelltraining | 6,7 % | |
anthropic-ai | Anthropic | Modelltraining | 6,6 % |
Applebot-Extended | Apple | Modelltraining | 6,6 % |
Meta-ExternalAgent | Meta | Modelltraining | 6,5 % |
PerplexityBot | Perplexity | KI-Suchindex | 5,6 % |
ChatGPT-User | OpenAI | Abruf auf Nutzeranfrage | 4,1 % |
Perplexity-User | Perplexity | Abruf auf Nutzeranfrage | 3,9 % |
Claude-User | Anthropic | Abruf auf Nutzeranfrage | 3,6 % |
OAI-SearchBot | OpenAI | KI-Suchindex | 3 % |
KI-Crawler-Sperren nach Branche
Anteil der robots.txt-Dateien jeder Branche, die mindestens einen KI-Crawler sperren, und die vier meistgefragten Crawler.
| Branche | robots.txt | Mind. ein KI-Crawler | GPTBot | ClaudeBot | PerplexityBot | Google-Extended |
|---|---|---|---|---|---|---|
| Alle Websites | 1.349 | 11,4 % | 7,6 % | 7,3 % | 5,6 % | 6,7 % |
| SaaS & Software | 119 | 7,6 % | 0,8 % | 0,8 % | 0 % | 0,8 % |
| Nachrichten & Medien | 57 | 50,9 % | 38,6 % | 35,1 % | 31,6 % | 33,3 % |
| Universitäten | 46 | 0 % | 0 % | 0 % | 0 % | 0 % |
| E-Commerce | 36 | 11,1 % | 8,3 % | 5,6 % | 0 % | 8,3 % |
| Banken & Finanzen | 25 | 16 % | 8 % | 4 % | 4 % | 8 % |
| Öffentlicher Sektor | 23 | 8,7 % | 8,7 % | 4,3 % | 8,7 % | 4,3 % |
| Hotels & Pensionen | 12 | 8,3 % | 8,3 % | 8,3 % | 0 % | 8,3 % |
| Automotive | 10 | 20 % | 20 % | 20 % | 10 % | 20 % |
| Telekom & Versorger(kleine Stichprobe) | 8 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Restaurants(kleine Stichprobe) | 8 | 50 % | 25 % | 37,5 % | 25 % | 37,5 % |
| Reisen & Verkehr(kleine Stichprobe) | 6 | 33,3 % | 0 % | 0 % | 0 % | 0 % |
| Immobilienmakler(kleine Stichprobe) | 6 | 16,7 % | 16,7 % | 0 % | 0 % | 0 % |
| Webagenturen(kleine Stichprobe) | 4 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Kanzleien & Freiberufler(kleine Stichprobe) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Handwerker & lokale Geschäfte(kleine Stichprobe) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
Die Branche vergibt der AIVIS-Klassifikator anhand des Startseiteninhalts: 390 der 1.769 Domains haben eine, die übrigen zählen in den Gesamtwerten, aber nicht in dieser Tabelle. Branchen mit weniger als 10 robots.txt-Dateien sind ausgegraut und im Datensatz als low_sample markiert: zu wenige, um die Branche abzubilden.
Methodik
- Stichprobe: der jeweils letzte Scan jeder Domain im AIVIS-Korpus (1.769 Domains, gescannt zwischen 19.09.2026 und 22.09.2026). Basis sind die 1.349 Domains, die eine robots.txt ausliefern (76,3 % des Korpus): Eine Website ohne robots.txt setzt keinerlei Beschränkung und bleibt aus den Prozentwerten heraus, statt als offen gezählt zu werden.
- Messung: Für jedes der 13 User-Agent-Tokens wird die robots.txt nach den Standardregeln für Gruppenzuordnung (RFC 9309) ausgewertet — die Gruppe, die das Token nennt, oder sonst die allgemeine Gruppe „User-agent: *“. Ein Crawler gilt als gesperrt, wenn ihm das Stammverzeichnis „/“ verboten ist. Regeln, die nur einzelne Ordner sperren, zählen nicht als Sperre.
- Der Zweck folgt der Dokumentation des jeweiligen Betreibers: Trainings-Crawler sammeln Daten für Modelle (GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent); KI-Such-Crawler bauen den Index auf, den Antworten zitieren (OAI-SearchBot, PerplexityBot); Abrufe auf Nutzeranfrage öffnen eine Seite, wenn eine Person den Assistenten darum bittet (ChatGPT-User, Claude-User, Perplexity-User). anthropic-ai ist ein älteres Token, das viele robots.txt-Dateien noch aufführen.
- Grenzen: Die robots.txt ist eine Erklärung, keine technische Sperre. Firewalls und Bot-Schutz von CDNs können Crawler abweisen, die die robots.txt erlaubt, und manche Crawler ignorieren sie; dieser Report misst nur die erklärte Richtlinie.
- Verhältnis zum AI Readiness Index: Der Index misst Sperren über alle gescannten Domains, auch über jene ohne robots.txt; dieser Report nimmt die robots.txt-Dateien als Basis, seine Prozentwerte sind daher per Definition höher. Beide werden live aus denselben Scans berechnet.
Datensatz herunterladen
Gesamtwerte, die Quote jedes Crawlers und jede Branchenzeile dieses Reports, live neu berechnet, während der Korpus wächst.
Lizenziert unter CC-BY 4.0 — frei nutzbar mit Nennung von AIVIS.
Zitieren als: AIVIS, AI Crawler Blocking Report 2026, https://aivis.lumnika.com/en/research/ai-crawler-blocking-2026
Sperrt Ihre Website die KI-Crawler aus, die Sie brauchen?
Prüfen Sie Ihre robots.txt kostenlos und in Sekunden gegen alle 13 KI-Crawler und sehen Sie, welche Regel welchen Crawler aussperrt.