Report sul blocco dei crawler AI 2026
Quali crawler AI tengono fuori i siti, e quali lasciano entrare? Misurato su 1349 robots.txt reali, non con un sondaggio.
Campione: 1349 file robots.txt, su 1769 domini scansionati · Scansioni dal 19 set 2026 al 22 set 2026 · Ricalcolato il 25 set 2026
Dei 1349 robots.txt analizzati da AIVIS, l’11,4% esclude almeno un crawler AI dall’intero sito, e l’1,4% li esclude tutti e 13. La grande maggioranza lascia ogni crawler AI libero di leggere.
Il blocco colpisce l’addestramento dei modelli molto più delle risposte: l’11,4% dei siti blocca almeno un crawler di training, mentre solo il 5,8% blocca un crawler di ricerca AI e il 5,6% i fetcher che un assistente invia quando un utente gli chiede di aprire una pagina. Blocca soltanto i crawler di training il 5,1% dei siti, lasciando aperte la ricerca AI e le visite su richiesta.
Fra i settori con abbastanza domini da essere rappresentativi, Notizie e media è quello che blocca più spesso (il 50,9% dei robots.txt esclude almeno un crawler AI) e Università quello che blocca meno (lo 0%).
Tasso di blocco per crawler
Quota dei 1349 robots.txt che vietano l’intero sito a ciascun crawler.
| Crawler (user-agent) | Gestore | Scopo | Bloccato da |
|---|---|---|---|
CCBot | Common Crawl | Addestramento modelli | 8,9% |
Bytespider | ByteDance | Addestramento modelli | 8,6% |
GPTBot | OpenAI | Addestramento modelli | 7,6% |
ClaudeBot | Anthropic | Addestramento modelli | 7,3% |
Google-Extended | Addestramento modelli | 6,7% | |
anthropic-ai | Anthropic | Addestramento modelli | 6,6% |
Applebot-Extended | Apple | Addestramento modelli | 6,6% |
Meta-ExternalAgent | Meta | Addestramento modelli | 6,5% |
PerplexityBot | Perplexity | Indice di ricerca AI | 5,6% |
ChatGPT-User | OpenAI | Visita su richiesta dell’utente | 4,1% |
Perplexity-User | Perplexity | Visita su richiesta dell’utente | 3,9% |
Claude-User | Anthropic | Visita su richiesta dell’utente | 3,6% |
OAI-SearchBot | OpenAI | Indice di ricerca AI | 3% |
Blocco dei crawler AI per settore
Quota di robots.txt di ogni settore che blocca almeno un crawler AI, e i quattro crawler su cui si chiede di più.
| Settore | robots.txt | Almeno un crawler AI | GPTBot | ClaudeBot | PerplexityBot | Google-Extended |
|---|---|---|---|---|---|---|
| Tutti i siti | 1349 | 11,4% | 7,6% | 7,3% | 5,6% | 6,7% |
| SaaS e software | 119 | 7,6% | 0,8% | 0,8% | 0% | 0,8% |
| Notizie e media | 57 | 50,9% | 38,6% | 35,1% | 31,6% | 33,3% |
| Università | 46 | 0% | 0% | 0% | 0% | 0% |
| E-commerce | 36 | 11,1% | 8,3% | 5,6% | 0% | 8,3% |
| Banche e finanza | 25 | 16% | 8% | 4% | 4% | 8% |
| Pubblica amministrazione | 23 | 8,7% | 8,7% | 4,3% | 8,7% | 4,3% |
| Hotel e B&B | 12 | 8,3% | 8,3% | 8,3% | 0% | 8,3% |
| Automotive | 10 | 20% | 20% | 20% | 10% | 20% |
| Telco e utility(campione ridotto) | 8 | 0% | 0% | 0% | 0% | 0% |
| Ristoranti(campione ridotto) | 8 | 50% | 25% | 37,5% | 25% | 37,5% |
| Viaggi e trasporti(campione ridotto) | 6 | 33,3% | 0% | 0% | 0% | 0% |
| Agenzie immobiliari(campione ridotto) | 6 | 16,7% | 16,7% | 0% | 0% | 0% |
| Agenzie web(campione ridotto) | 4 | 0% | 0% | 0% | 0% | 0% |
| Studi legali e professionisti(campione ridotto) | 2 | 0% | 0% | 0% | 0% | 0% |
| Artigiani e attività locali(campione ridotto) | 2 | 0% | 0% | 0% | 0% | 0% |
Il settore è assegnato dal classificatore di AIVIS in base al contenuto della homepage: ce l’hanno 390 dei 1769 domini, gli altri contano nei totali ma non in questa tabella. I settori con meno di 10 robots.txt sono in grigio e marcati low_sample nel dataset: troppo pochi per rappresentare il settore.
Metodologia
- Campione: l’ultima scansione di ogni dominio del corpus AIVIS (1769 domini, scansionati fra il 19 set 2026 e il 22 set 2026). La base sono i 1349 domini che servono un robots.txt (il 76,3% del corpus): un sito senza robots.txt non pone alcuna restrizione, e resta fuori dalle percentuali invece di essere contato come aperto.
- Misura: per ciascuno dei 13 token user-agent il robots.txt è valutato con le regole standard di corrispondenza dei gruppi (RFC 9309) — il gruppo che nomina il token, o il gruppo generico «User-agent: *» se nessuno lo nomina. Un crawler è bloccato quando gli è vietata la radice del sito «/». Le regole che chiudono solo alcune cartelle non contano come blocco.
- Lo scopo segue la documentazione di ciascun gestore: i crawler di training raccolgono dati per i modelli (GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent); i crawler di ricerca AI costruiscono l’indice che le risposte citano (OAI-SearchBot, PerplexityBot); i fetcher su richiesta aprono una pagina quando una persona lo chiede all’assistente (ChatGPT-User, Claude-User, Perplexity-User). anthropic-ai è un token storico che molti robots.txt elencano ancora.
- Limiti: il robots.txt è una dichiarazione, non un blocco tecnico. Firewall e protezioni anti-bot delle CDN possono respingere crawler che il robots.txt permette, e alcuni crawler lo ignorano; questo report misura solo la politica dichiarata.
- Rapporto con l’AI Readiness Index: l’Index riporta il blocco su tutti i domini scansionati, compresi quelli senza robots.txt; questo report usa come base i robots.txt, quindi le sue percentuali sono più alte per definizione. Entrambe sono ricalcolate dal vivo sulle stesse scansioni.
Scarica il dataset
Totali, il tasso di ogni crawler e ogni riga di settore dietro questo report, ricalcolati dal vivo man mano che il corpus cresce.
Licenza CC-BY 4.0 — riutilizzabile liberamente citando AIVIS.
Citare come: AIVIS, AI Crawler Blocking Report 2026, https://aivis.lumnika.com/en/research/ai-crawler-blocking-2026
Il tuo sito blocca i crawler AI che ti servono?
Controlla gratis in pochi secondi il tuo robots.txt contro tutti i 13 crawler AI e scopri quale regola esclude ciascuno.