Informe de bloqueo de rastreadores de IA 2026
¿Qué rastreadores de IA dejan fuera los sitios, y cuáles dejan entrar? Medido en 1349 robots.txt reales, no con una encuesta.
Muestra: 1349 archivos robots.txt, de 1769 dominios analizados · Análisis del 19 sept 2026 al 22 sept 2026 · Recalculado el 25 sept 2026
De los 1349 robots.txt que analizó AIVIS, el 11,4 % cierra todo el sitio a al menos un rastreador de IA, y el 1,4 % se lo cierra a los 13 rastreadores monitorizados. La gran mayoría deja que cualquier rastreador de IA lea libremente.
El bloqueo apunta al entrenamiento de modelos mucho más que a las respuestas: el 11,4 % de los sitios bloquea al menos un rastreador de entrenamiento, mientras que solo el 5,8 % bloquea un rastreador de búsqueda de IA y el 5,6 % bloquea los agentes que un asistente envía cuando un usuario le pide abrir una página. El 5,1 % bloquea únicamente rastreadores de entrenamiento y deja abiertas la búsqueda de IA y las visitas a petición.
Entre los sectores con dominios suficientes para ser representativos, Noticias y medios es el que más bloquea (el 50,9 % de sus robots.txt excluye al menos un rastreador de IA) y Universidades el que menos (el 0 %).
Tasa de bloqueo por rastreador
Porcentaje de los 1349 robots.txt que prohíben todo el sitio a cada rastreador.
| Rastreador (user-agent) | Operador | Finalidad | Bloqueado por |
|---|---|---|---|
CCBot | Common Crawl | Entrenamiento de modelos | 8,9 % |
Bytespider | ByteDance | Entrenamiento de modelos | 8,6 % |
GPTBot | OpenAI | Entrenamiento de modelos | 7,6 % |
ClaudeBot | Anthropic | Entrenamiento de modelos | 7,3 % |
Google-Extended | Entrenamiento de modelos | 6,7 % | |
anthropic-ai | Anthropic | Entrenamiento de modelos | 6,6 % |
Applebot-Extended | Apple | Entrenamiento de modelos | 6,6 % |
Meta-ExternalAgent | Meta | Entrenamiento de modelos | 6,5 % |
PerplexityBot | Perplexity | Índice de búsqueda de IA | 5,6 % |
ChatGPT-User | OpenAI | Visita a petición del usuario | 4,1 % |
Perplexity-User | Perplexity | Visita a petición del usuario | 3,9 % |
Claude-User | Anthropic | Visita a petición del usuario | 3,6 % |
OAI-SearchBot | OpenAI | Índice de búsqueda de IA | 3 % |
Bloqueo de rastreadores de IA por sector
Porcentaje de robots.txt de cada sector que bloquea al menos un rastreador de IA, y los cuatro rastreadores por los que más se pregunta.
| Sector | robots.txt | Algún rastreador de IA | GPTBot | ClaudeBot | PerplexityBot | Google-Extended |
|---|---|---|---|---|---|---|
| Todos los sitios | 1349 | 11,4 % | 7,6 % | 7,3 % | 5,6 % | 6,7 % |
| SaaS y software | 119 | 7,6 % | 0,8 % | 0,8 % | 0 % | 0,8 % |
| Noticias y medios | 57 | 50,9 % | 38,6 % | 35,1 % | 31,6 % | 33,3 % |
| Universidades | 46 | 0 % | 0 % | 0 % | 0 % | 0 % |
| E-commerce | 36 | 11,1 % | 8,3 % | 5,6 % | 0 % | 8,3 % |
| Banca y finanzas | 25 | 16 % | 8 % | 4 % | 4 % | 8 % |
| Sector público | 23 | 8,7 % | 8,7 % | 4,3 % | 8,7 % | 4,3 % |
| Hoteles y B&B | 12 | 8,3 % | 8,3 % | 8,3 % | 0 % | 8,3 % |
| Automoción | 10 | 20 % | 20 % | 20 % | 10 % | 20 % |
| Telecom y servicios(muestra reducida) | 8 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Restaurantes(muestra reducida) | 8 | 50 % | 25 % | 37,5 % | 25 % | 37,5 % |
| Viajes y transporte(muestra reducida) | 6 | 33,3 % | 0 % | 0 % | 0 % | 0 % |
| Agencias inmobiliarias(muestra reducida) | 6 | 16,7 % | 16,7 % | 0 % | 0 % | 0 % |
| Agencias web(muestra reducida) | 4 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Bufetes y profesionales(muestra reducida) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Autónomos y negocios locales(muestra reducida) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
El sector lo asigna el clasificador de AIVIS a partir del contenido de la página de inicio: lo tienen 390 de los 1769 dominios; el resto cuenta en los totales pero no en esta tabla. Los sectores con menos de 10 robots.txt aparecen en gris y marcados como low_sample en el conjunto de datos: son demasiado pocos para representar al sector.
Metodología
- Muestra: el último análisis de cada dominio del corpus de AIVIS (1769 dominios, analizados entre el 19 sept 2026 y el 22 sept 2026). La base son los 1349 dominios que sirven un robots.txt (el 76,3 % del corpus): un sitio sin robots.txt no impone ninguna restricción, y queda fuera de los porcentajes en lugar de contarse como abierto.
- Medición: para cada uno de los 13 tokens user-agent, el robots.txt se evalúa con las reglas estándar de correspondencia de grupos (RFC 9309) — el grupo que nombra el token o, si no lo hay, el grupo genérico «User-agent: *». Un rastreador está bloqueado cuando tiene prohibida la raíz del sitio «/». Las reglas que cierran solo algunas carpetas no cuentan como bloqueo.
- La finalidad sigue la documentación de cada operador: los rastreadores de entrenamiento recopilan datos para los modelos (GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent); los de búsqueda de IA construyen el índice que citan las respuestas (OAI-SearchBot, PerplexityBot); los agentes a petición abren una página cuando una persona se lo pide al asistente (ChatGPT-User, Claude-User, Perplexity-User). anthropic-ai es un token antiguo que muchos robots.txt aún incluyen.
- Límites: el robots.txt es una declaración, no un bloqueo técnico. Los cortafuegos y la protección antibots de las CDN pueden rechazar rastreadores que el robots.txt permite, y algunos rastreadores lo ignoran; este informe mide solo la política declarada.
- Relación con el AI Readiness Index: el Index mide el bloqueo sobre todos los dominios analizados, incluidos los que no tienen robots.txt; este informe toma como base los robots.txt, por lo que sus porcentajes son más altos por definición. Ambos se recalculan en directo sobre los mismos análisis.
Descarga el conjunto de datos
Los totales, la tasa de cada rastreador y cada fila por sector de este informe, recalculados en directo a medida que crece el corpus.
Con licencia CC-BY 4.0 — reutilización libre citando a AIVIS.
Cita como: AIVIS, AI Crawler Blocking Report 2026, https://aivis.lumnika.com/en/research/ai-crawler-blocking-2026
¿Tu sitio bloquea los rastreadores de IA que necesitas?
Comprueba gratis y en segundos tu robots.txt frente a los 13 rastreadores de IA y descubre qué regla deja fuera a cada uno.