Rapport 2026 sur le blocage des robots IA
Quels robots IA les sites tiennent-ils à l’écart, et lesquels laissent-ils entrer ? Mesuré sur 1 349 robots.txt réels, pas par sondage.
Échantillon : 1 349 fichiers robots.txt, sur 1 769 domaines analysés · Analyses du 19 sept. 2026 au 22 sept. 2026 · Recalculé le 25 sept. 2026
Sur les 1 349 robots.txt analysés par AIVIS, 11,4 % interdisent l’ensemble du site à au moins un robot IA, et 1,4 % l’interdisent aux 13 robots suivis. La grande majorité laisse tous les robots IA libres de lire.
Le blocage vise l’entraînement des modèles bien plus que les réponses : 11,4 % des sites bloquent au moins un robot d’entraînement, contre seulement 5,8 % pour un robot de recherche IA et 5,6 % pour les agents qu’un assistant envoie quand un utilisateur lui demande d’ouvrir une page. 5,1 % ne bloquent que les robots d’entraînement, en laissant ouvertes la recherche IA et les visites à la demande.
Parmi les secteurs assez représentés, Actualités et médias bloque le plus souvent (50,9 % des robots.txt excluent au moins un robot IA) et Universités le moins souvent (0 %).
Taux de blocage par robot
Part des 1 349 robots.txt qui interdisent l’ensemble du site à chaque robot.
| Robot (user-agent) | Opérateur | Finalité | Bloqué par |
|---|---|---|---|
CCBot | Common Crawl | Entraînement de modèles | 8,9 % |
Bytespider | ByteDance | Entraînement de modèles | 8,6 % |
GPTBot | OpenAI | Entraînement de modèles | 7,6 % |
ClaudeBot | Anthropic | Entraînement de modèles | 7,3 % |
Google-Extended | Entraînement de modèles | 6,7 % | |
anthropic-ai | Anthropic | Entraînement de modèles | 6,6 % |
Applebot-Extended | Apple | Entraînement de modèles | 6,6 % |
Meta-ExternalAgent | Meta | Entraînement de modèles | 6,5 % |
PerplexityBot | Perplexity | Index de recherche IA | 5,6 % |
ChatGPT-User | OpenAI | Visite à la demande | 4,1 % |
Perplexity-User | Perplexity | Visite à la demande | 3,9 % |
Claude-User | Anthropic | Visite à la demande | 3,6 % |
OAI-SearchBot | OpenAI | Index de recherche IA | 3 % |
Blocage des robots IA par secteur
Part des robots.txt de chaque secteur qui bloquent au moins un robot IA, et les quatre robots les plus demandés.
| Secteur | robots.txt | Au moins un robot IA | GPTBot | ClaudeBot | PerplexityBot | Google-Extended |
|---|---|---|---|---|---|---|
| Tous les sites | 1 349 | 11,4 % | 7,6 % | 7,3 % | 5,6 % | 6,7 % |
| SaaS et logiciels | 119 | 7,6 % | 0,8 % | 0,8 % | 0 % | 0,8 % |
| Actualités et médias | 57 | 50,9 % | 38,6 % | 35,1 % | 31,6 % | 33,3 % |
| Universités | 46 | 0 % | 0 % | 0 % | 0 % | 0 % |
| E-commerce | 36 | 11,1 % | 8,3 % | 5,6 % | 0 % | 8,3 % |
| Banque et finance | 25 | 16 % | 8 % | 4 % | 4 % | 8 % |
| Secteur public | 23 | 8,7 % | 8,7 % | 4,3 % | 8,7 % | 4,3 % |
| Hôtels et chambres d'hôtes | 12 | 8,3 % | 8,3 % | 8,3 % | 0 % | 8,3 % |
| Automobile | 10 | 20 % | 20 % | 20 % | 10 % | 20 % |
| Télécoms et énergie(échantillon réduit) | 8 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Restaurants(échantillon réduit) | 8 | 50 % | 25 % | 37,5 % | 25 % | 37,5 % |
| Voyages et transport(échantillon réduit) | 6 | 33,3 % | 0 % | 0 % | 0 % | 0 % |
| Agences immobilières(échantillon réduit) | 6 | 16,7 % | 16,7 % | 0 % | 0 % | 0 % |
| Agences web(échantillon réduit) | 4 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Cabinets et professions libérales(échantillon réduit) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
| Artisans et commerces locaux(échantillon réduit) | 2 | 0 % | 0 % | 0 % | 0 % | 0 % |
Le secteur est attribué par le classificateur d’AIVIS à partir du contenu de la page d’accueil : 390 des 1 769 domaines en ont un, les autres comptent dans les totaux mais pas dans ce tableau. Les secteurs de moins de 10 robots.txt sont grisés et marqués low_sample dans le jeu de données : trop peu nombreux pour représenter le secteur.
Méthodologie
- Échantillon : la dernière analyse de chaque domaine du corpus AIVIS (1 769 domaines, analysés entre le 19 sept. 2026 et le 22 sept. 2026). La base est constituée des 1 349 domaines qui servent un robots.txt (76,3 % du corpus) : un site sans robots.txt ne pose aucune restriction, et il est exclu des pourcentages plutôt que compté comme ouvert.
- Mesure : pour chacun des 13 jetons user-agent, le robots.txt est évalué selon les règles standard de correspondance des groupes (RFC 9309) — le groupe qui nomme le jeton, ou le groupe générique « User-agent: * » à défaut. Un robot est bloqué quand la racine du site « / » lui est interdite. Les règles qui ne ferment que certains dossiers ne comptent pas comme un blocage.
- La finalité suit la documentation de chaque opérateur : les robots d’entraînement collectent des données pour les modèles (GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent) ; les robots de recherche IA construisent l’index que citent les réponses (OAI-SearchBot, PerplexityBot) ; les agents à la demande ouvrent une page quand une personne le demande à l’assistant (ChatGPT-User, Claude-User, Perplexity-User). anthropic-ai est un jeton historique que beaucoup de robots.txt listent encore.
- Limites : le robots.txt est une déclaration, pas un blocage technique. Pare-feu et protections anti-bots des CDN peuvent refuser des robots que le robots.txt autorise, et certains robots l’ignorent ; ce rapport mesure uniquement la politique déclarée.
- Lien avec l’AI Readiness Index : l’Index mesure le blocage sur tous les domaines analysés, y compris ceux sans robots.txt ; ce rapport prend les robots.txt pour base, ses pourcentages sont donc plus élevés par définition. Tous deux sont recalculés en direct sur les mêmes analyses.
Télécharger le jeu de données
Les totaux, le taux de chaque robot et chaque ligne sectorielle de ce rapport, recalculés en direct à mesure que le corpus grandit.
Sous licence CC-BY 4.0 — réutilisation libre avec attribution à AIVIS.
Citer ainsi : AIVIS, AI Crawler Blocking Report 2026, https://aivis.lumnika.com/en/research/ai-crawler-blocking-2026
Votre site bloque-t-il les robots IA dont vous avez besoin ?
Vérifiez gratuitement en quelques secondes votre robots.txt face aux 13 robots IA et voyez quelle règle exclut chacun d’eux.