Robots IA mixtes : ce que change le blocage de Cloudflare
· 5 min de lecture · Transformation Numérique
Depuis le 15 septembre 2026, Cloudflare applique ses blocages aux robots IA qui mêlent recherche, entraînement et agents, et ajoute un réglage « Disallow AI Training ». Les entreprises doivent maintenant décider, page par page, ce qu'elles ouvrent aux moteurs IA.
Un robot d'indexation mixte (mixed-use crawler) est un programme qui parcourt le web pour plusieurs usages à la fois : alimenter un moteur de recherche, entraîner un modèle d'intelligence artificielle (IA) et servir des agents IA agissant pour un utilisateur. Le 15 septembre 2026, Cloudflare a commencé à appliquer ses réglages de blocage à ces robots mixtes et a lancé une option pour refuser l'entraînement sans disparaître de la recherche.
Pour un dirigeant, la question n'est plus technique. Elle devient stratégique : quelles pages doivent nourrir les moteurs de réponse IA (ChatGPT, Gemini, Perplexity), et lesquelles doivent rester hors de portée des modèles ?
Qu'est-ce qui a changé chez Cloudflare le 15 septembre 2026 ?
Cloudflare avait annoncé le 1er juillet 2026 une échéance pour les entreprises d'IA : séparer leurs robots de recherche, d'entraînement et d'agents, faute de quoi ils seraient bloqués par défaut sur de nombreux sites (TechCrunch, 1er juillet 2026). Le billet publié par Cloudflare le 15 septembre 2026 précise la mise en œuvre :
- Trois comportements distincts : Cloudflare classe désormais chaque robot selon trois comportements, soit la recherche (construire un index), l'entraînement (entraîner ou ajuster un modèle) et l'agent (visite pour le compte d'un humain).
- Blocages étendus aux robots mixtes : les réglages « Block » et « Block on pages with ads » s'appliquent maintenant aussi aux robots qui combinent plusieurs usages.
- Nouvelle option « Disallow AI Training » : elle publie dans le fichier robots.txt le refus d'entraînement tout en conservant l'indexation pour la recherche.
- Pages avec publicité : pour les nouveaux domaines et les comptes gratuits, les robots d'entraînement et d'agents sont bloqués par défaut sur les pages affichant des annonces (TechCrunch, 1er juillet 2026).
Pourquoi Cloudflare durcit-il le ton envers les robots IA ?
Le trafic non humain domine désormais le web. Matthew Prince, président-directeur général de Cloudflare, a déclaré en juillet 2026 que la majorité du trafic sur Internet n'est plus humaine (TechCrunch, 1er juillet 2026).
Les résumés générés par IA réduisent les clics vers les sites sources (voir notre analyse des résumés IA de Google et du trafic des entreprises). Cloudflare indique toutefois, dans son billet du 15 septembre 2026, que les visiteurs référés par la recherche IA convertissent de 3 à 5 fois mieux que ceux de la recherche traditionnelle.
Quels robots Cloudflare considère-t-il comme « responsables » ?
Cloudflare désigne comme opérateurs responsables (accountable) ceux qui respectent quatre exigences : un mécanisme de refus de l'entraînement, un mécanisme de refus des résumés IA, une visibilité par URL sur l'usage à des fins d'entraînement, et la garantie qu'un refus ne pénalise pas le classement dans la recherche. Le billet cite Applebot, Googlebot et Bingbot, ainsi que les robots d'Amazon, Anthropic, Meta et OpenAI.
Les données de Cloudflare montrent un écart de comportement net : 17 % des sites de son réseau bloquent l'entraînement, mais moins de 1 % bloquent les robots de recherche (Cloudflare, 15 septembre 2026).
Quel cadre juridique encadre le refus d'entraînement ?
Au Canada, aucune loi n'impose encore aux entreprises d'IA de respecter un refus exprimé dans robots.txt. Le gouvernement fédéral a mené une consultation sur le droit d'auteur à l'ère de l'IA générative (Innovation, Sciences et Développement économique Canada, 2023-2024), sans réforme adoptée à ce jour.
En Europe, le cadre est plus contraignant. L'article 53 du règlement européen sur l'IA (AI Act) oblige les fournisseurs de modèles d'IA à usage général à mettre en place une politique de respect du droit d'auteur, incluant les réserves de droits prévues à l'article 4 de la directive 2019/790. Le protocole robots.txt, normalisé par l'IETF (Internet Engineering Task Force) dans la RFC 9309 en septembre 2022, reste d'application volontaire. Les limites juridiques de l'accès des agents aux sites sont détaillées dans notre article sur la décision du Neuvième Circuit.
Comment une entreprise québécoise doit-elle arbitrer ?
Le bon réglage dépend de la nature des pages, pas d'une position globale « pour » ou « contre » l'IA :
- Pages commerciales (services, produits, études de cas) : autoriser la recherche et les agents, pour être cité dans les réponses IA.
- Contenus à valeur propriétaire (rapports payants, guides premium) : activer « Disallow AI Training » ou bloquer.
- Espaces clients et documentation interne : bloquer tous les robots et vérifier l'authentification, indépendamment de Cloudflare.
Sans Cloudflare, la même politique doit être documentée dans le robots.txt et auprès de l'hébergeur.
Questions fréquentes
Mon site risque-t-il de disparaître de Google à cause de Cloudflare ?
Non, si les réglages sont bien choisis. Cloudflare classe Googlebot parmi les robots responsables et l'option « Disallow AI Training », lancée le 15 septembre 2026, refuse l'entraînement sans bloquer l'indexation. Le risque existe si un administrateur active « Block » sur la recherche. Vérifiez la section AI Crawl Control du tableau de bord Cloudflare.
Qu'est-ce qu'un robot d'agent IA ?
Un robot d'agent IA visite une page à la demande d'un humain, par exemple lorsqu'un utilisateur demande à ChatGPT ou Claude de consulter un site. Cloudflare le distingue depuis septembre 2026 des robots de recherche et d'entraînement. Bloquer les agents peut empêcher un client potentiel de comparer vos offres via son assistant IA.
Le fichier robots.txt empêche-t-il réellement l'entraînement des modèles ?
Pas techniquement. Le robots.txt (RFC 9309, 2022) exprime une préférence que les robots respectent volontairement. En Europe, l'AI Act oblige les fournisseurs de modèles à usage général à respecter les réserves de droits. Au Canada, aucune obligation équivalente n'existe en septembre 2026.
Faut-il bloquer l'entraînement IA sur un site d'entreprise ?
Cela dépend du contenu. Selon Cloudflare, 17 % des sites de son réseau bloquent l'entraînement en septembre 2026. Une PME qui vit de sa visibilité gagne à laisser ses pages commerciales accessibles, tandis qu'un éditeur de contenus payants a intérêt à refuser l'entraînement pour protéger sa valeur.
Sources
- Cloudflare, « Have it both ways: stay discoverable in search while disallowing AI training », 15 septembre 2026 : https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
- TechCrunch, « Cloudflare's new policy pushes AI companies to pay for publishers' content », 1er juillet 2026 : https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/
- EUR-Lex, Règlement (UE) 2024/1689 sur l'intelligence artificielle, article 53 : https://eur-lex.europa.eu/eli/reg/2024/1689/oj
- EUR-Lex, Directive (UE) 2019/790 sur le droit d'auteur dans le marché unique numérique : https://eur-lex.europa.eu/eli/dir/2019/790/oj
- IETF, RFC 9309 « Robots Exclusion Protocol », septembre 2022 : https://www.rfc-editor.org/rfc/rfc9309
- Innovation, Sciences et Développement économique Canada, Consultation sur le droit d'auteur à l'ère de l'intelligence artificielle générative : https://ised-isde.canada.ca/site/strategie-politique-droit-auteur/fr/consultation-droit-auteur-lere-lintelligence-artificielle-generative
Voir tous les articles