Cloudflare bloque l’entraînement sans freiner l’indexation
#legislation-ia 3 min · 17 septembre 2026

Cloudflare bloque l’entraînement sans freiner l’indexation

Par Arthur Dekeyser

En résumé

1

Cloudflare distingue désormais les robots d’indexation des robots d’entraînement.

2

Le réglage Disallow AI Training bloque certains crawlers sans couper la recherche.

3

Les anciens domaines conservent automatiquement leurs préférences dans le tableau de bord.

💡

Le signal : Cloudflare indique que 17 % des sites protégés activent un blocage de l’entraînement, contre moins de 1 % pour la recherche.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Cloudflare sépare désormais les usages des robots qui explorent les sites web. Son réglage « Disallow AI Training » permet de refuser l’entraînement des modèles sans interrompre l’indexation classique. La directive s’inscrit dans le fichier robots.txt et distingue les crawlers selon leur usage. Les robots mixtes classés « Accountable » conservent leur accès pour la recherche. Les robots d’entraînement d’Amazon, Anthropic, Meta et OpenAI restent bloqués. Cloudflare protège plus de 20 % des sites dans le monde. L’entreprise détaille cette évolution dans son annonce officielle, également présentée par le Journal du Modérateur.

Les chiffres distinguent clairement les deux arbitrages. Selon Cloudflare, moins de 1 % des sites protégés bloquent les robots de recherche. En parallèle, 17 % activent un mécanisme de blocage de l’entraînement. Le dispositif repose sur quatre critères pour qualifier un opérateur d’« Accountable ». Celui-ci doit proposer un refus de l’entraînement. Il doit aussi prévoir un refus des résumés générés par IA. Il doit fournir une visibilité à l’échelle de l’URL sur les pages accessibles à l’entraînement. Enfin, il doit garantir que ce refus ne dégrade pas le référencement classique.

Les opérateurs encadrent leurs robots

Google et Apple remplissent déjà les critères « Accountable » avec leurs propres mécanismes. Google utilise la règle « Disallow » appliquée à Google-Extended. Apple s’appuie sur Applebot-Extended. Microsoft doit encore ajouter une préférence de non-entraînement dans robots.txt, avec une prise en charge attendue début 2027. D’ici là, le réglage Cloudflare ne transmet rien à Bing. Le refus de Bing repose sur la balise NOARCHIVE. Cloudflare distingue aussi trois comportements dans ses produits Bot Management et AI Crawl Control. Search concerne l’indexation, Training l’entraînement et Agent les agents déclenchés par un internaute.

Quatre réglages sont proposés au niveau du domaine, dans les paramètres de sécurité et sur toutes les offres. Allow laisse passer tous les robots. Disallow AI Training agit uniquement sur le comportement Training. Block on pages with ads bloque les pages lorsqu’une publicité est détectée. Block bloque tous les robots concernés. Ce dernier réglage s’applique désormais aussi aux crawlers mixtes. Il coupe donc l’accès d’Applebot, Bingbot et Googlebot, y compris pour la recherche. Cloudflare remplace aussi Block AI Bots par les contrôles Search, Training et Agent.

Les domaines existants reprennent automatiquement leurs préférences. Aucune action supplémentaire n’est requise pour ces configurations. Un domaine réglé sur Block ou Block on pages with ads pour l’entraînement bascule vers Disallow AI Training. Une ancienne configuration Block AI Bots devient Allow pour Search, Disallow AI Training pour Training et Block on pages with ads pour Agent. Pour les nouveaux domaines, Cloudflare propose deux réglages prédéfinis. Les sites financés par la publicité utilisent Disallow AI Training pour Training et Block on pages with ads pour Agent. Les autres restent en Allow sur les trois contrôles.

Cloudflare prépare les résumés IA

Cette évolution prolonge plusieurs initiatives de Cloudflare autour de l’exploration web. L’entreprise a lancé AI Labyrinth pour piéger les robots d’entraînement dans des pages générées. Elle a ensuite présenté Pay per Crawl, un modèle de paiement au crawl. Cloudflare a aussi proposé une version Markdown automatique des pages pour les agents. Un endpoint permet désormais d’explorer un site entier avec une seule requête API. Le prochain chantier concerne les résumés générés par IA. Cloudflare vise début 2027 un réglage unique côté plateforme. Celui-ci doit permettre de doser la part de contenu qu’un opérateur reprend dans ses résumés.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi