Article

Accès des agents au Web : comprendre les blocages, licences et paiements

Les sites distinguent de plus en plus les robots de recherche, d’entraînement et les agents personnels. Voici les règles d’accès et leurs effets sur la lecture.

Vous demandez à un agent de comparer trois articles. Deux sont accessibles, le troisième refuse les robots. Ce refus peut viser la collecte pour l'entraînement, la charge générée par les visites automatisées ou la rémunération du contenu. Pour comprendre ces choix, il faut distinguer les usages et les mécanismes qui les encadrent.

Tous les robots ne viennent pas pour la même raison

Un crawler parcourt automatiquement des pages. Il peut alimenter un moteur de recherche, constituer un corpus ou récupérer des informations pour un service.

Un agent peut aussi ouvrir une page pour répondre immédiatement à une personne : comparer une offre, consulter une documentation ou préparer une réservation. Cette lecture ponctuelle n'a pas le même objectif qu'une collecte massive.

La distinction compte pour l'éditeur. Il peut vouloir faciliter la recherche et la consultation, tout en refusant certains autres usages. Le système de filtrage doit pouvoir reconnaître ces catégories avec suffisamment de fiabilité.

Le retour de trafic est devenu une question centrale

Les moteurs de recherche lisent les sites et peuvent leur envoyer des visiteurs. Un assistant qui fournit directement une réponse peut réduire le besoin d'ouvrir la page source, même s'il peut aussi lui apporter des visites.

Cloudflare mesure notamment un ratio entre les pages collectées et les visites renvoyées. Sur la semaine du 19 au 26 juin 2025, son observatoire indiquait 70 900 pages lues par visite attribuée à Anthropic, contre 0,1 pour Mistral.

Ces chiffres décrivent un périmètre et une période. Les visites issues d'applications sans en-tête Referer peuvent échapper à l'attribution. Cloudflare vend aussi des outils de contrôle du trafic automatisé : ses observations sont utiles, mais ne résument pas à elles seules l'économie de tous les sites.

Bloquer un accès et déclarer une préférence sont deux choses différentes

Le fichier robots.txt indique aux robots les chemins qu'ils sont invités à explorer ou à éviter. Il ne constitue pas un contrôle d'accès. Pour interdire techniquement une consultation, il faut une protection appliquée par le serveur ou un intermédiaire.

Cloudflare a annoncé en juillet 2025 un blocage par défaut de certains crawlers d'IA pour les nouveaux domaines concernés. Ses options annoncées en juillet 2026 distinguent ensuite recherche, agents et entraînement, avec des règles dépendant du type de trafic et de page.

Pour un éditeur, le point pratique est de vérifier sa configuration réelle. Une catégorie bloquée peut contenir plusieurs usages, et un robot peut remplir plusieurs fonctions. Le nom du réglage ne suffit pas à prévoir tous ses effets.

Le paiement à la lecture demande un mécanisme commun

Le pay-per-crawl de Cloudflare permet de proposer un prix lorsqu'un robot demande une page. Le service utilise notamment 402 Payment Required et des en-têtes décrivant le paiement. Le code HTTP ne définit pas, à lui seul, un protocole universel de facturation.

Le robot et l'éditeur doivent participer au dispositif. Cloudflare assure l'infrastructure et l'encaissement. Sa documentation décrit encore cette offre comme une bêta fermée au moment de la révision de cet article, en septembre 2026.

Le paiement à l'usage poursuit une autre logique : rémunérer une utilisation du contenu, par exemple dans une réponse, plutôt que chaque récupération. Une page lue une seule fois peut servir plusieurs fois. Mesurer ces usages et attribuer la rémunération reste une partie du problème.

RSL décrit des conditions de licence

Really Simple Licensing, ou RSL, fournit un document XML lisible par un programme. Il peut exprimer des conditions d'attribution, d'usage ou de paiement.

Un site peut le faire découvrir depuis robots.txt, une page, un en-tête HTTP, un média ou un flux. Cela ne transforme pas les règles Allow et Disallow de robots.txt en contrôle de licence.

La déclaration, son interprétation par le client et son application technique sont trois étapes distinctes. Publier une condition ne garantit pas que tous les robots la liront ou la respecteront.

llms.txt aide à trouver du contenu

Le fichier llms.txt propose un index en Markdown des ressources utiles d'un site. Il vise à faciliter leur découverte et leur lecture.

Il n'autorise ni n'interdit un accès. Sa présence ne prouve pas non plus que chaque agent le consulte. Pour juger de son utilité, il faut observer les clients qui l'utilisent réellement.

Identifier un agent sans confondre identité et permission

Des requêtes signées peuvent aider un serveur à reconnaître leur origine. Les travaux Web Bot Auth cherchent à normaliser une partie de ces échanges.

Une identité reconnue ne donne pas automatiquement accès au contenu. Le site doit encore décider des usages permis, des limites et d'un paiement éventuel. Un agent personnel peut rencontrer davantage de difficultés qu'un opérateur déjà intégré à ces mécanismes.

La controverse entre Cloudflare et Perplexity sur le trafic automatisé illustre aussi les difficultés d'attribution. Leurs déclarations opposées ne doivent pas être présentées comme une conclusion indépendante.

Choisir une politique adaptée à son site

Je préfère distinguer la lecture demandée par une personne de la collecte destinée à d'autres usages. Cette préférence demande des moyens de contrôle et ne supprime pas les besoins de financement de l'éditeur.

Pour chaque dispositif, vérifiez ce qu'il reconnaît, ce qu'il bloque et ce qu'il laisse passer. Mesurez également les visites, la charge et les résultats commerciaux utiles au site. Une règle compréhensible et observable permet de faire évoluer l'accès sur des éléments concrets.

Sources

Explorer

Sur le même sujet

Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.

Laisser un commentaire

Elle n'est jamais affichée ni publiée. Elle sert à regrouper vos commentaires et, si vous vous inscrivez un jour avec elle, à vous les rendre.

Votre commentaire sera relu avant d'être publié.