Article

Être cité par une IA : ce que les études permettent vraiment de conclure

Les études sur les citations par les IA donnent des résultats variables. Comprenez ce qu’elles mesurent avant de transformer leurs observations en recettes.

Une réponse générée peut reprendre un article sans lui envoyer beaucoup de visiteurs. Les éditeurs cherchent donc à comprendre ce qui favorise une citation. Les études disponibles donnent des pistes, mais leurs protocoles et leurs résultats diffèrent. Elles invitent surtout à distinguer trois choses : être trouvé, être cité et recevoir une visite.

Distinguer la citation et la visite

Le Pew Research Center a suivi 900 adultes américains sur 68 879 recherches Google en mars 2025. Parmi ces recherches, 12 593 ont produit un résumé généré. Les résultats, publiés en juillet 2025, distinguent les pages avec et sans résumé.

Sur une page de résultatsAvec un résumé généréSans
Visites produisant un clic vers un site8 %15 %
Pages après lesquelles le navigateur est refermé au moins cinq secondes26 %16 %
Clics sur un lien à l'intérieur du résumé1 %sans objet

Dans cet échantillon, les visites avec résumé sont associées à moins de clics vers les sites : 8 %, contre 15 % sans résumé. Les liens du résumé lui-même reçoivent un clic dans 1 % des visites concernées.

Une réserve s'impose avant d'en tirer une cause, et Pew la fournit lui-même : les requêtes qui déclenchent un résumé ne sont pas les mêmes que les autres. « Seules 8 % des recherches d'un ou deux mots ont produit un résumé », contre 53 % au-delà de dix mots. L'écart mesuré mélange donc l'effet du résumé et celui du type de question. La mesure date par ailleurs de mars 2025, avant la généralisation du mode conversationnel de Google.

Reste le fait qui compte pour un éditeur : une page rapporte deux choses désormais distinctes, la visite qu'elle reçoit et la reprise de son contenu dans la réponse.

Les premiers résultats de l'étude GEO

Des éléments attribuables : citations, statistiques, sources nommées. C'est le résultat de l'expérience fondatrice du domaine, présentée à la conférence ACM SIGKDD en 2024 sous le nom de Generative Engine Optimization. Ses auteurs ont réécrit les mêmes pages de neuf façons, puis mesuré la visibilité de chaque version.

Réécriture appliquéeEffet sur la part de réponse
Ajouter des citations d'auteur+41 % (meilleure des neuf)
Ajouter des statistiques+33 %
Améliorer la fluidité du texte+29 %
Nommer ses sources+28 %
Bourrer des mots-clés−9 %, et 10 % sous la référence sur Perplexity.ai

Ces pourcentages décrivent les effets observés dans le dispositif de l'étude. Pour savoir ce qu'ils peuvent apporter à un éditeur, il faut examiner comment les pages ont été sélectionnées et comment leur visibilité a été calculée.

Ce que le protocole mesure, et ce qu'il ne mesure pas

Elle ne mesure pas la probabilité d'être cité. Le protocole part de cinq pages déjà retenues par le moteur de recherche, et regarde laquelle occupe la plus grande part de la réponse, sur un total normalisé à 1.

Autrement dit : les réécritures redistribuent une part entre concurrentes. Elles n'ouvrent pas la porte. Ce qui fait entrer une page dans les cinq premières, c'est le classement ordinaire, que l'expérience ne touche pas.

Le dispositif lui-même mérite d'être connu. Le moteur principal est une maquette montée par les auteurs autour de GPT-3.5. Perplexity.ai n'a été éprouvé que sur deux cents cas, et par dépôt de fichiers, faute de pouvoir lui imposer des URL. Les réécritures sont donc comparables entre elles, sur un montage de 2023 qui ne ressemble plus aux moteurs d'aujourd'hui.

Un second résultat, très cité, demande la même prudence. Sur les sources classées cinquièmes, nommer ses sources fait plus que doubler la part ; sur les sources déjà premières, la même réécriture la fait reculer de 30 %. Mais ce chiffre ne vaut que lorsque les cinq concurrentes optimisent toutes en même temps. Ce n'est pas un gain créé, c'est une part déplacée.

Les études suivantes limitent la portée des premières conclusions

Les études suivantes obtiennent des résultats moins favorables aux recettes de réécriture. C-SEO Bench, présenté à NeurIPS en 2025, compare neuf méthodes sur deux tâches, trois domaines et plus de seize mille documents. La plupart apportent peu de gain et certaines dégradent le classement.

Les auteurs observent aussi que les gains diminuent lorsque davantage de pages appliquent les mêmes méthodes. Ce résultat souligne la concurrence entre sources ; il ne permet pas de conclure qu'aucune amélioration durable n'est possible dans tous les moteurs.

Une seconde étude, présentée à SIGIR en 2026 sur deux cent cinquante-deux mille essais et six modèles, trouve d'autres leviers : « la pertinence thématique et la position dans la liste sont les principaux moteurs d'une citation en premier », l'ajout d'un prix explicite et d'une date récente aidant de façon constante, tandis que « les retouches de forme seules ont peu d'effet ».

Une synthèse critique du domaine, publiée en juillet 2026, conclut qu'« aucune technique passée en revue ne montre d'effet causal stable, longitudinal et inter-plateformes sur la découvrabilité organique ».

Je continue pourtant d'écrire des textes attribuables, et pas par superstition. Un chiffre avec son unité, une citation avec son auteur, une affirmation avec sa source se transportent hors de la page sans rien perdre. Pour un moteur comme pour un lecteur humain qui vous recopie. C'est une bonne raison d'écrire ainsi. Ce n'est pas une mécanique de visibilité démontrée, et je me garderai de la vendre comme telle.

Rendre les passages compréhensibles aide aussi les lecteurs

Un système de recherche peut exploiter un passage sans restituer l'article entier. Google décrit notamment un classement qui analyse des passages pour apprécier la pertinence d'une page.

Les fonctionnalités d'IA de Google peuvent aussi lancer plusieurs recherches sur des sous-sujets, un procédé appelé query fan-out. Une section clairement centrée sur une question est plus facile à comprendre et à réutiliser. Cela ne garantit pas sa sélection.

La longueur seule ne permet pas de prédire une citation. Un article long peut être bien organisé ; un article court peut manquer de contexte. L'objectif éditorial reste de fournir les informations nécessaires sans les disperser.

Un test simple consiste à lire un intertitre et le paragraphe qui suit hors de la page. Le sujet, les unités et les conditions restent-ils compréhensibles ? Ce contrôle améliore la lisibilité, sans constituer un test de classement ou de citation.

Google conserve les exigences habituelles de la recherche

Sa documentation est explicite : « il n'y a pas d'exigence supplémentaire pour apparaître dans les AI Overviews ou l'AI Mode, ni d'optimisation spéciale nécessaire », et « vous n'avez pas besoin de créer de nouveaux fichiers lisibles par machine, de fichiers texte pour l'IA, ou de balisage ». Les règles sont celles de la recherche ordinaire.

Cette position ne contredit pas les mesures. Elle les recoupe même : si le classement ordinaire décide de l'entrée dans le contexte, c'est bien lui qu'il faut travailler.

L'effet des mentions hors de son site reste non démontré

C'est le seul point où je n'ai trouvé aucune mesure indépendante. Une grande part de ce qui circule vient d'éditeurs d'outils, et leurs chiffres demandent d'être lus avec leur méthode.

Chez Ahrefs, qui a corrélé la visibilité de 75 000 marques à leurs signaux, le facteur le mieux corrélé n'est pas celui qui circule d'ordinaire : c'est la mention sur YouTube (0,737). Les mentions de marque relevées ailleurs sur le web suivent, entre 0,66 et 0,71. Deux métriques de liens — nombre de backlinks et URL Rating — corrèlent très faiblement ; le Domain Rating, lui, se tient au milieu du classement.

Une précision qui change la lecture : Ahrefs n'a retenu que des domaines déjà forts. Sur un échantillon dont les sites faibles en liens ont été retirés, la force de lien varie peu, et une corrélation faible s'ensuit d'autant plus facilement. Ce n'est pas une preuve que les liens comptent moins.

Ces travaux sont documentés et de grande taille, mais corrélationnels et publiés par des parties intéressées. Tenez leur convergence pour une hypothèse, pas pour une mécanique : exister hors de son propre site reste une bonne idée, sans que personne sache dire de combien.

Enfin, rien n'oblige un fournisseur à nommer ses sources. Écrire un texte attribuable augmente peut-être vos chances d'être repris. Cela ne crée aucun droit à l'être.

Sources

Explorer

Sur le même sujet

Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.

Comprendre CQRS avec une commande client

Comprendre CQRS avec une commande client

CQRS distingue les règles qui valident une opération des données préparées pour les vues. Une commande client explique les deux modèles et leur synchronisation.

Laisser un commentaire

Elle n'est jamais affichée ni publiée. Elle sert à regrouper vos commentaires et, si vous vous inscrivez un jour avec elle, à vous les rendre.

Votre commentaire sera relu avant d'être publié.