Le Generative Engine Optimization ne consiste pas à trouver la faille qui ferait citer votre site par ChatGPT. Il consiste à rendre votre contenu retrouvable, compréhensible et assez original pour qu’un système de génération assistée par recherche ait une raison de l’utiliser — et de vous attribuer. Ce guide rassemble ce que disent les sources primaires : l’article fondateur du GEO, sa première revue critique systématique, la position officielle de Google, et les données de mesure réellement disponibles en 2026.
Qu’est-ce que le Generative Engine Optimization ?
Le Generative Engine Optimization désigne l’ensemble des pratiques visant à augmenter la présence d’un contenu dans les réponses produites par des moteurs et assistants génératifs : Google AI Overviews et AI Mode, ChatGPT Search, Gemini, Claude, Perplexity, Copilot et d’autres interfaces qui combinent recherche documentaire et génération de texte.
Dans un moteur classique, l’objectif principal est d’obtenir une position et un clic. Dans une interface générative, plusieurs résultats sont souvent consultés, synthétisés puis reformulés. Une marque peut donc apparaître de trois façons :
- comme source cliquable associée à une affirmation ;
- comme entité recommandée, par exemple un expert, un logiciel ou une méthode cités par leur nom ;
- comme influence non attribuée, lorsque l’idée est reprise sans que la source soit clairement mentionnée.
Une bonne stratégie GEO cherche à maximiser les deux premiers cas et à réduire le troisième, grâce à une attribution explicite, une identité cohérente et des contenus originaux. Elle ne promet pas de recette miracle : c’est un travail de fond, dont les effets sont conditionnels.
D’où vient le GEO : l’article fondateur et sa critique
Le terme n’est pas né d’une agence marketing. Il vient d’un travail de recherche : Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan et Ameet Deshpande ont publié « GEO: Generative Engine Optimization » le 16 novembre 2023, un article accepté à la conférence KDD 2024 [1]. C’est de ce travail que vient le fameux chiffre de « +40 % de visibilité » que l’on retrouve partout.
Près de trois ans plus tard, la littérature mérite d’être lue avec recul. La première revue critique systématique du domaine — « Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026) », signée Olivier Martinez, publiée le 15 juillet 2026, et portant sur 45 études — met de l’ordre dans un corpus hétérogène [2]. Précision importante : il s’agit d’une prépublication, qui n’a pas encore été évaluée par les pairs. Ses conclusions sont donc à lire comme un état des lieux argumenté, pas comme un consensus établi.
Ce que dit cette revue est plus nuancé que les deux camps qui s’affrontent en ligne. D’un côté, elle confirme que certaines pratiques fonctionnent : la pertinence thématique et la position dans le contexte fourni au modèle sont les deux leviers qui se reproduisent le plus stablement d’une étude à l’autre. De l’autre, elle tempère les recettes génériques : les heuristiques générales se transfèrent mal d’une plateforme à l’autre, et certaines réécritures optimisées pour la citation dégradent la récupération du document au lieu de l’améliorer. Sa conclusion la plus importante est un constat de limite : dans le corpus examiné, aucune technique étudiée ne démontre d’effet causal stable, longitudinal et multi-plateforme sur la découvrabilité organique [2].
Le GEO n’est donc pas une illusion, et ce n’est pas non plus un levier mécanique. C’est un ensemble de pratiques dont l’effet est réel mais conditionnel — ce qui doit se traduire dans la façon dont vous le mesurez.
SEO, AEO et GEO : quelles différences ?
| Discipline | Objectif principal | Résultat visé | Leviers dominants |
|---|---|---|---|
| SEO | Être bien classé dans les moteurs de recherche | Impressions, positions, clics | Indexation, pertinence, qualité, popularité, expérience utilisateur |
| AEO | Répondre directement à une question | Extraits optimisés, réponses vocales, blocs de réponse | Réponses concises, définitions, FAQ, données structurées |
| GEO | Être utilisé, cité ou recommandé dans une réponse générée | Citations, mentions, recommandations, trafic référent IA | SEO solide, contenu original, preuves, entités, attribution, accessibilité |
Ces disciplines se recouvrent largement. Google indique que ses bonnes pratiques SEO restent applicables à ses fonctionnalités génératives et qu’aucune optimisation spéciale n’est obligatoire pour apparaître dans AI Overviews ou AI Mode [4]. En pratique, le GEO est une couche stratégique supplémentaire : il ne dispense jamais d’un socle SEO propre.
Comment les moteurs génératifs choisissent leurs sources
1. La requête est reformulée ou décomposée
Une question complexe peut être transformée en plusieurs sous-requêtes lancées en parallèle. Cette technique, appelée query fan-out, n’est plus une terminologie de tiers : Google la décrit officiellement dans sa documentation comme « un ensemble de requêtes connexes, concurrentes, générées par le modèle pour récupérer davantage de résultats pertinents » [3]. Concrètement, une question sur un sujet donné déclenche des recherches complémentaires sur la définition, la comparaison, le prix, les limites ou les cas d’usage.
2. Des documents sont récupérés
Le système recherche des pages accessibles dans son index ou via des partenaires. La qualité du crawl, l’indexation, la clarté technique et la possibilité d’extraire le contenu restent donc déterminantes. Une page bloquée par un pare-feu, rendue uniquement après une interaction complexe ou inaccessible sans JavaScript peut tout simplement ne pas exister pour le moteur.
3. Les passages les plus pertinents sont sélectionnés
Le moteur ne lit pas nécessairement la page comme un humain : il identifie des passages susceptibles de répondre précisément à la question. Une section bien titrée, autonome et factuelle a davantage de chances d’être utilisée qu’un paragraphe vague. La revue critique de 2026 identifie justement la pertinence thématique et la position du passage comme les leviers les plus reproductibles [2].
4. La réponse est synthétisée
Le modèle combine les éléments récupérés, les compare et les reformule. Une information peut être écartée si elle paraît isolée, non vérifiable, contradictoire ou trop promotionnelle. La fidélité n’est d’ailleurs pas garantie : la revue de 45 études relève que seules 51,5 % des phrases générées sont entièrement soutenues par leurs citations [2]. Autrement dit, être cité ne signifie pas être repris fidèlement.
5. Certaines sources sont citées
Les critères exacts varient selon les plateformes et selon les requêtes. Une source a généralement plus de chances d’être retenue lorsqu’elle apporte une preuve spécifique, une donnée originale, une définition claire, un comparatif utile ou une information difficile à remplacer.
La structure de ces citations a changé. Une analyse Ahrefs portant sur 863 000 pages de résultats et 4 millions d’URL citées (mars 2026) montre que la part des citations d’AI Overviews issues du top 10 organique est passée de 76 % en juillet 2025 à 38 %. La répartition actuelle est d’environ 37,9 % pour le top 10, 31,2 % pour les positions 11 à 100 et 31 % hors du top 100 [15]. Conséquence pédagogique : le SEO reste le socle, mais l’éligibilité ne se limite plus au top 10 — ce qui ouvre la porte à des pages solides mais peu populaires.
Ce que Google dit vraiment de l’optimisation pour l’IA
La position officielle de Google est utile parce qu’elle est contre-intuitive par rapport au discours ambiant. Deux citations à garder en tête, reprises telles quelles de sa documentation :
« There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary. » [4]
« You don’t need to create new machine readable files, AI text files, or markup to appear in these features. There’s also no special schema.org structured data that you need to add. » [4]
Google va plus loin et range explicitement dans la catégorie des choses que vous pouvez ignorer les fichiers llms.txt, le découpage artificiel du contenu (« chunking ») et la réécriture spécifique pour les systèmes d’IA [3]. Le moteur précise aussi que ses fonctionnalités génératives s’appuient sur ses systèmes de classement et de qualité existants — ce qui explique pourquoi les bonnes pratiques SEO restent valables, et pourquoi la production massive de contenus sans valeur ajoutée tombe sous le coup de sa politique contre l’abus de contenu à grande échelle [5].
Un dernier avertissement, précieux pour la partie mesure : « No third-party tool has access to our internal ranking or AI systems. » [3]
Les 7 piliers d’une stratégie GEO efficace
Pilier 1 — Être accessible aux moteurs et aux robots
Une page non indexable, bloquée par erreur ou inaccessible sans JavaScript ne peut pas être utilisée, quelle que soit sa qualité. Le premier travail consiste à vérifier le fichier robots.txt, les balises noindex, les codes HTTP, les canonicals, les sitemaps et le rendu mobile.
Pour ChatGPT Search, OpenAI distingue trois agents aux rôles différents, et les confondre est une erreur fréquente : OAI-SearchBot pour l’apparition dans les réponses de recherche, GPTBot pour l’entraînement des modèles, et ChatGPT-User pour les actions déclenchées par un utilisateur [10]. Il est donc possible d’autoriser l’apparition dans la recherche tout en refusant l’usage pour l’entraînement.
Pilier 2 — Répondre à une intention précise
Une page doit résoudre une question identifiable. Un article qui survole dix sujets sans en traiter aucun sérieusement n’aide personne, ni le lecteur ni le moteur. Une bonne page GEO possède un sujet principal, des sous-questions logiques et un vocabulaire qui couvre les formulations réellement employées par le public.
Pilier 3 — Apporter une information non interchangeable
Les synthèses génériques sont faciles à remplacer. Les contenus les plus défendables contiennent des données propriétaires, des résultats de tests, une méthodologie, des observations de terrain, une analyse experte, des exemples précis ou un cadre original.
Principe : plus une information pourrait être copiée depuis cinquante autres pages, moins elle constitue une raison forte de citer votre site.
Pilier 4 — Rendre les affirmations vérifiables
Indiquez les sources, la date des données, le périmètre du test, la taille de l’échantillon, les limites et les hypothèses. Distinguez clairement un fait, une estimation et une opinion. Cette discipline renforce simultanément la confiance humaine, le SEO et la réutilisabilité par les IA. Elle vous protège aussi de l’erreur la plus coûteuse : affirmer un chiffre que vous ne pouvez pas défendre.
Pilier 5 — Construire une entité identifiable
Les moteurs doivent pouvoir relier un nom, une biographie, une expertise, des réalisations et des profils externes. Utilisez une identité cohérente sur le site, LinkedIn, GitHub, ORCID, HAL, Google Scholar ou les plateformes pertinentes pour votre activité. Une page auteur détaillée et des biographies identiques d’une plateforme à l’autre facilitent cette association.
Pilier 6 — Structurer le contenu pour l’humain
Les titres explicites, les résumés, les tableaux, les listes, les définitions et les réponses directes améliorent la lisibilité. Il ne faut pas pour autant découper artificiellement chaque idée en fragments minuscules : Google précise qu’aucun découpage spécial n’est requis, et que ses systèmes savent gérer plusieurs sujets sur une même page [3]. La priorité reste une structure naturelle et utile.
Pilier 7 — Mesurer les mentions et les citations
Une stratégie GEO ne se pilote pas uniquement avec le trafic Google. Il faut suivre les sources citées, les recommandations, les requêtes qui déclenchent une mention, les pages utilisées et les visites provenant des assistants IA — en acceptant que ces mesures soient bruitées (voir la section mesure plus bas).
GPTBot, OAI-SearchBot, ChatGPT-User : qui fait quoi
C’est le point technique où le plus d’erreurs se glissent, parce que bloquer « OpenAI » en bloc est le réflexe le plus courant — et le plus coûteux.
| Agent | Rôle | Conséquence si vous le bloquez |
|---|---|---|
GPTBot | Entraînement des modèles [10] | Votre contenu n’est plus utilisé pour l’entraînement. Cela ne vous retire pas de ChatGPT Search. |
OAI-SearchBot | Index de ChatGPT Search [10] | C’est lui qui gouverne l’apparition dans les réponses de recherche de ChatGPT. |
ChatGPT-User | Actions déclenchées par un utilisateur [10] | Ce n’est pas un crawler automatique : « robots.txt rules may not apply ». |
Deux subtilités à connaître. D’abord, bloquer OAI-SearchBot retire bien le site des réponses de ChatGPT Search, mais la documentation précise que le site « can still appear as navigational links » si l’URL est obtenue par un moteur tiers. Pour empêcher totalement l’apparition, il faut un noindex [10]. Ensuite, ChatGPT-User n’est pas utilisé pour explorer le web de façon automatique : « ChatGPT-User is not used for crawling the web in an automatic fashion », et parce que ces actions sont déclenchées par un utilisateur, les règles de robots.txt peuvent ne pas s’appliquer [10]. Un lecteur qui bloque tout OpenAI par excès de prudence rate ce distinguo.
Exemple de configuration, à adapter à votre politique :
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Sitemap: https://www.exemple.fr/sitemap.xml
Attention au blocage au niveau WAF ou CDN. Bloquer un robot via Cloudflare ou un pare-feu applicatif, c’est-à-dire au-dessus de robots.txt, supprime silencieusement votre éligibilité sans qu’aucun de vos fichiers ne le signale. Google le rappelle dans ses prérequis : il faut vérifier que l’exploration est autorisée dans robots.txt « and by any CDN or hosting infrastructure » [4]. Après toute modification de règles côté hébergeur, testez le rendu vu par le robot.
Faut-il créer un fichier llms.txt ?
llms.txt est une proposition de spécification visant à fournir aux modèles un point d’entrée lisible vers les ressources importantes d’un site [12]. Ce n’est ni un standard universel, ni un levier de référencement : Google indique explicitement ne pas l’utiliser pour son moteur de recherche [3].
Les données disponibles invitent à la prudence. Une étude Ahrefs portant sur 137 000 domaines conclut que 97 % des fichiers llms.txt ne reçoivent aucune requête, et que les robots de récupération IA représentent environ 1,1 % du total des requêtes observées [13]. Un test contrôlé mené sur dix sites aboutit à la même conclusion : huit sites sur dix n’observent aucun changement après implémentation [14].
Faut-il pour autant le supprimer de votre feuille de route ? Pas nécessairement, mais pas pour les raisons qu’on lit le plus souvent. llms.txt a un usage réel, et il est hors marketing : les agents de code — Claude Code, Cursor, Cline et d’autres — le lisent pour accéder à la documentation de bibliothèques et de projets. Si votre site publie de la documentation technique, un llms.txt bien tenu peut donc rendre service à des outils de développement. Pour la visibilité dans les moteurs génératifs grand public, en revanche, l’effet attendu est proche de zéro.
Dans tous les cas, il ne doit jamais remplacer un sitemap, une architecture claire, un robots.txt correct ou des pages HTML accessibles.
Audit GEO technique : la checklist essentielle
Crawl et indexation
- Le site répond en HTTPS sans erreur ni boucle de redirection.
- Les pages stratégiques renvoient un code HTTP 200.
- Le fichier
robots.txtne bloque pas les contenus importants — ni les robots de recherche IA que vous souhaitez autoriser. - Aucun pare-feu, WAF ou règle CDN ne bloque ces robots en amont.
- Les pages à indexer ne comportent pas de balise
noindex. - Le sitemap XML contient les URL canoniques et à jour.
- Chaque page possède une URL stable et descriptive.
- Les balises canonical ne pointent pas vers une page différente par erreur.
Architecture et HTML
- Un seul
<h1>principal décrit le sujet de la page. - Les
<h2>et<h3>forment une hiérarchie logique et portent des identifiants stables. - Le texte principal est présent dans le HTML rendu, sans dépendre d’une interaction.
- Les menus, boutons et formulaires utilisent des libellés accessibles.
- Les images importantes possèdent un texte alternatif descriptif.
- Le contenu fonctionne sur mobile et reste lisible sans zoom.
Performance et expérience
- Les images sont compressées et servies dans un format moderne.
- Le chargement différé est utilisé lorsque c’est pertinent.
- Les scripts tiers inutiles sont supprimés.
- Les éléments principaux ne se déplacent pas pendant le chargement.
- Les publicités et fenêtres modales ne masquent pas le contenu.
Comment créer des contenus que les IA ont intérêt à citer
Commencer par une réponse directe
Après chaque titre important, donnez d’abord la réponse en deux ou trois phrases, puis développez les nuances, les exemples et les preuves. Cette structure sert à la fois les lecteurs pressés et les systèmes qui recherchent un passage autonome. C’est aussi le levier le mieux documenté : la position du passage et sa pertinence thématique sont les deux seuls facteurs qui se reproduisent de façon stable dans la revue de 2026 [2].
Utiliser des formulations attribuables
Associez clairement les observations originales à leur source. Une formulation attribuée est plus facile à reprendre avec votre nom qu’une affirmation anonyme. L’important est qu’elle soit vraie : imaginons que vous publiiez une étude montrant que, sur une période donnée, l’intérêt pour les assistants spécialisés progresse plus vite que celui des assistants généralistes. La forme utile serait alors : « selon notre étude menée sur tel périmètre, entre telle et telle date, avec telle méthode, la progression observée est de… ». Un chiffre que vous ne pouvez pas documenter ne vous sera jamais attribué — il sera simplement ignoré, ou pire, repris sans vous.
Publier une méthodologie
Une étude sans méthode est difficile à évaluer, donc difficile à citer. Ajoutez un encadré indiquant :
- la période étudiée ;
- les catégories de sources analysées ;
- le volume de données ;
- les critères d’inclusion et d’exclusion ;
- les méthodes de déduplication ;
- les limites connues.
Il est possible d’être transparent sans révéler un algorithme propriétaire : décrivez le périmètre et les précautions, pas nécessairement les pondérations internes, les prompts ou les règles de scoring.
Créer quatre formats particulièrement citables
- Les études originales : données, enquêtes, analyses longitudinales et rapports.
- Les comparatifs méthodiques : critères explicites, protocole reproductible, résultats et limites.
- Les guides opérationnels : méthode étape par étape, exemples, checklist et erreurs fréquentes.
- Les ressources de référence : glossaires, bases de données, chronologies, tableaux et répertoires maintenus.
Écrire pour être compris, pas pour manipuler
Évitez l’accumulation artificielle de mots-clés, les affirmations sensationnalistes et les dizaines de pages quasi identiques. Google avertit que la production massive de contenus sans valeur ajoutée relève de l’abus de contenu à grande échelle [3], et que réécrire un texte dans le seul but de plaire aux systèmes d’IA ne sert à rien : ceux-ci comprennent les synonymes et le sens général d’une recherche [3]. L’IA peut accélérer la recherche et la structuration, mais l’expertise, la vérification et l’originalité doivent rester visibles.
Construire l’autorité et une identité numérique cohérente
Créer une page auteur complète
Une page auteur crédible doit contenir au minimum :
- le nom complet et une photographie professionnelle ;
- une biographie courte et une biographie détaillée ;
- les domaines d’expertise précis ;
- les formations, ouvrages, publications ou réalisations vérifiables ;
- les projets et organisations associés ;
- des liens vers les profils externes officiels ;
- une date de mise à jour.
Relier chaque contenu à son auteur
Affichez le nom de l’auteur, sa page de profil, la date de publication, la date de mise à jour et, si possible, une courte note expliquant pourquoi cette personne est qualifiée pour traiter le sujet.
Obtenir des preuves externes réelles
Les mentions indépendantes renforcent la crédibilité lorsqu’elles sont authentiques : interviews, podcasts, conférences, articles invités, dépôts GitHub, publications scientifiques, annuaires professionnels pertinents et retours d’utilisateurs vérifiables. À l’inverse, Google précise que rechercher des mentions inauthentiques n’est pas aussi utile qu’il y paraît, car ses systèmes de classement privilégient le contenu de qualité et que d’autres systèmes filtrent le spam [3].
Maintenir la cohérence des informations
Le nom, la fonction, la biographie courte, le site officiel et les principaux domaines d’expertise doivent être cohérents d’une plateforme à l’autre. Les variations mineures sont normales ; les contradictions importantes brouillent l’entité.
Données structurées : ce qu’elles apportent réellement
Les données structurées Schema.org aident les moteurs à comprendre la nature d’une page et certaines relations : article, auteur, organisation, fil d’Ariane, produit ou profil [18]. Elles peuvent rendre une page éligible à des présentations enrichies, mais elles ne garantissent ni classement, ni citation par une IA. Google est catégorique : « there’s no special schema.org structured data that you need to add » pour ses fonctionnalités génératives [4].
Pour une page GEO, les types les plus pertinents restent :
ArticleouBlogPostingpour le contenu [17] ;Personpour l’auteur ;Organizationpour l’éditeur ;BreadcrumbListpour le fil d’Ariane ;FAQPagelorsque la page contient une véritable FAQ visible [9].
Le point qui a changé en 2026. Le rich result FAQ est désormais entièrement déprécié. Google a annoncé en mai 2026 que la fonctionnalité n’est plus affichée dans les résultats de recherche, et sa documentation ne mentionne plus qu’un historique de dépréciation [8]. Avant mai 2026, l’affichage enrichi était limité aux sites considérés comme faisant autorité, notamment dans les domaines gouvernementaux et de santé ; ce n’est plus le cas. Autrement dit : conserver un balisage FAQPage ne produit plus aucun affichage enrichi, y compris pour les sites gouvernementaux et de santé.
Faut-il pour autant le retirer ? Non. Le balisage FAQPage reste valide, et Google ne sanctionne pas des données structurées inutilisées [8] [9]. Il conserve surtout un intérêt pour les moteurs génératifs et les systèmes de RAG, qui l’exploitent pour identifier une question et sa réponse sans ambiguïté. C’est exactement l’argument GEO : on ne balise plus pour obtenir une étoile dans Google, on balise pour être compris. À une condition, toujours la même : le balisage doit décrire fidèlement un contenu visible sur la page.
Comment mesurer sa visibilité dans ChatGPT, Gemini, Claude et Perplexity
Google Search Console : ce que le rapport dit — et ne dit pas
Le rapport « Generative AI » de Search Console est souvent présenté à tort comme un tableau de bord complet. Ce qu’il contient réellement : des impressions, les pages concernées, les pays, les appareils et les dates [6]. Ce qu’il ne contient pas : les clics, le CTR, la position moyenne et les requêtes.
Cette limitation n’est pas un retard de développement : elle est structurelle, et c’est la plus documentée du produit. Elle a une conséquence pratique directe — le rapport mesure une visibilité, pas une performance. Pour connaître les clics réellement générés, il faut croiser ces données avec le rapport Performance classique, dans lequel les fonctionnalités IA sont comptabilisées [4]. Annoncer un CTR issu de ce rapport serait une erreur de méthode.
Deuxième point à ne pas oublier : pour être éligible à l’affichage dans les fonctionnalités d’IA génératives de Google, une page doit être indexée et « included in Search generative AI features in Search Console ». C’est une condition distincte de l’indexation classique, et elle se vérifie séparément [3].
Les indicateurs à suivre
| Indicateur | Ce qu’il mesure | Fréquence |
|---|---|---|
| Taux de mention | Part des requêtes testées où votre nom ou votre marque apparaît | Hebdomadaire |
| Taux de citation | Part des réponses contenant un lien vers votre site | Hebdomadaire |
| Part de voix | Présence comparée à vos concurrents | Mensuelle |
| Pages citées | Nombre d’URL différentes utilisées comme sources | Mensuelle |
| Trafic référent IA | Sessions provenant de domaines ou paramètres associés aux assistants | Hebdomadaire |
| Conversions assistées | Inscriptions, ventes ou demandes après une visite issue d’une IA | Mensuelle |
Suivre les assistants dans l’analytics
OpenAI indique que les liens issus de ChatGPT Search peuvent inclure le paramètre utm_source=chatgpt.com [11]. C’est exact, mais insuffisant : depuis mai 2026, Google Analytics 4 classe nativement le trafic de ChatGPT, Gemini, DeepSeek, Copilot et Grok dans un canal « AI Assistant » (medium ai-assistant) [16]. Deux réserves à connaître : Perplexity n’est pas inclus et exige un groupe de canaux personnalisé, et le canal exclut les AI Overviews et AI Mode, qui restent classés en recherche organique [16]. Conservez donc également l’analyse des domaines référents, afin de ne pas dépendre d’un seul signal.
Un chiffre circule beaucoup pour relativiser tout cela : environ 70,6 % du trafic issu d’IA arriverait sans referrer. Il provient d’une analyse secondaire portant sur 446 000 visites, et doit être présenté comme tel — c’est une estimation, pas une donnée officielle. Elle suffit néanmoins à expliquer pourquoi aucun tableau de bord ne sera jamais exhaustif.
Pourquoi il faut un protocole de mesure stable
La variabilité des réponses génératives est le principal obstacle à une mesure honnête. La revue de 45 études documente des ordres de grandeur utiles : environ 65 % des sources citées changent d’un jour à l’autre ; le recouvrement des pages citées sur deux mois est de 18 % pour les AI Overviews contre 45 % pour le Google organique ; et, on l’a vu, seules 51,5 % des phrases générées sont entièrement soutenues par leurs citations [2]. Un graphique de citations qui bouge n’est donc pas nécessairement le signe d’une action réussie ou ratée : c’est souvent du bruit.
La variabilité vient aussi des outils. Un test ayant soumis le même site à sept plateformes de suivi a produit des comptages allant de 38 à 312 citations, soit un facteur huit, tout simplement parce que chaque outil définit différemment ce qu’est une « citation » — un lien cliquable pour les uns, une simple mention pour les autres. C’est l’argument le plus solide en faveur d’un protocole figé : mêmes requêtes, mêmes formulations, mêmes plateformes, mêmes dates de relevé, et comparaison de vos résultats avec eux-mêmes plutôt qu’avec un chiffre absolu.
Les outils de suivi : des ordres de grandeur
La presse spécialisée cite plusieurs plateformes de suivi de citations. Les tarifs ci-dessous sont des ordres de grandeur constatés en 2026, issus de sources secondaires, et à vérifier avant toute décision : ils changent vite et les périmètres ne sont pas comparables.
| Outil | Ordre de grandeur du tarif | Périmètre annoncé |
|---|---|---|
| Otterly.ai | environ 29 $/mois | 15 prompts suivis |
| Profound | offre Starter à 99 $/mois | ChatGPT uniquement |
| Peec AI | environ 89 €/mois | suivi multi-modèles |
| Semrush AI Toolkit | module d’environ 99 $/mois | intégré à la suite Semrush |
| Ahrefs Brand Radar | selon l’abonnement | suivi de marque |
Rappel de Google, qui vaut pour tous ces outils : « No third-party tool has access to our internal ranking or AI systems. » [3] Aucun d’entre eux ne voit les coulisses d’un moteur ; tous observent des réponses de l’extérieur, avec les limites que cela implique.
Exemple de grille de suivi
| Date | Plateforme | Requête | Mention | Citation | Position dans la réponse | Concurrents cités |
|---|---|---|---|---|---|---|
| 24/09/2026 | ChatGPT | Comment être cité par les IA ? | Oui/Non | Oui/Non | Début/Milieu/Fin | Liste |
Plan d’action GEO sur 90 jours
Jours 1 à 30 — Corriger les fondations
- Vérifier indexation,
robots.txt, sitemap, canonicals, codes HTTP — et l’absence de blocage WAF ou CDN en amont. - Autoriser explicitement les robots de recherche IA compatibles avec votre politique, en distinguant
GPTBot,OAI-SearchBotetChatGPT-User[10]. - Trancher explicitement la question de l’inclusion dans les fonctions IA de Google, via le contrôle dédié dans Search Console (Paramètres > Search generative AI). Ce contrôle permet d’exclure un site des AI Overviews, d’AI Mode et des fonctions IA de Discover, et n’a aucun effet sur le classement organique : c’est un choix éditorial, pas une pénalité [7].
- Créer ou enrichir les pages À propos, Auteur et Contact.
- Ajouter les données structurées
Article,PersonetBreadcrumbList— en gardant en tête qu’elles n’ont aucun effet spécifique sur les fonctions génératives [4]. - Identifier 20 à 50 requêtes stratégiques et établir la mesure initiale, avec un protocole figé.
- Mettre à jour les cinq pages qui reçoivent déjà le plus d’impressions.
Jours 31 à 60 — Produire des actifs citables
- Publier une étude originale ou un rapport fondé sur vos données, avec méthodologie et limites.
- Créer un guide de référence répondant à une question centrale de votre domaine.
- Publier un comparatif avec protocole et critères explicites.
- Ajouter une FAQ utile aux pages importantes — pour la compréhension, pas pour un rich result qui n’existe plus [8].
- Créer des tableaux, définitions et checklists réutilisables.
- Renforcer le maillage interne entre guides, études et pages de profil.
Jours 61 à 90 — Développer l’autorité et mesurer
- Diffuser les résultats sur LinkedIn, YouTube, newsletter ou plateformes spécialisées.
- Obtenir au moins trois mentions externes légitimes — des mentions réelles, pas des insertions artificielles.
- Comparer les citations avant et après publication, en tenant compte de la variabilité quotidienne.
- Mettre à jour les contenus qui génèrent des impressions mais peu de clics, en croisant le rapport Performance classique.
- Consolider les pages proches au lieu de multiplier les articles redondants.
- Documenter ce qui fonctionne dans un tableau de bord GEO mensuel, et ce qui n’a rien changé.
Les erreurs GEO les plus fréquentes
- Traiter le GEO comme un hack indépendant du SEO. Sans crawl, indexation et qualité, le reste est fragile.
- Produire des centaines de pages génériques. Le volume sans valeur originale augmente le risque de dilution et tombe sous le coup des politiques anti-spam [3].
- Inventer des statistiques. Une donnée non sourcée peut détruire la confiance, et les systèmes de génération ont de plus en plus de mal à soutenir des affirmations qu’ils ne peuvent pas vérifier [2].
- Masquer l’auteur. Une page sans identité claire est plus difficile à attribuer.
- Confondre longueur et profondeur. Un article long n’est utile que si chaque section apporte une réponse.
- Surutiliser le balisage Schema.org. Le balisage doit refléter exactement le contenu visible.
- Considérer llms.txt comme indispensable. Il reste optionnel, n’est pas utilisé par Google Search [3], et les données montrent qu’il est très rarement lu par les robots de récupération [13].
- Attendre un rich result FAQ. Il n’existe plus, pour personne [8].
- Négliger les mises à jour. Les contenus et les modèles vieillissent vite ; la date et l’historique des modifications comptent.
- Mesurer seulement les clics, ou croire un chiffre de citations isolé. Un comptage sans protocole stable mesure surtout le bruit de la plateforme.
Checklist GEO prête à l’emploi
- La page répond à une question précise dès les premières lignes.
- Le contenu est indexable, rapide et lisible sur mobile.
- Aucun robot souhaité n’est bloqué par un fichier, un WAF ou un CDN.
- La décision d’inclusion dans les fonctions IA de Google est prise explicitement.
- L’auteur et l’éditeur sont clairement identifiés.
- Les affirmations importantes sont sourcées et datées.
- La page contient au moins un élément original difficile à remplacer.
- Les titres décrivent exactement les réponses présentes et portent des identifiants stables.
- Les tableaux et listes servent une comparaison réelle.
- Les limites et incertitudes sont explicites.
- Les données structurées correspondent au contenu visible.
- Le contenu est relié à d’autres pages pertinentes du site.
- Les profils externes confirment l’identité et l’expertise.
- Les citations et mentions sont suivies dans un tableau de bord, avec un protocole figé.
Conclusion : le GEO récompense la clarté, les preuves et l’originalité
Le Generative Engine Optimization n’est pas une collection de hacks. Les moteurs génératifs ont besoin de contenus accessibles, fiables et suffisamment distinctifs pour soutenir leurs réponses. Une stratégie durable combine donc un SEO technique sain, une expertise identifiable, des données originales, une structuration claire et un suivi régulier des citations.
La lecture des sources primaires invite à la mesure plutôt qu’à l’enthousiasme ou au cynisme. L’article fondateur de 2023 a montré qu’un effet existait dans un cadre expérimental donné [1] ; la revue critique de 2026 montre que cet effet est conditionnel, que les recettes générales se transfèrent mal, et qu’aucun levier ne démontre à ce jour d’effet causal stable dans la durée [2]. Cela ne signifie pas que le GEO ne marche pas. Cela signifie qu’il faut cesser de le vendre comme une mécanique et le traiter comme ce qu’il est : une discipline de fonds, dont les résultats se lisent sur des mois et se mesurent avec méthode.
Le meilleur investissement n’est donc pas de produire davantage de textes génériques. Il consiste à publier des ressources que les lecteurs, les journalistes, les moteurs de recherche et les IA ont une raison réelle de consulter : études, benchmarks, méthodes, données et analyses difficiles à trouver ailleurs.
Questions fréquentes
Qu’est-ce que le GEO, en une phrase ?
Le Generative Engine Optimization regroupe les pratiques qui visent à rendre un contenu suffisamment accessible, explicite, fiable et original pour qu’un système d’IA puisse le retrouver, l’utiliser comme preuve et l’attribuer à sa source. Il ne remplace pas le SEO : il en dépend.
D’où vient le terme GEO et que dit la recherche ?
Le terme vient de l’article « GEO: Generative Engine Optimization » de Pranjal Aggarwal et coauteurs, soumis le 16 novembre 2023 et accepté à KDD 2024. C’est de ce travail que vient le chiffre de « +40 % de visibilité ». La première revue critique, signée Olivier Martinez (15 juillet 2026, 45 études), nuance ce résultat : il est valide dans un cadre expérimental donné, mais conditionnel et sans effet causal durable démontré.
Le GEO remplace-t-il le SEO ?
Non. Google indique que ses fonctionnalités génératives s’appuient sur ses systèmes de classement et de qualité existants, et que les bonnes pratiques SEO restent valables. En pratique, le GEO est une couche supplémentaire : sans crawl, indexation et contenu de qualité, rien d’autre ne tient.
Peut-on garantir une citation dans ChatGPT ou Gemini ?
Non. Aucune technique ni aucun prestataire ne peut garantir une citation : les réponses varient selon la requête, le contexte, la date et le modèle. La revue de 45 études constate même qu’aucune technique examinée ne démontre d’effet causal stable, longitudinal et multi-plateforme sur la découvrabilité organique.
Le rapport Generative AI de Search Console permet-il de suivre les clics et le CTR ?
Non, et c’est une limitation structurelle documentée. Le rapport contient les impressions, les pages, les pays, les appareils et les dates — mais ni clics, ni CTR, ni position moyenne, ni requêtes. Il mesure une visibilité, pas une performance. Pour les clics, il faut croiser avec le rapport Performance classique.
Peut-on apparaître dans les AI Overviews sans optimisation spéciale ?
Oui. Google l’écrit explicitement : « There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary. » Une page doit être indexée et éligible à un extrait dans Google Search, ce qui relève des prérequis techniques habituels.
Faut-il autoriser OAI-SearchBot et bloquer GPTBot ?
C’est une configuration possible et courante. OpenAI distingue trois agents : GPTBot (entraînement), OAI-SearchBot (index de ChatGPT Search) et ChatGPT-User (actions déclenchées par un utilisateur, non automatiques). Bloquer GPTBot n’enlève pas le site des réponses de ChatGPT Search ; bloquer OAI-SearchBot, si, mais l’URL peut encore apparaître comme lien de navigation.
Un blocage au niveau du pare-feu ou du CDN pose-t-il problème ?
Oui, et c’est un point souvent oublié. Bloquer un robot via Cloudflare ou un WAF, c’est-à-dire au-dessus de robots.txt, supprime silencieusement l’éligibilité sans qu’aucun fichier ne le signale. Google demande de vérifier que l’exploration est autorisée « in robots.txt, and by any CDN or hosting infrastructure ».
Le fichier llms.txt améliore-t-il la visibilité dans les IA ?
Les données disponibles sont défavorables. Une étude Ahrefs sur 137 000 domaines conclut que 97 % des fichiers llms.txt ne reçoivent aucune requête, et un test contrôlé sur dix sites n’observe aucun changement sur huit d’entre eux. Google indique explicitement ne pas l’utiliser. llms.txt garde un usage réel mais hors marketing : la documentation technique lue par les agents de code.
FAQPage est-il encore utile en 2026 ?
Le rich result FAQ est entièrement déprécié depuis mai 2026 : il ne produit plus aucun affichage enrichi, y compris pour les sites gouvernementaux et de santé. Le balisage reste valide et sans danger — Google ne sanctionne pas des données structurées inutilisées — et conserve un intérêt pour les moteurs génératifs et les systèmes de RAG, qui l’utilisent pour identifier une question et sa réponse.
Comment suivre le trafic venu de ChatGPT ou de Perplexity ?
OpenAI mentionne le paramètre utm_source=chatgpt.com, mais ce n’est pas suffisant. Depuis mai 2026, GA4 classe nativement le trafic de ChatGPT, Gemini, DeepSeek, Copilot et Grok dans un canal « AI Assistant ». Deux limites : Perplexity n’est pas inclus et exige un groupe de canaux personnalisé, et les AI Overviews restent classées en recherche organique.
Pourquoi les comptages de citations varient-ils autant d’un outil à l’autre ?
Parce que chaque outil définit différemment ce qu’est une « citation » : lien cliquable pour certains, simple mention pour d’autres. Un test ayant soumis le même site à sept plateformes a produit des comptages allant de 38 à 312 citations, soit un facteur huit. C’est ce qui justifie un protocole de mesure figé, comparé à lui-même plutôt qu’à un chiffre absolu.
Sources
- GEO: Generative Engine OptimizationPranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande — KDD 2024
Article fondateur du GEO, soumis le 16 novembre 2023, accepté à KDD 2024. C’est de ce travail que vient le chiffre de « +40 % de visibilité » fréquemment cité.
- Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)Olivier Martinez — prépublication arXiv, 15 juillet 2026
Prépublication non encore évaluée par les pairs. Revue de 45 études. Établit que la pertinence thématique et la position du contexte sont les leviers les plus reproductibles, que les heuristiques génériques se transfèrent mal, que certaines réécritures orientées citation dégradent la récupération, et qu’aucune technique examinée ne montre d’effet causal stable sur la découvrabilité organique.
- Optimizing your website for generative AI features on Google SearchGoogle Search Central
Position officielle de Google : meilleures pratiques SEO applicables aux fonctions génératives, description officielle du query fan-out, liste des pratiques à ignorer (llms.txt, chunking, réécriture pour l’IA), et avertissement « No third-party tool has access to our internal ranking or AI systems. »
- AI features and your websiteGoogle Search Central
Contient la citation « There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary. », la mention « no special schema.org structured data that you need to add », le prérequis d’exploration « in robots.txt, and by any CDN or hosting infrastructure », et le fait que les fonctions IA sont comptabilisées dans le rapport Performance.
- Guidance on generative AI contentGoogle Search Central
Cadre de Google sur les contenus assistés par IA : les bonnes pratiques restent celles du contenu utile et fiable, et la production massive sans valeur ajoutée relève de l’abus de contenu à grande échelle.
- Introducing Search Generative AI performance reports in Search ConsoleGoogle Search Central Blog
Décrit le contenu exact du rapport : impressions, pages, pays, appareils et dates — sans clics, CTR, position moyenne ni requêtes. Précise aussi le déploiement mondial au 31 août 2026.
- Search generative AI controlGoogle Search Console Help
Contrôle d’exclusion des fonctions IA génératives de Search (Settings > Search generative AI), couvrant AI Overviews, AI Mode et les fonctions IA de Discover. Confirme que ce contrôle « isn’t used as a ranking or inclusion signal affecting other parts of Search ».
- FAQ (FAQPage) structured dataGoogle Search Central
Documentation de dépréciation : le rich result FAQ « is no longer shown in Google Search results » depuis l’annonce de mai 2026, alors qu’il était auparavant réservé aux sites gouvernementaux et de santé faisant autorité.
- FAQPageschema.org
Définition du type FAQPage. Le vocabulaire reste valide et peut être utilisé pour décrire une FAQ visible, indépendamment de l’arrêt des rich results Google.
- Overview of OpenAI crawlersOpenAI
Distingue GPTBot (entraînement), OAI-SearchBot (index de ChatGPT Search) et ChatGPT-User (« not used for crawling the web in an automatic fashion », « robots.txt rules may not apply »). Précise qu’un site exclu d’OAI-SearchBot « can still appear as navigational links ».
- Publishers and developers FAQOpenAI
FAQ destinée aux éditeurs et développeurs : paramètres de suivi transmis par ChatGPT Search (utm_source=chatgpt.com) et modalités de contrôle d’accès des agents OpenAI.
- The /llms.txt filellms-txt
Proposition de spécification du fichier llms.txt, qui fournit aux modèles un point d’entrée lisible vers les ressources importantes d’un site. Ce n’est pas un standard universel.
- We Analyzed 137K Sites: 97% of llms.txt Files Never Get ReadAhrefs
Étude sur 137 000 domaines : 97 % des fichiers llms.txt ne reçoivent aucune requête, et les robots de récupération IA représentent environ 1,1 % des requêtes observées.
- Does llms.txt matter?Search Engine Land
Test contrôlé sur dix sites : huit n’observent aucun changement après implémentation d’un fichier llms.txt.
- Update: 38% of AI Overview Citations Pull From The Top 10Ahrefs
Analyse de 863 000 pages de résultats et 4 millions d’URL citées (mars 2026) : la part des citations d’AI Overviews issues du top 10 organique passe de 76 % en juillet 2025 à 38 %, avec 37,9 % top 10, 31,2 % en positions 11-100 et 31 % hors top 100.
- Default channel groupsGoogle Analytics Help
Définit le canal « AI Assistant » (medium ai-assistant) : trafic provenant de ChatGPT, Gemini, DeepSeek, Copilot ou Grok. Exclut les AI Overviews et AI Mode, classés en recherche organique, et ne liste pas Perplexity.
- Article structured dataGoogle Search Central
Décrit les propriétés des types Article et BlogPosting, utilisés pour relier un contenu à son auteur et à son éditeur.
- Introduction to structured dataGoogle Search Central
Principes généraux du balisage Schema.org : aide le moteur à comprendre la nature d’une page et ses relations, sans garantir classement ni affichage enrichi.
Chiffres et affirmations vérifiés sur ces sources le .



