Aller au contenu
Intelligence Stratégique
DERNIÈRE PUBLICATION 27.09.26

GEO & IA10 MIN DE LECTURE

GEO SEO : ce que la recherche sur le Generative Engine Optimization mesure vraiment

Le GEO vient d'un article de recherche de 2023 dont les gains tiennent dans un laboratoire précis. Ce que l'on sait des moteurs génératifs, d'après leur documentation, et ce qui reste de la conjecture.

EN BREF

  • Le terme GEO a été introduit par Aggarwal et al. (arXiv, novembre 2023), article publié ensuite aux actes de KDD 2024.
  • Leur meilleure méthode améliore de 41 % une mesure de visibilité, sur un moteur simulé avec GPT-3.5 et cinq sources par requête : un résultat de laboratoire, pas une promesse de trafic.
  • Le code publié par les auteurs demande au modèle d’ajouter des citations et des statistiques, y compris inventées : ces « méthodes » ne sont pas transposables telles quelles.
  • Google documente ses AI Overviews : aucune exigence ni balisage spécial, fichier llms.txt ignoré, rapport dédié dans Search Console.
  • OpenAI et Perplexity publient la liste de leurs robots d’exploration : c’est le principal levier technique vérifiable.

DAMIEN HERNANDEZPUBLIÉ LE 27.09.2026 9 SOURCES LIÉES

Réponse immédiate

Le GEO SEO, ou Generative Engine Optimization, désigne le travail visant à rendre un contenu visible et cité dans les réponses des moteurs génératifs (AI Overviews de Google, ChatGPT, Perplexity). Le terme vient d’un article de recherche de 2023, dont les gains mesurés tiennent dans un cadre expérimental précis. Google indique pour sa part qu’optimiser pour ses fonctions d’IA reste du SEO.

GEO SEO : de quoi parle-t-on ?

Un moteur génératif est un système qui combine un moteur de recherche et un modèle de langage : il récupère des documents, puis rédige une réponse synthétique qui cite certains d’entre eux. Les AI Overviews et le mode IA de Google, la recherche de ChatGPT ou Perplexity fonctionnent sur ce principe. Google décrit par exemple la technique du « query fan-out » : le modèle lance plusieurs recherches apparentées pour compléter la réponse.

Le GEO SEO est l’expression que le marché emploie pour désigner l’optimisation d’un contenu en vue d’apparaître dans ces réponses. On rencontre aussi AEO (answer engine optimization), « SEO IA » ou « référencement ChatGPT ». Ces étiquettes recouvrent des pratiques très diverses, de la simple hygiène technique à des promesses invérifiables.

Google a pris position. Son guide d’optimisation pour les fonctions d’IA générative (mis à jour le 10/07/2026) indique que, de son point de vue, optimiser pour la recherche générative revient à optimiser pour l’expérience de recherche, donc à faire du SEO, et renvoie les lecteurs tentés par des prestations « GEO » ou « AEO » vers ses conseils pour évaluer un prestataire SEO.

D’où vient le terme : l’article de recherche de 2023

Le terme a été introduit par l’article « GEO: Generative Engine Optimization », de Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan et Ameet Deshpande. Déposé sur arXiv le 16 novembre 2023 (version 3 du 28 juin 2024), il a été publié dans les actes de la 30e conférence ACM SIGKDD (KDD 2024, Barcelone, 25 au 29 août 2024), DOI 10.1145/3637528.3671900. Les auteurs y présentent le GEO comme un cadre d’optimisation de type boîte noire, destiné aux créateurs de contenu face à des moteurs dont ils ne voient pas le fonctionnement.

Le dispositif expérimental

  • Le banc d’essai GEO-bench : 10 000 requêtes issues de neuf jeux de données (dont MS Marco, Natural Questions, ELI5 et des requêtes de la page Discover de Perplexity), réparties en 8 000 pour l’entraînement, 1 000 pour la validation et 1 000 pour le test.
  • Le moteur : un moteur génératif simulé. Pour chaque requête, les cinq premiers résultats de Google sont récupérés, puis le modèle gpt-3.5-turbo rédige une réponse citée ; cinq réponses sont échantillonnées.
  • L’intervention : pour chaque requête, une seule des cinq sources est tirée au hasard et réécrite par GPT-3.5 selon l’une des neuf méthodes ; les quatre autres restent inchangées.
  • Les neuf méthodes : ton plus assuré (Authoritative), ajout de statistiques, bourrage de mots-clés, ajout de sources citées, ajout de citations, simplification, fluidité, mots rares, termes techniques.
  • Les mesures : la part de mots de la réponse attribuée à la source, pondérée par sa position (Position-Adjusted Word Count), et une « impression subjective » notée par GPT-3.5 sur sept critères (pertinence, influence, unicité, position perçue, quantité perçue, probabilité de clic, diversité).

Les résultats publiés

Sur le jeu de test, avec le moteur simulé, les auteurs obtiennent les scores suivants (tableau 1 de l’article, moyennes sur cinq tirages).

Méthode Visibilité pondérée par la position Impression subjective (moyenne)
Aucune optimisation (référence) 19,3 19,3
Bourrage de mots-clés 17,7 20,2
Mots rares 20,5 20,4
Simplification 22,0 20,5
Ton assuré 21,3 22,9
Termes techniques 22,7 21,4
Fluidité 24,7 21,9
Ajout de sources citées 24,6 21,9
Ajout de statistiques 25,2 23,7
Ajout de citations 27,2 24,7

Les meilleures méthodes améliorent la référence de 41 % sur la première mesure et de 28 % sur la seconde. Le bourrage de mots-clés, pratique héritée du vieux SEO, fait moins bien que l’absence d’optimisation sur la mesure principale. Trois autres résultats méritent l’attention :

  • L’effet dépend du rang. L’ajout de sources citées augmente de 115,1 % la visibilité d’une source classée cinquième dans les résultats de Google, mais la réduit de 30,3 % pour une source classée première. Les gains profitent surtout aux sources mal classées.
  • L’effet dépend du domaine. Le ton assuré aide surtout sur les questions de débat et d’histoire ; les statistiques, sur le droit et les questions d’opinion.
  • Le test sur Perplexity est partiel. Sur 200 requêtes, les sources ont été fournies à Perplexity en fichiers téléversés, faute de pouvoir lui imposer des URL. L’ajout de citations y passe de 24,1 à 29,1 sur la mesure principale ; le bourrage de mots-clés fait environ 10 % moins bien que la référence.

Ce que l’expérience ne dit pas

Les auteurs reconnaissent eux-mêmes plusieurs limites : les moteurs évoluent et les méthodes devront s’adapter, la nature des requêtes change, et l’effet des modifications sur le classement dans les moteurs de recherche n’a pas été évalué. D’autres limites découlent du protocole :

  • Visibilité n’est pas trafic. Les mesures portent sur la place d’une source dans le texte généré, pas sur les clics, les visites ou les ventes.
  • Un jeu à somme nulle. Une seule source est modifiée face à quatre sources inchangées. Si toutes les sources appliquent la même méthode, rien n’indique que le gain subsiste.
  • Un moteur de 2023. Le moteur principal est simulé avec GPT-3.5, et l’évaluation subjective est elle-même confiée à GPT-3.5. Les moteurs commerciaux actuels récupèrent et classent leurs sources autrement.
  • Du contenu inventé. L’article renvoie à son dépôt GitHub pour les consignes utilisées. Dans le fichier src/geo_functions.py (consulté le 27/09/2026), la consigne d’ajout de citations demande d’en ajouter « even though fake and artificial », celle d’ajout de statistiques d’en ajouter « even if hypothetical », et celle d’ajout de sources autorise à les inventer pourvu qu’elles paraissent plausibles. Les gains mesurés récompensent donc en partie des contenus fabriqués. Pour une publication qui s’engage à ne publier que des faits sourcés, ces méthodes ne sont pas applicables telles quelles.

Ce que l’article établit reste utile : dans son dispositif, une source qui contient des faits précis, attribués et chiffrés est davantage reprise par le modèle. Il n’établit ni une recette, ni un effet durable sur un moteur commercial donné.

Ce que l’on sait : la documentation officielle

Google : AI Overviews et mode IA

La page « AI features and your website » (mise à jour le 10/12/2025) indique qu’il n’existe aucune exigence supplémentaire ni optimisation spéciale pour apparaître dans les AI Overviews ou le mode IA : la page doit être indexée et pouvoir s’afficher avec un extrait. Les directives habituelles (nosnippet, data-nosnippet, max-snippet, noindex) permettent de limiter ce qui est repris. Le guide d’optimisation de Google ajoute que Google Search n’utilise pas les fichiers llms.txt, qu’aucun découpage du contenu en fragments n’est nécessaire, qu’aucun balisage schema.org particulier n’est requis, et que multiplier les pages pour chaque variante de requête peut relever de sa politique contre l’abus de contenu à grande échelle.

Deux précisions techniques évitent des confusions. Le jeton Google-Extended sert à refuser que le contenu serve à entraîner les modèles Gemini ou à ancrer leurs réponses dans certains produits ; selon la documentation des robots de Google, il n’a aucun effet sur l’inclusion ou le classement dans Google Search. Et depuis le 31 août 2026, selon le blog Search Central, tous les sites disposent dans Search Console de rapports dédiés aux fonctions d’IA générative : impressions, pages, pays, appareils et dates. Les clics n’y figurent pas dans la liste annoncée.

OpenAI et Perplexity : les robots d’exploration

Robot Éditeur Rôle déclaré robots.txt
OAI-SearchBot OpenAI Faire apparaître des sites dans les fonctions de recherche de ChatGPT Un site qui le bloque n’apparaît pas dans les réponses de recherche de ChatGPT
GPTBot OpenAI Collecter du contenu susceptible de servir à l’entraînement des modèles Son blocage est distinct de celui d’OAI-SearchBot
ChatGPT-User OpenAI Visiter une page à la demande d’un utilisateur Les règles peuvent ne pas s’appliquer, l’action venant d’un utilisateur
PerplexityBot Perplexity Faire apparaître et lier des sites dans les résultats de Perplexity ; non utilisé pour entraîner des modèles Respecte robots.txt
Perplexity-User Perplexity Visiter une page pour répondre à la question d’un utilisateur Ignore en général robots.txt

Sources : documentation des robots d’OpenAI et documentation des robots de Perplexity, consultées le 27/09/2026. Bloquer par erreur OAI-SearchBot ou PerplexityBot est l’une des rares causes d’absence qu’un éditeur peut vérifier lui-même.

Ce qui relève de la conjecture

Au-delà de ces documents, la plupart des affirmations du marché du GEO SEO ne sont pas vérifiables de l’extérieur. Aucun éditeur de moteur génératif ne publie la liste de ses critères de sélection des sources. Les réponses varient selon la formulation, le moment, la langue et l’historique de l’utilisateur, ce qui rend fragile toute « part de visibilité IA » calculée sur quelques requêtes. Les listes de « facteurs de classement GEO » ne citent en général ni protocole ni échantillon. La règle de cette publication s’applique ici comme ailleurs : un chiffre sans protocole, sans période et sans échantillon n’est pas repris.

Ce que cela change pour l’information d’affaires

Pour la veille stratégique, un moteur génératif est un point d’entrée rapide, pas une source : chaque fait qu’il avance doit être remonté à son document d’origine. Pour la due diligence, une synthèse d’IA sur une entreprise ne remplace pas la lecture des registres officiels. Pour l’intelligence économique, le sujet touche à l’influence : si des contenus fabriqués peuvent gagner en visibilité dans des réponses générées, comme le suggère l’expérience de 2023, la vérification des sources devient une compétence défensive autant qu’éditoriale.

Méthode : observer sa visibilité dans les moteurs génératifs

Avant toute démarche de GEO SEO, mieux vaut mesurer la situation réelle. Les étapes suivantes n’utilisent que des données de première main.

  1. Vérifier l’accès technique. Lire le fichier robots.txt et s’assurer qu’OAI-SearchBot, PerplexityBot et Googlebot ne sont pas bloqués par erreur, en distinguant les robots de recherche des robots d’entraînement.
  2. Consulter les données de première main. Ouvrir le rapport consacré à l’IA générative dans Search Console pour les impressions dans les AI Overviews et le mode IA ; filtrer les journaux du serveur sur les agents déclarés par OpenAI et Perplexity.
  3. Fixer un panel de requêtes. Une vingtaine de questions réelles de votre domaine, formulées à l’avance et conservées à l’identique.
  4. Relever à date fixe et archiver. Interroger chaque moteur plusieurs fois, noter la date, le moteur, les sources citées, et conserver des captures datées.
  5. Publier le protocole avec le chiffre. Toute mesure diffusée indique son périmètre, sa période et son échantillon, et distingue citation, impression et clic.
  6. Améliorer le contenu pour le lecteur. Faits précis, sources primaires liées, auteurs identifiés, données originales : ce qui rend une page plus utile est aussi ce que la documentation officielle recommande. Jamais de chiffre ou de citation inventés.

Limites et précautions

  • Aucune méthode de GEO SEO ne garantit d’être cité : le fonctionnement interne des moteurs génératifs n’est pas public.
  • Les résultats de l’article de 2023 valent pour son dispositif (GPT-3.5, cinq sources, une seule modifiée) et ne se généralisent pas à un moteur commercial actuel.
  • Ajouter des statistiques, des citations ou des sources inventées expose à la désinformation et à la perte de confiance, quels que soient les gains de visibilité.
  • La documentation des éditeurs change souvent : les dates de mise à jour citées ici sont celles relevées le 27/09/2026.

Questions fréquentes

Qu’est-ce que le GEO ?

Le Generative Engine Optimization désigne l’optimisation d’un contenu pour qu’il soit repris et cité dans les réponses des moteurs génératifs. Le terme vient d’un article de recherche publié sur arXiv en 2023 puis à KDD 2024.

Quelle est la différence entre le SEO et le GEO ?

Le SEO vise le classement dans une liste de résultats ; le GEO vise la reprise dans une réponse rédigée par une IA. Google considère que, pour ses propres fonctions d’IA, il s’agit toujours de SEO, puisqu’elles s’appuient sur son index et ses systèmes de classement.

Comment s’appelle le SEO pour IA ?

On parle de GEO (Generative Engine Optimization), d’AEO (Answer Engine Optimization), de SEO IA ou de référencement IA. Aucun de ces termes n’a de définition normalisée.

Le GEO peut-il remplacer le SEO ?

Rien ne l’indique : les AI Overviews exigent qu’une page soit indexée et éligible à un extrait, et les moteurs génératifs s’appuient sur des résultats de recherche. Les deux se recouvrent largement.

Faut-il créer un fichier llms.txt ?

Pour Google, non : son guide indique que Google Search n’utilise pas ces fichiers et qu’ils n’aident ni ne nuisent à la visibilité. Aucun document consulté d’OpenAI ou de Perplexity n’en fait une condition.

Sources

  1. P. Aggarwal, V. Murahari, T. Rajpurohit, A. Kalyan, K. Narasimhan, A. Deshpande, « GEO: Generative Engine Optimization », arXiv:2311.09735, arxiv.org, v1 16/11/2023, v3 28/06/2024 ; KDD 2024, doi.org/10.1145/3637528.3671900.
  2. Dépôt de code de l’article, fichier src/geo_functions.py, GEO-optim, github.com, consulté le 27/09/2026.
  3. « AI features and your website », Google Search Central, developers.google.com, mis à jour le 10/12/2025.
  4. « Optimizing your website for generative AI features on Google Search », Google Search Central, developers.google.com, mis à jour le 10/07/2026.
  5. « Introducing Search Generative AI performance reports in Search Console », Google Search Central Blog, developers.google.com, 03/06/2026 (note du 31/08/2026).
  6. « Google’s common crawlers » (Google-Extended), Google, developers.google.com, mis à jour le 14/07/2026.
  7. « Overview of OpenAI Crawlers », OpenAI, developers.openai.com, consulté le 27/09/2026.
  8. « Perplexity Crawlers », Perplexity, docs.perplexity.ai, consulté le 27/09/2026.

À jour au 27/09/2026.

PUBLIÉ LE 27.09.2026 · UNE ERREUR ? SIGNALEZ-LA