GeoAndSeo
Guide

SEO par IA : être cité par ChatGPT, Claude, Perplexity et Gemini

Être cité par un moteur de réponse suppose trois choses : que ses robots puissent lire vos pages, qu'il comprenne ce que vous dites sans effort, et qu'il vous juge assez fiable pour vous nommer. Aucun éditeur ne publie ses critères, aucune citation ne se garantit. Ce guide explique comment chacun des quatre systèmes s'alimente, et comment vérifier ce qui se passe réellement.

Un moteur de réponse ne classe pas, il choisit

Un moteur de recherche classique vous rend une liste et laisse l'utilisateur arbitrer. Un moteur de réponse rédige une réponse et ne mentionne que les quelques sources qui lui ont servi. La différence de conséquence est brutale : en recherche classique, la dixième position rapporte encore des visites ; dans une réponse générée, on est cité ou on n'existe pas. Nous développons cette opposition dans notre page GEO vs SEO.

Deuxième différence, moins souvent dite : ces systèmes ne s'alimentent pas tous de la même façon. Certains disposent d'un index qu'ils construisent eux-mêmes, d'autres s'appuient sur celui d'un partenaire, d'autres encore vont chercher la page au moment précis où la question est posée. Et tous conservent, en arrière-plan, un corpus d'entraînement figé qui ne contient rien de ce que vous publierez demain. Comprendre laquelle de ces voies s'applique à votre cas évite de travailler dans le vide.

Une note sur ce que vaut ce guide. Les noms de robots et les mécanismes d'alimentation décrits ci-dessous sont documentés publiquement par leurs éditeurs. En revanche, tout ce qui touche à la sélection des sources relève de l'observation répétée : nous écrivons « semble favoriser » quand c'est le cas, et la section consacrée à ce que personne ne sait est à lire avant de bâtir un plan d'action.

Les quatre moteurs, un par un

Pour chacun : comment il s'alimente, quels robots il envoie, ce qui semble favoriser une citation, et comment vérifier votre présence.

ChatGPT — comment il choisit ses sources

Éditeur : OpenAI

Comment il s'alimente

Deux sources distinctes, qu'il faut cesser de confondre. D'un côté, les connaissances acquises pendant l'entraînement du modèle : un corpus figé, arrêté à une date, qui ne contient rien de ce que vous publierez demain. De l'autre, une recherche en direct sur le web, déclenchée quand la question porte sur l'actualité, sur un lieu, sur un prix, ou quand l'utilisateur la demande explicitement. C'est cette seconde voie qui produit des réponses avec des liens cliquables, et c'est la seule sur laquelle un site publié cette année peut agir à court terme.

Les robots qu'il utilise

RobotCe qu'il fait
GPTBotcollecte destinée à l'entraînement des modèles
OAI-SearchBotconstitution de l'index utilisé par la recherche dans ChatGPT
ChatGPT-Userrécupération d'une page au moment où un utilisateur la demande

Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.

Ce qui semble favoriser une citation

  • Une page qui répond à la question posée dans les premières lignes, sans exiger de lire trois paragraphes d'introduction avant d'arriver au fait.
  • Une source que le reste du web reconnaît déjà : citée, liée, mentionnée ailleurs. Un moteur de réponse hérite en grande partie de la réputation construite pour la recherche classique.
  • Des informations vérifiables et datées, plutôt que des affirmations générales sans origine.

Comment vérifier que vous y apparaissez

Deux méthodes, complémentaires. Côté serveur, vos journaux d'accès portent les noms de robots ci-dessus : leur présence prouve que vos pages sont récupérées, ce qui est le préalable à toute citation. Côté usage, posez dans ChatGPT, avec la recherche activée, les questions que posent réellement vos clients, et notez si vous apparaissez. Répétez à intervalles réguliers : une seule observation ne dit rien, une série en dit beaucoup.

Claude — comment il choisit ses sources

Éditeur : Anthropic

Comment il s'alimente

Là aussi, un corpus d'entraînement figé complété par une recherche web activable. Claude est très utilisé en contexte professionnel et à travers des outils tiers qui lui font lire des pages précises. Concrètement, une part importante des consultations de votre site passe par une récupération à la demande — quelqu'un pose une question, le système va chercher, lit, résume — plutôt que par un index constitué à l'avance.

Les robots qu'il utilise

RobotCe qu'il fait
ClaudeBotcollecte destinée à l'entraînement
Claude-Userrécupération d'une page à la demande d'un utilisateur
Claude-SearchBotindexation liée aux fonctions de recherche

Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.

Ce qui semble favoriser une citation

  • Une page dont le contenu principal est lisible sans exécuter de JavaScript : une récupération à la demande lit le document tel qu'il est servi.
  • Une structure explicite — titres qui annoncent leur contenu, listes, tableaux — qui permet d'extraire une réponse sans reconstituer le raisonnement.
  • De la précision plutôt que de la promotion. Un texte commercial vague donne peu de matière à citer ; un texte qui donne des conditions, des étapes et des limites en donne beaucoup.

Comment vérifier que vous y apparaissez

Vos journaux serveur restent la source la plus fiable : filtrez sur les noms de robots ci-dessus et regardez quelles pages sont récupérées, et à quelle fréquence. Complétez par des tests manuels dans l'interface, recherche activée, sur vos questions cibles. Il n'existe pas de console officielle qui vous dirait « vous avez été cité X fois » — quiconque vous l'affirme vend une estimation, pas une mesure.

Perplexity — comment il choisit ses sources

Éditeur : Perplexity AI

Comment il s'alimente

C'est le plus transparent des quatre sur son fonctionnement : il est bâti autour de la recherche en direct. Chaque réponse s'appuie sur des pages récupérées au moment de la question, et les sources sont affichées avec des liens numérotés à côté du texte. Le corpus d'entraînement joue un rôle marginal dans ce que vous voyez à l'écran.

Les robots qu'il utilise

RobotCe qu'il fait
PerplexityBotexploration destinée à alimenter le moteur
Perplexity-Userrécupération d'une page suite à une question d'utilisateur

Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.

Ce qui semble favoriser une citation

  • La fraîcheur compte davantage ici qu'ailleurs : une page mise à jour et datée a un avantage visible sur un contenu ancien traitant du même sujet.
  • La concordance directe entre la question et un passage de votre page. Une section intitulée exactement comme la question posée est plus facile à retenir qu'un paragraphe qui aborde le sujet en passant.
  • La diversité : le moteur affiche plusieurs sources par réponse, ce qui laisse mécaniquement plus de place qu'un système qui n'en citerait qu'une.

Comment vérifier que vous y apparaissez

C'est le moteur le plus simple à suivre, parce que les sources sont visibles. Posez vos questions cibles, lisez la liste des sources citées, notez votre présence ou votre absence et quel concurrent occupe la place. Croisez avec vos journaux serveur pour voir si le robot passe. Ce suivi manuel, tenu quelques semaines, vous apprend plus que n'importe quel score global.

Gemini et les aperçus IA de Google — comment il choisit ses sources

Éditeur : Google

Comment il s'alimente

Le cas particulier du lot, et le plus important pour une PME. Les réponses générées par Google s'appuient sur l'index de Google, celui que Googlebot construit depuis toujours. Il n'y a pas d'exploration parallèle à conquérir séparément : si vos pages sont bien indexées dans la recherche classique, elles sont éligibles ; si Googlebot ne les voit pas, aucun réglage spécifique à l'IA ne compensera.

Les robots qu'il utilise

RobotCe qu'il fait
Googlebotexploration de l'index de recherche, socle commun à tout le reste
Google-Extendedcontrôle d'usage de votre contenu pour certains produits d'IA de Google — ce n'est pas un explorateur distinct, et le bloquer ne vous retire pas de la recherche

Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.

Ce qui semble favoriser une citation

  • Un bon positionnement dans la recherche classique reste le meilleur point de départ observable : les sources reprises dans les réponses générées viennent le plus souvent de pages déjà bien classées.
  • Un contenu qui traite un sujet complet plutôt qu'une seule requête, parce qu'une réponse générée couvre souvent plusieurs facettes d'une même question.
  • Des données structurées correctes, qui lèvent l'ambiguïté sur ce qu'est votre entreprise, ce que vous vendez et où vous intervenez.

Comment vérifier que vous y apparaissez

C'est le seul des quatre pour lequel un outil officiel existe : la Search Console vous donne impressions, clics et positions, ainsi que l'inspection d'URL pour voir comment une page est comprise. Ce n'est pas un rapport de citations dans les aperçus IA — Google ne le fournit pas — mais c'est une donnée réelle sur votre visibilité, et rien d'équivalent n'existe chez les trois autres.

Ce que personne ne sait, et qu'il faut dire

C'est la section que la plupart des guides omettent, et c'est celle qui vous évitera de payer pour une promesse invérifiable.

Les critères de sélection ne sont pas publiés
Aucun de ces éditeurs ne documente comment une source est retenue plutôt qu'une autre. Ce que la profession appelle « facteurs de citation » relève de l'observation répétée, pas d'une spécification. Toute personne qui vous présente une liste de critères comme une vérité établie extrapole — nous compris, ce qui explique la prudence du vocabulaire employé plus haut.
La même question peut donner deux réponses différentes
Ces systèmes ne sont pas déterministes. Reposez la même question dix minutes plus tard, depuis un autre compte ou un autre pays, et les sources citées peuvent changer. Il n'existe donc pas de « position » stable à suivre comme on suit un classement Google, et un tableau de bord qui vous affiche un rang précis dans ChatGPT décrit une observation ponctuelle, pas un état.
Les règles changent sans préavis
Les modèles sont remplacés, les fonctions de recherche activées ou désactivées par défaut, les robots renommés, les partenariats de recherche renégociés. Une méthode qui fonctionnait il y a six mois peut ne plus rien produire aujourd'hui, sans qu'aucune annonce ne l'explique.
Personne ne peut garantir une citation
Ni nous, ni quiconque. Ce qui se pilote, c'est l'ensemble des conditions qui rendent une citation possible : être accessible aux robots, être compréhensible sans effort, être exact, être à jour, être reconnu ailleurs sur le web. Un prestataire qui promet un résultat sur ce canal promet quelque chose dont il n'a pas le contrôle.
La mesure elle-même est immature
Hors de la Search Console de Google, il n'existe pas de source de données officielle. Les journaux serveur prouvent le passage des robots — c'est un fait solide, et le plus sous-utilisé. Les tests manuels prouvent une apparition à un instant donné. Tout le reste est de l'estimation, et mérite d'être présenté comme telle.

Ce constat n'est pas décourageant, il est libérateur : il déplace l'effort de ce qu'on ne contrôle pas — le résultat — vers ce qu'on contrôle entièrement, c'est-à-dire les conditions. Et ces conditions, elles, se vérifient une par une.

Ce qui reste vrai quel que soit le moteur

Les quatre systèmes diffèrent par leur alimentation, pas par ce qu'ils attendent d'une page. Le socle suivant vaut pour tous, et ne dépend d'aucune interprétation.

  1. Point 1

    Laisser passer les robots que vous visez

    Un robots.txt trop restrictif, hérité d'une consigne de sécurité mal comprise, suffit à vous exclure. Ouvrez le fichier, lisez-le, et vérifiez qu'aucune règle n'exclut les robots listés sur cette page. C'est la première chose à faire, et la seule dont l'effet soit binaire.

  2. Point 2

    Répondre à la question avant de vous présenter

    Une page qui commence par l'histoire de l'entreprise oblige la machine à chercher. Une page qui répond en deux phrases puis développe lui offre un passage prêt à être repris. Cette structure sert aussi vos lecteurs humains, ce qui est le meilleur test de sa légitimité.

  3. Point 3

    Être lisible sans exécution de script

    Une récupération à la demande lit le document tel qu'il arrive. Si votre texte n'apparaît qu'après le chargement d'un composant, il peut être absent de ce que la machine a sous les yeux.

  4. Point 4

    Déclarer ce que vous êtes, en langage machine

    Le balisage schema.org lève l'ambiguïté sur votre nom, votre activité, vos coordonnées, vos horaires, vos tarifs. Cela ne force aucune citation, mais cela supprime les raisons de vous écarter par incertitude.

  5. Point 5

    Rester cohérent partout

    Un nom d'entreprise, une adresse et un numéro qui diffèrent entre votre site, vos fiches d'annuaire et vos réseaux créent un doute. Un système qui doute cite quelqu'un d'autre.

Sur la mise en œuvre technique de ces points, deux lectures complètent ce guide : notre article sur le balisage schema.org pour les IA pour la partie déclarative, et celui consacré aux conditions d'une citation par ChatGPT pour la partie rédactionnelle. Le vocabulaire employé ici est défini dans notre glossaire.

Comment mesurer sans se raconter d'histoires

Trois niveaux de preuve existent, et il faut savoir lequel vous tenez. Le premier est factuel : vos journaux serveur montrent quels robots passent, sur quelles pages, à quelle fréquence. C'est une donnée dure, gratuite, et presque personne ne la regarde. Elle ne prouve pas une citation, mais son absence prouve qu'aucune citation n'est possible — ce qui est déjà un diagnostic.

Le deuxième est observationnel : vous posez vos questions cibles dans chaque interface, à intervalles réguliers, et vous notez les sources citées. Perplexity, qui affiche systématiquement ses références, est le plus commode pour cet exercice. Tenez un simple tableau : la question, la date, le moteur, votre présence, le concurrent cité. Après quelques semaines, une tendance apparaît là où une observation isolée ne disait rien.

Le troisième est officiel, et n'existe que chez Google : la Search Console vous donne impressions, clics et positions réelles. Ce n'est pas un rapport de citations dans les réponses générées, mais c'est la seule donnée fournie par l'éditeur lui-même. Utilisez-la pour ce qu'elle est, et ne la présentez jamais comme une mesure de votre visibilité dans les IA. Nos outilscouvrent les vérifications techniques ; notre article sur les aperçus IA de Google détaille ce cas particulier.

Questions fréquentes sur le SEO par IA

Le SEO par IA remplace-t-il le référencement classique ?
Non, il s'y ajoute. Les réponses générées par Google s'appuient sur l'index de Google, et les autres moteurs reprennent souvent des sources déjà reconnues dans la recherche classique. Un site qui abandonne son référencement perd sur les deux canaux à la fois.
Combien de temps faut-il pour être cité par une IA ?
Il n'existe pas de délai fiable à annoncer. Une page récupérée à la demande peut être citée le jour même, tandis qu'une présence stable dans un index de recherche prend le temps d'une exploration et d'une reconnaissance par le reste du web. Toute promesse de délai précis sur ce canal est une invention.
Faut-il bloquer les robots des IA pour protéger son contenu ?
C'est un arbitrage, pas une évidence. Bloquer les robots d'entraînement protège votre contenu d'un usage que vous n'avez pas choisi ; bloquer les robots de recherche et de récupération à la demande vous retire des réponses que vos clients lisent. Ces robots portent des noms distincts, ce qui permet de décider séparément.
Comment savoir si une IA cite mon site ?
Par vos journaux serveur, qui montrent le passage des robots et les pages récupérées, et par des tests manuels répétés sur vos questions cibles. La Search Console couvre la partie Google. En dehors de cela, aucune source officielle ne publie de compteur de citations.

Vérifier les conditions, plutôt que d'espérer le résultat

Notre analyse contrôle ce qui se contrôle : quels robots d'IA ont accès à vos pages, ce que vos données structurées déclarent, si votre contenu est lisible sans exécution de script, et si vos informations sont cohérentes d'une source à l'autre. Aucune promesse de citation — un état des lieux, et la liste de ce qui vous empêche aujourd'hui d'être retenu.

Analyser mon site