Pour chacun : comment il s'alimente, quels robots il envoie, ce qui semble favoriser une citation, et comment vérifier votre présence.
ChatGPT — comment il choisit ses sources
Éditeur : OpenAI
Comment il s'alimente
Deux sources distinctes, qu'il faut cesser de confondre. D'un côté, les connaissances acquises pendant l'entraînement du modèle : un corpus figé, arrêté à une date, qui ne contient rien de ce que vous publierez demain. De l'autre, une recherche en direct sur le web, déclenchée quand la question porte sur l'actualité, sur un lieu, sur un prix, ou quand l'utilisateur la demande explicitement. C'est cette seconde voie qui produit des réponses avec des liens cliquables, et c'est la seule sur laquelle un site publié cette année peut agir à court terme.
Les robots qu'il utilise
| Robot | Ce qu'il fait |
|---|
| GPTBot | collecte destinée à l'entraînement des modèles |
| OAI-SearchBot | constitution de l'index utilisé par la recherche dans ChatGPT |
| ChatGPT-User | récupération d'une page au moment où un utilisateur la demande |
Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.
Ce qui semble favoriser une citation
- Une page qui répond à la question posée dans les premières lignes, sans exiger de lire trois paragraphes d'introduction avant d'arriver au fait.
- Une source que le reste du web reconnaît déjà : citée, liée, mentionnée ailleurs. Un moteur de réponse hérite en grande partie de la réputation construite pour la recherche classique.
- Des informations vérifiables et datées, plutôt que des affirmations générales sans origine.
Comment vérifier que vous y apparaissez
Deux méthodes, complémentaires. Côté serveur, vos journaux d'accès portent les noms de robots ci-dessus : leur présence prouve que vos pages sont récupérées, ce qui est le préalable à toute citation. Côté usage, posez dans ChatGPT, avec la recherche activée, les questions que posent réellement vos clients, et notez si vous apparaissez. Répétez à intervalles réguliers : une seule observation ne dit rien, une série en dit beaucoup.
Claude — comment il choisit ses sources
Éditeur : Anthropic
Comment il s'alimente
Là aussi, un corpus d'entraînement figé complété par une recherche web activable. Claude est très utilisé en contexte professionnel et à travers des outils tiers qui lui font lire des pages précises. Concrètement, une part importante des consultations de votre site passe par une récupération à la demande — quelqu'un pose une question, le système va chercher, lit, résume — plutôt que par un index constitué à l'avance.
Les robots qu'il utilise
| Robot | Ce qu'il fait |
|---|
| ClaudeBot | collecte destinée à l'entraînement |
| Claude-User | récupération d'une page à la demande d'un utilisateur |
| Claude-SearchBot | indexation liée aux fonctions de recherche |
Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.
Ce qui semble favoriser une citation
- Une page dont le contenu principal est lisible sans exécuter de JavaScript : une récupération à la demande lit le document tel qu'il est servi.
- Une structure explicite — titres qui annoncent leur contenu, listes, tableaux — qui permet d'extraire une réponse sans reconstituer le raisonnement.
- De la précision plutôt que de la promotion. Un texte commercial vague donne peu de matière à citer ; un texte qui donne des conditions, des étapes et des limites en donne beaucoup.
Comment vérifier que vous y apparaissez
Vos journaux serveur restent la source la plus fiable : filtrez sur les noms de robots ci-dessus et regardez quelles pages sont récupérées, et à quelle fréquence. Complétez par des tests manuels dans l'interface, recherche activée, sur vos questions cibles. Il n'existe pas de console officielle qui vous dirait « vous avez été cité X fois » — quiconque vous l'affirme vend une estimation, pas une mesure.
Perplexity — comment il choisit ses sources
Éditeur : Perplexity AI
Comment il s'alimente
C'est le plus transparent des quatre sur son fonctionnement : il est bâti autour de la recherche en direct. Chaque réponse s'appuie sur des pages récupérées au moment de la question, et les sources sont affichées avec des liens numérotés à côté du texte. Le corpus d'entraînement joue un rôle marginal dans ce que vous voyez à l'écran.
Les robots qu'il utilise
| Robot | Ce qu'il fait |
|---|
| PerplexityBot | exploration destinée à alimenter le moteur |
| Perplexity-User | récupération d'une page suite à une question d'utilisateur |
Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.
Ce qui semble favoriser une citation
- La fraîcheur compte davantage ici qu'ailleurs : une page mise à jour et datée a un avantage visible sur un contenu ancien traitant du même sujet.
- La concordance directe entre la question et un passage de votre page. Une section intitulée exactement comme la question posée est plus facile à retenir qu'un paragraphe qui aborde le sujet en passant.
- La diversité : le moteur affiche plusieurs sources par réponse, ce qui laisse mécaniquement plus de place qu'un système qui n'en citerait qu'une.
Comment vérifier que vous y apparaissez
C'est le moteur le plus simple à suivre, parce que les sources sont visibles. Posez vos questions cibles, lisez la liste des sources citées, notez votre présence ou votre absence et quel concurrent occupe la place. Croisez avec vos journaux serveur pour voir si le robot passe. Ce suivi manuel, tenu quelques semaines, vous apprend plus que n'importe quel score global.
Gemini et les aperçus IA de Google — comment il choisit ses sources
Éditeur : Google
Comment il s'alimente
Le cas particulier du lot, et le plus important pour une PME. Les réponses générées par Google s'appuient sur l'index de Google, celui que Googlebot construit depuis toujours. Il n'y a pas d'exploration parallèle à conquérir séparément : si vos pages sont bien indexées dans la recherche classique, elles sont éligibles ; si Googlebot ne les voit pas, aucun réglage spécifique à l'IA ne compensera.
Les robots qu'il utilise
| Robot | Ce qu'il fait |
|---|
| Googlebot | exploration de l'index de recherche, socle commun à tout le reste |
| Google-Extended | contrôle d'usage de votre contenu pour certains produits d'IA de Google — ce n'est pas un explorateur distinct, et le bloquer ne vous retire pas de la recherche |
Ces robots portant des noms différents, vous pouvez les autoriser ou les refuser séparément dans robots.txt. Refuser la collecte destinée à l'entraînement n'empêche pas la recherche, et inversement.
Ce qui semble favoriser une citation
- Un bon positionnement dans la recherche classique reste le meilleur point de départ observable : les sources reprises dans les réponses générées viennent le plus souvent de pages déjà bien classées.
- Un contenu qui traite un sujet complet plutôt qu'une seule requête, parce qu'une réponse générée couvre souvent plusieurs facettes d'une même question.
- Des données structurées correctes, qui lèvent l'ambiguïté sur ce qu'est votre entreprise, ce que vous vendez et où vous intervenez.
Comment vérifier que vous y apparaissez
C'est le seul des quatre pour lequel un outil officiel existe : la Search Console vous donne impressions, clics et positions, ainsi que l'inspection d'URL pour voir comment une page est comprise. Ce n'est pas un rapport de citations dans les aperçus IA — Google ne le fournit pas — mais c'est une donnée réelle sur votre visibilité, et rien d'équivalent n'existe chez les trois autres.