Orkas Orkas
Accueil Blog Recherche
Recherche

Comment être cité par ChatGPT : ce qui détermine réellement si vous êtes repris

Être cité, ce n’est pas être bien classé. C’est passer l’étape de récupération, puis être le passage qui mérite d’être cité. Voici le mécanisme, les vérifications qui font vraiment la différence et celles qui ne la font pas.

À la question "Comment être cité par ChatGPT ?", la réponse prend généralement la forme d’une liste : écrire du bon contenu, ajouter des données structurées, créer un llms.txt. Ces conseils ne sont pas tant faux qu’adressés à la mauvaise couche. Ils décrivent l’apparence qu’une page devrait avoir et passent sous silence les deux questions qui déterminent réellement le résultat : le système de récupération peut-il seulement atteindre votre page, et contient-elle un passage qui reste pertinent une fois sorti de son contexte  ?

Cet article décrit le mécanisme, dans l’ordre où il s’exécute réellement. Nous appliquons ces contrôles à notre propre site, et certains nous ont permis de trouver des problèmes qu’aucun travail sur le contenu n’aurait résolus.

La version courte Être mentionné n’est pas être cité SeoGeoAgent teste quelles réponses citent réellement votre domaine et distingue cela d’un nom de marque rappelé de mémoire. Voir visibilité dans la recherche et les réponses de l’IA.
Télécharger Orkas — gratuit

La citation est un problème de récupération, pas de classement

Quand ChatGPT répond avec des liens, il ne lit pas le web en direct pour chaque question. Une étape de récupération extrait des passages candidats d’un index ; le modèle compose une réponse à partir des éléments obtenus et attribue les parties sur lesquelles il s’appuie. Deux conséquences en découlent, toutes deux peu intuitives si vous venez du SEO classique :

  • L’unité est le passage, pas la page. Une page peut être bien classée sans rien apporter, parce que le fait à citer se trouve dans une image, un graphique sans équivalent textuel ou un paragraphe qui n’existe qu’après l’exécution de JavaScript.
  • Être récupérable et être citable sont deux exigences différentes. Figurer dans l’index est un prérequis. Fournir la phrase la plus claire disponible sur la question est ce qui vous vaut une attribution. La plupart des listes de contrôle GEO ne traitent que le premier point, puis s’étonnent que le trafic n’ait pas bougé.

En pratique, classement et citation divergent. Vous pouvez occuper la troisième position pour un mot-clé sans jamais être cité, parce que les deux pages au-dessus donnent la réponse dans une phrase autonome, tandis que vous l’enfouissez au quatrième paragraphe d’une section intitulée "Notre philosophie".

Trois robots, trois rôles différents

C’est ici que se commettent les erreurs les plus coûteuses, car on raisonne sur "le robot d’OpenAI" comme s’il n’y en avait qu’un. OpenAI documente trois Agents distincts, et ils ne font pas le même travail :

  • GPTBot — exploration massive pour l’entraînement des modèles. Le bloquer change ce que les futurs modèles apprennent de votre site. Cela ne vous retire pas des citations en direct de ChatGPT.
  • OAI-SearchBot — construit l’index de recherche consulté par la récupération. C’est lui qui détermine si vous pouvez être cité.
  • ChatGPT-User — récupère une URL précise lorsqu’une question utilisateur déclenche une navigation en direct. Bloquez-le et la récupération échoue au moment même où quelqu’un pose une question sur vous.

L’échec courant : une équipe décide qu’elle ne veut pas que son contenu entraîne des modèles, bloque GPTBot et pense avoir fait un choix réfléchi. C’est vrai — concernant l’entraînement. Elle n’a rien décidé sur la récupération. La version pire : quelqu’un bloque tous les Agents OpenAI avec une seule règle générique, fait discrètement disparaître l’entreprise des réponses IA, puis passe un trimestre à se demander pourquoi les concurrents sont cités.

Ces choix sont distincts : prenez-les séparément. Notre propre robots.txt autorise les trois et bloque /api/ ainsi que les liens de partage, car ceux-ci contiennent du contenu utilisateur qui n’a rien à faire dans un index. Vos choix peuvent différer — entraînement et récupération impliquent réellement des compromis différents. Décidez simplement robot par robot, pas fournisseur par fournisseur, et relisez de temps à autre la documentation du fournisseur, car ces politiques évoluent.

robots.txt n’est pas le filtre qui vous bloque réellement

Robots exprime une demande, et c’est la couche que tout le monde examine. Celle qui bloque réellement est votre CDN ou votre WAF. Dans de nombreuses configurations par défaut, les plateformes en périphérie soumettent les agents utilisateurs inconnus à un défi ou les bloquent. Le résultat est silencieux : robots.txt indique Allow, la périphérie renvoie 403 et vous devenez impossible à explorer, alors que tous les fichiers de votre dépôt affirment que vous êtes ouvert.

La vérification prend dix secondes, et presque personne ne la fait :

curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User"  https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/

200 signifie accessible. Un 403, un 503 ou une page de défi signifie que vous avez un problème de visibilité qu’aucun travail de contenu ne corrigera. Faites le test en production, depuis l’extérieur de votre réseau, pour chaque domaine exploité — chacun a généralement sa propre configuration en périphérie, et elles divergent.

Si vous ne faites qu’une chose après cet article, faites celle-ci. C’est le contrôle le plus rentable par seconde investie, et il est invisible dans tous les audits de contenu.

Si un fait nécessite JavaScript, il n’existe pas

Les robots de récupération analysent couramment le HTML brut sans exécuter JavaScript. Le test permettant de savoir si une affirmation est citable n’est donc pas ce qu’affiche votre navigateur, mais ceci :

curl -s https://your-site/page/ | grep -i "the claim you want quoted"

Rien dans la sortie signifie rien à citer. Cela a une véritable conséquence de conception : les textes essentiels aux citations — définition, faits clés, réponses FAQ, affirmations tarifaires et de sécurité — doivent être dans le HTML servi. Un dictionnaire d’exécution qui remplace le texte après hydratation convient comme amélioration ; il ne peut pas être le seul endroit où le fait existe.

Ce problème frappe surtout les sites multilingues, et c’est le piège que nous avons explicitement évité dans notre conception. Si votre texte chinois n’existe que dans un dictionnaire i18n JavaScript, alors, pour un robot qui lit le HTML brut, votre contenu chinois n’existe pas du tout. Notre solution consiste à intégrer chaque langue dans un vrai balisage et à laisser CSS décider de celle qu’un humain voit. Les robots reçoivent les quatre langues ; les lecteurs n’en voient qu’une. Cela alourdit la page, et cela en vaut la peine.

Écrivez des passages qui résistent à la sortie de leur contexte

C’est la partie qui relève vraiment de la rédaction plutôt que de la plomberie technique, et c’est là que réside le levier une fois cette plomberie en place.

Un fragment récupéré arrive au modèle sans le reste de votre page. Ni hiérarchie des titres, ni paragraphe précédent, ni navigation. Écrivez en conséquence :

  • La réponse d’abord. La première phrase sous un titre doit donner la réponse, pas préparer le terrain. "X est Y" vaut mieux que "Dans le paysage actuel en évolution rapide…" — qui ne répond à rien et n’est jamais cité.
  • Gardez les sujets explicites. "Il prend en charge OAuth" est inutilisable hors contexte ; "Orkas prend en charge OAuth" résiste. Les pronoms ne survivent pas au découpage.
  • Rendez chaque affirmation autonome. Entité, réserve et limite dans une phrase : "Avec votre propre fournisseur, les échanges avec les modèles lui parviennent directement, sans passer par un proxy Orkas." Cette phrase peut être citée seule sans devenir fausse, et c’est précisément ce qui la rend citable.
  • Préférez le vérifiable à l’impressionnant. Les superlatifs vagues ne sont jamais cités, car ils ne répondent à aucune question posée.

La question est la clé de récupération

Les utilisateurs posent des questions, et la récupération cherche des textes formulés comme des questions. Un titre reprenant la question exacte — "Orkas fait-il transiter les échanges avec les modèles par un proxy ?" — correspond mieux qu’un groupe nominal comme "Architecture des modèles". C’est cela, et non la magie des données structurées, qui donne aux blocs FAQ un poids disproportionné dans la visibilité IA : ce sont littéralement des paires question-réponse, la forme même de ce qui est récupéré.

Les données structurées vous rendent interprétable, pas prioritaire

JSON-LD n’achète pas de citations. Il permet une classification sans ambiguïté : ce qu’est la page, qui l’a publiée, quel texte est une question et lequel en est la réponse. Deux règles comptent plus que les autres :

  • Le schéma FAQ doit correspondre exactement au texte visible. Un schéma qui affirme quelque chose que la page ne dit pas pose un problème de confiance, et les moteurs de recherche traitent cet écart comme un signal de spam plutôt qu’une erreur de mise en forme.
  • N’inventez jamais de notes, de récompenses ou de chiffres. Un moteur qui repère une seule note agrégée inventée a une bonne raison de réduire la crédibilité de toutes vos autres affirmations.

La règle 1:1 se dégrade facilement en silence — quelqu’un modifie la FAQ visible, oublie le schéma et, six mois plus tard, les deux divergent. Nous la faisons respecter par un test qui parcourt chaque page du sitemap, extrait la FAQ du JSON-LD et vérifie que chaque question et réponse figure mot pour mot dans le texte visible de la page. En cas de divergence, la compilation échoue. Les données structurées sont une affirmation sur votre propre page ; elles doivent être contrôlées comme telles.

llms.txt : peu coûteux, utile et survendu

Soyez honnête sur la nature de ce fichier. llms.txt est une convention proposée. Aucun grand moteur ne promet de le lire, et quiconque vous dit qu’il constitue un canal d’ingestion fait une supposition.

Son utilité réelle est plus limitée, mais mérite tout de même une heure : un endroit stable où vos faits de référence sont énoncés clairement — nature du produit, traitement des modèles et des données, tarifs, URL importantes. Lorsqu’un robot ou un chercheur humain y arrive, il obtient une version sans habillage marketing au lieu de la reconstituer depuis des pages promotionnelles. C’est aussi une contrainte utile. Si vous ne pouvez pas énoncer les faits sur votre produit en quarante lignes sans adjectifs, vos pages ne le peuvent pas non plus : ce problème de contenu existait déjà.

Ce qu’il n’est pas : une garantie, ni un substitut à la présence de ces faits sur les pages elles-mêmes.

Les contradictions vous font écarter

Les moteurs de réponse recoupent les informations. Si votre page tarifaire dit une chose, votre documentation une autre et la FAQ d’accueil une troisième, le moteur ne tranche pas — il nuance, ou cite quelqu’un de cohérent.

La cohérence des faits entre les supports constitue donc l’essentiel du travail réel, sans rien de spectaculaire. Quand un fait sur les modèles, les tarifs ou la sécurité change, il doit changer partout dans la même modification — page, documentation, FAQ d’accueil, llms.txt — sinon vous créez une contradiction qui survivra à la modification. Nous en faisons une règle stricte plutôt qu’une habitude, car les habitudes cèdent face aux échéances.

La corroboration l’emporte sur l’affirmation de soi

Voici le point le plus difficile à accepter : votre propre site est la source la moins solide à votre sujet. Les moteurs accordent du poids à la corroboration, et ils ont raison. Une affirmation qui ne figure que sur votre domaine est une affirmation marketing. La même affirmation sur GitHub, dans une comparaison tierce, un fil de forum ou une documentation rédigée par quelqu’un d’autre est un fait.

C’est pourquoi, une fois les bases du site établies, le travail hors site rapporte davantage qu’une nouvelle page de destination — dépôts, annuaires, articles sous forme de listes, discussions authentiques. Pour le dire simplement : le travail sur site vous rend citable ; le travail hors site vous permet d’être cité. Les équipes surinvestissent systématiquement dans le premier, car c’est la moitié qu’elles contrôlent.

Comment mesurer sans vous raconter d’histoires

C’est ici que les articles sur le GEO deviennent généralement flous : vous ne pouvez pas mesurer précisément les citations ChatGPT. Il n’existe aucun tableau de bord. Vous disposez de trois signaux imparfaits :

  • Journaux du serveur. Recherchez avec grep OAI-SearchBot et ChatGPT-User. La fréquence d’exploration et les URL récupérées vous indiquent si vous figurez dans l’index et ce qui est consulté en direct. C’est le signal le plus honnête dont vous disposez.
  • Trafic référent provenant de l’assistant. Réel, mais partiel — beaucoup de citations sont lues sans clic, ce qui est précisément le principe d’un moteur de réponse.
  • Vérifications manuelles ponctuelles. Posez les dix questions sur lesquelles vous voulez être la référence ; notez qui est cité. Fastidieux, indicatif, mais toujours le seul moyen d’observer directement les réponses.

Considérez les trois comme des indications de tendance. Quiconque vous vend un "score GEO" précis vous vend un chiffre qu’il a inventé.

Ce que nous ferions réellement en premier

Par ordre de rendement, pas d’élégance dans une présentation :

  • 1. curl -A pour tester les robots de récupération en production. Si la périphérie les bloque, rien d’autre dans cette liste ne compte.
  • 2. curl | grep pour rechercher vos affirmations clés. Déplacez dans le HTML servi tout ce qui n’existe que dans JavaScript.
  • 3. Réécrivez la première phrase sous chaque titre pour qu’elle donne la réponse, avec des sujets explicites.
  • 4. Rendez le texte de la FAQ identique à son schéma et supprimez tout schéma que le texte visible ne justifie pas.
  • 5. Réconciliez les faits qui se contredisent entre les pages, la documentation et llms.txt.
  • 6. Ensuite — et seulement ensuite — cherchez à obtenir des corroborations hors site.

Les étapes 1 et 2 sont généralement l’endroit où se cachent les citations manquantes. Ce sont aussi celles dont personne ne parle dans ses articles, car elles ne relèvent pas du marketing de contenu.

Pour conclure

Être cité par ChatGPT est moins mystérieux que ne le laisse penser l’acronyme qui l’entoure. Soyez accessible au robot de récupération. Soyez lisible sans JavaScript. Soyez citable en une phrase autonome. Soyez cohérent sur vos propres supports. Soyez corroboré ailleurs que sur votre site marketing. Les outils changent ; ces cinq principes tiennent.

Nous appliquons ces contrôles à notre site et les avons intégrés à un processus Orkas qui audite la visibilité dans la recherche et les réponses de l’IA d’un site et remet une liste de corrections priorisées. Si vous voulez comprendre la couche sous-jacente — comment un Agent principal planifie le travail et mobilise les spécialistes — lisez l’orchestration multi-Agents en pratique.