Orkas Orkas
Início Blog Pesquisa
Pesquisa

Como ser citado pelo ChatGPT: o que realmente determina se é citado

Ser citado não é obter uma boa classificação. É sobreviver à recuperação e depois ser o excerto que vale a pena citar. Veja o mecanismo, as verificações que realmente fazem a diferença e as que não fazem.

A pergunta "Como posso ser citado pelo ChatGPT?" costuma receber como resposta uma lista: escreva bom conteúdo, adicione marcação de esquema, crie um llms.txt. O problema desse conselho não é estar errado, mas apontar para a camada errada. Descreve o aspeto que uma página deve ter e ignora as duas perguntas que de facto decidem o resultado: o sistema de recuperação consegue aceder à sua página? e existe nela um excerto que sobreviva a ser retirado do contexto?

Este artigo apresenta o mecanismo, pela ordem em que realmente funciona. Aplicámos estas verificações no nosso próprio site, e algumas delas revelaram problemas que nenhum trabalho de conteúdo teria resolvido.

Em resumo Ser mencionado não é ser citado O SeoGeoAgent verifica quais as respostas que realmente citam o seu domínio e distingue isso de um nome de marca recordado de memória. Veja visibilidade na pesquisa e nas respostas de IA.
Descarregar o Orkas — grátis

A citação é um problema de recuperação, não de classificação

Quando o ChatGPT responde com ligações, não está a ler a Web em tempo real a cada pergunta. Uma etapa de recuperação obtém excertos candidatos a partir de um índice; o modelo compõe a resposta com o que foi devolvido e atribui as partes em que se apoiou às respetivas fontes. Daí resultam duas consequências, ambas contraintuitivas para quem vem do SEO clássico:

  • A unidade é o excerto, não a página. Uma página pode ter uma boa classificação e não contribuir com nada, porque o facto que valeria a pena citar está numa imagem, num gráfico sem equivalente textual ou num parágrafo que só existe depois de o JavaScript ser executado.
  • Recuperável e citável são níveis diferentes. Estar no índice é uma pré-condição. Ser a frase mais clara disponível sobre a pergunta é o que gera a atribuição. A maioria das listas de verificação de GEO só trata do primeiro nível e depois estranha que o tráfego não mude.

A classificação e a citação separam-se na prática. Pode estar na terceira posição para uma palavra-chave e nunca ser citado, porque as duas páginas acima apresentam a resposta numa frase autossuficiente e enterrou a sua no quarto parágrafo de uma secção chamada "A Nossa Filosofia".

Três bots, três trabalhos diferentes

É aqui que se cometem os erros mais caros, porque as pessoas pensam no "robô de rastreio da OpenAI" como se fosse uma coisa só. A OpenAI documenta três agentes separados, e eles não fazem o mesmo trabalho:

  • GPTBot — rastreio em massa para treino de modelos. Bloqueá-lo altera o que os modelos futuros absorvem do seu site. Não o remove das citações em tempo real do ChatGPT.
  • OAI-SearchBot — constrói o índice de pesquisa que a recuperação lê. É este que decide se pode ser citado.
  • ChatGPT-User — obtém um URL específico quando a pergunta de um utilizador desencadeia uma navegação em tempo real. Bloqueie-o e a obtenção falha exatamente no momento em que alguém pergunta sobre si.

A falha comum: uma equipa decide que não quer o seu conteúdo a treinar modelos, bloqueia o GPTBot e acredita ter tomado uma decisão ponderada. Tomou — sobre treino. Não disse nada sobre recuperação. A versão pior: alguém bloqueia todos os agentes da OpenAI com uma regra com carácter universal e apaga silenciosamente a empresa das respostas de IA, e depois passa um trimestre a perguntar-se porque são citados os concorrentes.

São escolhas separáveis, pelo que deve fazê-las separadamente. O nosso robots.txt permite os três e bloqueia /api/ e ligações de partilha, porque as ligações de partilha são conteúdo de utilizadores e não têm lugar num índice. O seu pode ser diferente — o treino e a recuperação envolvem contrapartidas realmente distintas. Decida apenas por bot, não por fornecedor, e releia a documentação do fornecedor de vez em quando, porque essas políticas mudam.

O robots.txt não é a porta que realmente lhe barra o acesso

O robots.txt é um pedido, e é a camada que todos inspecionam. A camada que realmente cria obstáculos é a sua CDN ou WAF. As plataformas de periferia de rede apresentam desafios a agentes de utilizador desconhecidos ou bloqueiam-nos em várias configurações predefinidas, e o resultado é silencioso: o robots.txt diz Allow, a infraestrutura de periferia devolve 403, e o seu site não pode ser rastreado enquanto todos os ficheiros do seu repositório insistem que está tudo aberto.

A verificação demora dez segundos e quase ninguém a faz:

curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User"  https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/

200 significa acessível. Um 403, um 503 ou uma página de desafio significa que tem um problema de visibilidade que nenhum trabalho de conteúdo resolve. Execute a verificação em produção, a partir de fora da sua própria rede, para cada domínio que gere — cada domínio costuma ter a sua própria configuração de periferia de rede, e estas divergem com o tempo.

Se fizer apenas uma coisa deste artigo, faça esta. É a verificação com maior retorno por segundo gasto, e é invisível para qualquer auditoria de conteúdo.

Se um facto precisa de JavaScript, não existe

Os robôs de rastreio para recuperação normalmente leem HTML bruto sem executar JavaScript. Por isso, o teste para saber se uma afirmação é citável não é o que o seu navegador mostra — é este:

curl -s https://your-site/page/ | grep -i "the claim you want quoted"

Nada no resultado significa nada a citar. Isso tem uma consequência real de conceção: o texto essencial para a citação — a sua definição, os factos-chave, as respostas às perguntas frequentes, as afirmações sobre preços e segurança — precisa de estar no HTML servido. Um dicionário em tempo de execução que troca o texto depois da hidratação é ótimo como melhoria; não pode ser o único lugar onde o facto existe.

Isto causa mais problemas em sites multilingues, e é a armadilha que contornámos de propósito. Se a sua versão em chinês só existe num dicionário i18n de JavaScript, então, para um robô que rastreia HTML bruto, o seu conteúdo em chinês simplesmente não está lá. A nossa solução é incorporar cada idioma como marcação real e deixar o CSS decidir qual é apresentado a uma pessoa. Os robôs de rastreio recebem os quatro idiomas; os leitores recebem um. Aumenta o peso da página e vale a pena.

Escreva excertos que sobrevivam a ser retirados do contexto

Esta é a parte que é de facto escrita, e não infraestrutura, e é onde pode fazer a diferença depois de a infraestrutura funcionar.

Um excerto recuperado chega ao modelo sem a sua página à volta. Sem hierarquia de títulos, sem o parágrafo anterior, sem navegação. Escreva a pensar nisso:

  • Responda primeiro. A primeira frase sob um título deve ser a resposta, não uma pista de descolagem. "X é Y" é melhor do que "No cenário atual em rápida evolução…" — que não responde a nada e nunca é citado.
  • Mantenha os sujeitos explícitos. "Ele suporta OAuth" é inútil depois de extraído; "O Orkas suporta OAuth" sobrevive. Pronomes morrem na fragmentação.
  • Torne cada afirmação autossuficiente. Entidade, qualificador e limite numa frase: "Com o seu próprio fornecedor, o tráfego do modelo vai diretamente para esse fornecedor e não passa pelo Orkas como proxy." Essa frase pode ser citada isoladamente sem se tornar falsa, e é exatamente por isso que é citável.
  • Prefira verificável a impressionante. Superlativos vagos nunca são citados, porque não respondem a pergunta nenhuma.

A pergunta é a chave de recuperação

Os utilizadores fazem perguntas, e a recuperação corresponde a texto em forma de pergunta. Um título que é a pergunta literal — "O Orkas faz proxy do tráfego de modelo?" — corresponde melhor do que um sintagma nominal como "Arquitetura de modelos". É por isso, e não por magia do esquema, que os blocos de FAQ contribuem tanto para a visibilidade em IA: são literalmente pares de pergunta e resposta, que é a forma do que está a ser recuperado.

Os dados estruturados tornam o conteúdo analisável, não preferido

O JSON-LD não compra citações. Compra classificação sem ambiguidade: o que é esta página, quem a publicou, que texto é a pergunta e qual é a resposta. Duas regras importam mais do que as outras:

  • O esquema de FAQ tem de corresponder ao texto visível ponto por ponto. Um esquema que afirma algo que a página não diz é um problema de confiança, e os motores de pesquisa tratam a divergência como um sinal de spam, não como um lapso de formatação.
  • Nunca invente avaliações, prémios ou contagens. Um motor que deteta uma avaliação agregada inventada passa a ter um motivo para desvalorizar tudo o resto que afirma.

A regra 1:1 é daquelas que se degradam em silêncio — alguém edita a FAQ visível, esquece-se do esquema e, seis meses depois, contradizem-se. Garantimos o seu cumprimento com um teste que percorre todas as páginas do nosso mapa do site, extrai a FAQ do JSON-LD e verifica se cada pergunta e resposta aparece literalmente no texto visível dessa página. Se houver divergências, a compilação falha. Os dados estruturados são uma afirmação sobre a sua própria página; devem ser verificados como tal.

llms.txt: barato, útil e sobrevalorizado

Seja honesto sobre o que é este ficheiro. llms.txt é uma convenção proposta. Nenhum grande motor promete lê-lo, e quem lhe disser que é um canal de ingestão está a adivinhar.

A sua verdadeira utilidade é mais limitada e continua a valer uma hora: um local estável onde os seus factos canónicos são apresentados sem rodeios — o que é o produto, o tratamento do modelo e dos dados, os preços, os URLs que importam. Quando um rastreador ou um investigador humano lá chega, recebe a versão sem floreados em vez de a reconstruir a partir de páginas de marketing. Também é uma boa forma de impor disciplina. Se não consegue apresentar os factos do seu produto em quarenta linhas sem adjetivos, as suas páginas também não conseguem, e esse é um problema de conteúdo que já tinha.

O que não é: uma garantia, nem um substituto para a presença desses factos nas próprias páginas.

As contradições levam à sua exclusão

Os motores de resposta fazem verificações cruzadas. Se a sua página de preços diz uma coisa, a sua documentação diz outra e a FAQ da página inicial diz uma terceira, o motor não decide quem tem razão — hesita, ou cita alguém que foi consistente.

Por isso, a consistência factual entre os vários pontos de presença é a maior parte do trabalho real, e nada disso é glamoroso. Quando um facto sobre o modelo, o preço ou a segurança muda, tem de mudar em todo o lado na mesma alteração — página, documentação, FAQ da página inicial, llms.txt — ou terá criado uma contradição que vai sobreviver à edição. Tratamos isto como uma regra rígida, não como um hábito, porque os hábitos cedem perante os prazos.

A corroboração supera a autoafirmação

Aqui está a parte mais difícil de aceitar: o seu próprio site é a fonte mais fraca disponível sobre si. Os motores dão peso à corroboração, e fazem bem. Uma afirmação que só aparece no seu domínio é uma afirmação de marketing. A mesma afirmação no GitHub, numa comparação de terceiros, num tópico de fórum, em documentação que outra pessoa escreveu, é um facto.

Por isso, assim que o trabalho básico no site estiver realmente feito, o trabalho fora do site rende mais do que outra página de destino — repositórios, diretórios, listas, discussão genuína. Dito sem rodeios: o trabalho no site torna-o citável; o trabalho fora do site torna-o citado. As equipas investem sistematicamente demasiado no primeiro, porque é a metade que controlam.

Como medir sem mentir a si próprio

É aqui que os textos sobre GEO costumam perder rigor, por isso: não consegue medir citações do ChatGPT de forma clara. Não existe um painel de controlo. O que tem são três sinais imperfeitos:

  • Registos do servidor. Procure OAI-SearchBot e ChatGPT-User. A frequência de rastreio e os URLs consultados indicam se está no índice e o que está a ser obtido em tempo real. É o sinal mais honesto de que dispõe.
  • Tráfego de referência do assistente. Real, mas parcial — muitas citações são lidas e nunca recebem cliques, o que é precisamente o objetivo de um motor de resposta.
  • Verificações manuais. Faça as dez perguntas que quer dominar; registe quem é citado. É tedioso, dá apenas uma indicação e, ainda assim, é a única forma de observar a própria interface de resposta.

Trate os três como indicadores. Quem lhe vender uma "pontuação de GEO" precisa está a vender-lhe um número que inventou.

O que faríamos primeiro

Ordenado pelo retorno, não pelo aspeto num diapositivo:

  • 1. Execute curl -A com os bots de recuperação no ambiente de produção. Se a camada de periferia os bloquear, nada mais nesta lista importa.
  • 2. curl | grep nas suas afirmações-chave. Mova o que depender exclusivamente de JavaScript para o HTML servido.
  • 3. Reescreva a primeira frase sob cada título para que seja a resposta, com sujeitos explícitos.
  • 4. Torne o texto da FAQ e o esquema da FAQ idênticos, e apague qualquer esquema que não consiga sustentar com texto visível.
  • 5. Reconcilie factos que se contradizem entre páginas, documentação e llms.txt.
  • 6. Depois — e só depois — procure obter corroboração fora do site.

Os passos 1 e 2 são normalmente onde se escondem as citações em falta. Também são os dois sobre os quais ninguém escreve artigos, porque não são marketing de conteúdo.

Para concluir

Ser citado pelo ChatGPT é menos misterioso do que a sigla que o rodeia sugere. Seja acessível ao bot de recuperação. Seja legível sem JavaScript. Seja citável numa frase autossuficiente. Seja consistente nos seus vários pontos de presença. Seja corroborado nalgum lugar que não seja o seu site de marketing. As ferramentas mudam; estes cinco princípios permanecem.

Aplicámos estas verificações ao nosso próprio site e integrámo-las num fluxo do Orkas que audita a visibilidade na pesquisa e nas respostas de IA de um site e devolve uma lista de correções ordenada por prioridade. Se quiser conhecer a camada inferior — como um agente líder planeia o trabalho e atribui tarefas a especialistas para o executarem — leia orquestração multiagente na prática.