Alla domanda "Come faccio a farmi citare da ChatGPT?" di solito si risponde con un elenco di consigli: scrivi contenuti di qualità, aggiungi dati strutturati, crea un file llms.txt. Più che sbagliati, questi consigli si concentrano sul livello sbagliato. Descrivono come dovrebbe presentarsi una pagina e saltano le due domande che determinano davvero il risultato: il sistema di recupero delle informazioni riesce effettivamente a raggiungere la tua pagina e la pagina contiene un passaggio che mantiene il proprio significato anche estrapolato dal contesto?
Questo articolo descrive il meccanismo nell'ordine in cui si svolge davvero. Eseguiamo questi controlli sul nostro sito e un paio di essi ci hanno permesso di trovare problemi che nessun lavoro sui contenuti avrebbe potuto risolvere.
La citazione è un problema di recupero delle informazioni, non di posizionamento
Quando ChatGPT risponde con dei link, non sta leggendo il web in tempo reale per ogni domanda. Una fase di recupero estrae da un indice alcuni passaggi candidati; il modello compone una risposta a partire dai risultati e attribuisce alle fonti le parti su cui si è basato. Ne derivano due conseguenze, entrambe poco intuitive per chi proviene dalla SEO tradizionale:
- L'unità è il passaggio, non la pagina. Una pagina può posizionarsi bene senza contribuire in alcun modo, perché il fatto che vale la pena citare si trova in un'immagine, in un grafico senza equivalente testuale o in un paragrafo che esiste solo dopo l'esecuzione di JavaScript.
- Essere recuperabili ed essere citabili sono due requisiti diversi. Essere nell'indice è una condizione preliminare. Essere la frase più chiara disponibile sull'argomento è ciò che ti fa attribuire la citazione. La maggior parte delle liste di controllo GEO affronta solo il primo requisito, per poi chiedersi perché il traffico non sia cambiato.
Nella pratica, posizionamento e citazione sono due cose distinte. Puoi essere al terzo posto per una parola chiave e non venire mai citato, perché le due pagine sopra di te esprimono la risposta in una singola frase autonoma, mentre tu la nascondi nel quarto paragrafo di una sezione intitolata "La nostra filosofia".
Tre bot, tre compiti diversi
È qui che si commettono gli errori più costosi, perché si ragiona sul "crawler di OpenAI" come se fosse un'entità unica. OpenAI documenta tre agenti distinti, che non svolgono lo stesso compito:
- GPTBot — scansione su larga scala per l'addestramento dei modelli. Bloccarlo cambia ciò che i modelli futuri assorbono dal tuo sito. Non ti elimina dalle citazioni in tempo reale di ChatGPT.
- OAI-SearchBot — costruisce l'indice di ricerca da cui attinge il sistema di recupero. È questo a determinare se puoi essere citato o meno.
- ChatGPT-User — recupera un URL specifico quando la domanda di un utente attiva una navigazione in tempo reale. Se lo blocchi, il recupero fallisce proprio nel momento in cui qualcuno chiede informazioni su di te.
L'errore comune: un team decide di non volere che i propri contenuti vengano usati per addestrare i modelli, blocca GPTBot e crede di aver preso una decisione ponderata. L'ha presa, ma sull'addestramento. Non ha deciso nulla sul recupero delle informazioni. La versione peggiore: qualcuno blocca tutti gli agenti di OpenAI con un'unica regola con carattere jolly ed elimina silenziosamente l'azienda dalle risposte dell'IA, per poi passare un trimestre a chiedersi perché i concorrenti vengano citati.
Sono scelte separabili, quindi prendile separatamente. Il nostro robots.txt consente l'accesso a tutti e tre e blocca /api/ e i link di condivisione, perché questi ultimi contengono contenuti degli utenti che non devono finire in un indice. Il tuo può essere diverso: addestramento e recupero comportano davvero compromessi diversi. Decidi semplicemente per singolo bot, non per fornitore, e rileggi ogni tanto la documentazione del fornitore, perché queste politiche cambiano.
robots.txt non è la barriera che ti blocca davvero
Robots è una richiesta ed è il livello che tutti controllano. Il livello che causa davvero problemi è la tua CDN o il tuo WAF. In molte configurazioni predefinite, le piattaforme edge richiedono verifiche o bloccano gli user agent sconosciuti, e il risultato non dà segnali evidenti: robots.txt dice Allow, l'edge restituisce 403 e il sito non è scansionabile, mentre ogni file del tuo repository continua a dichiararlo accessibile.
Il controllo richiede dieci secondi e quasi nessuno lo esegue:
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/200 significa raggiungibile. Un 403, un 503 o una pagina di verifica significano che hai un problema di visibilità che nessun lavoro sui contenuti potrà risolvere. Esegui il controllo sull'ambiente di produzione, dall'esterno della tua rete, per ogni dominio che gestisci: ogni dominio di solito ha una propria configurazione edge e queste configurazioni tendono a divergere.
Se metti in pratica una sola cosa di questo articolo, scegli questa. È il controllo con il rendimento più alto per secondo impiegato ed è invisibile a qualsiasi verifica dei contenuti.
Se un fatto ha bisogno di JavaScript, non esiste
I crawler usati per il recupero delle informazioni analizzano comunemente l'HTML grezzo senza eseguire JavaScript. Quindi il test per capire se un'affermazione è citabile non è ciò che mostra il browser, ma questo:
curl -s https://your-site/page/ | grep -i "the claim you want quoted"Nessun risultato significa nulla da citare. Questo ha una conseguenza concreta sulla progettazione: il testo essenziale per le citazioni — la tua definizione, i fatti principali, le risposte alle domande frequenti, i prezzi e le affermazioni sulla sicurezza — deve essere presente nell'HTML restituito dal server. Un dizionario che sostituisce il testo in fase di esecuzione dopo l'idratazione va bene come miglioramento; non può essere l'unico posto in cui quel fatto esiste.
Questo problema colpisce soprattutto i siti multilingue ed è la trappola che abbiamo esplicitamente evitato nella progettazione. Se i tuoi testi in cinese esistono solo in un dizionario i18n JavaScript, per un crawler che legge l'HTML grezzo i tuoi contenuti in cinese non esistono affatto. La nostra soluzione consiste nell'inserire ogni lingua direttamente nel markup e lasciare che sia il CSS a decidere quale mostrare a una persona. I crawler ricevono tutte e quattro le lingue; i lettori ne vedono una. Aumenta il peso della pagina, ma ne vale la pena.
Scrivi passaggi che mantengano il proprio significato anche fuori contesto
Questa è la parte che riguarda davvero la scrittura anziché l'infrastruttura, ed è qui che puoi incidere una volta che l'infrastruttura funziona.
Un frammento recuperato arriva al modello senza il resto della pagina. Nessuna gerarchia di titoli, nessun paragrafo precedente, nessuna navigazione. Scrivi tenendone conto:
- Prima la risposta. La prima frase sotto un titolo dovrebbe essere la risposta, non una rincorsa introduttiva. "X è Y" funziona meglio di "Nell'attuale panorama in rapida evoluzione…", che non risponde a nulla e non viene mai citato.
- Mantieni espliciti i soggetti. "Supporta OAuth" è inutilizzabile una volta estrapolato; "Orkas supporta OAuth" mantiene il proprio significato. I pronomi non sopravvivono alla suddivisione in frammenti.
- Rendi ogni affermazione autosufficiente. Entità, condizione e limite in una sola frase: "Con il tuo fornitore, il traffico dei modelli va direttamente a quel fornitore e non passa attraverso un proxy di Orkas." Quella frase può essere citata da sola senza diventare falsa, ed è proprio per questo che è citabile.
- Preferisci ciò che è verificabile a ciò che fa colpo. I superlativi vaghi non vengono mai citati, perché non rispondono ad alcuna domanda posta da qualcuno.
La domanda è la chiave del recupero
Gli utenti fanno domande e il sistema di recupero cerca corrispondenze con testi formulati come domande. Un titolo che riprende letteralmente la domanda — "Orkas fa passare il traffico dei modelli attraverso un proxy?" — trova corrispondenza meglio di un'espressione nominale come "Architettura dei modelli". È questo, e non una magia dei dati strutturati, il motivo per cui i blocchi di domande frequenti rendono così tanto in termini di visibilità nell'IA: sono letteralmente coppie domanda-risposta, cioè la forma stessa di ciò che viene recuperato.
I dati strutturati ti rendono interpretabile, non preferibile
JSON-LD non ti procura citazioni. Ti procura una classificazione non ambigua: che cos'è questa pagina, chi l'ha pubblicata, quale testo è una domanda e quale è la sua risposta. Due regole contano più delle altre:
- I dati strutturati delle FAQ devono corrispondere al testo visibile uno a uno. Dati strutturati che affermano qualcosa che la pagina non dice creano un problema di fiducia, e i motori di ricerca trattano la discrepanza come un segnale di spam anziché come una svista di formattazione.
- Non inventare mai valutazioni, premi o conteggi. Un motore che individua una valutazione aggregata inventata ha un motivo per attribuire meno credibilità a tutto il resto che affermi.
La regola 1:1 è il genere di cosa che si deteriora senza farsi notare: qualcuno modifica le FAQ visibili, dimentica i dati strutturati e sei mesi dopo i due contenuti non coincidono più. La facciamo rispettare con un test che visita ogni pagina della nostra mappa del sito, estrae le FAQ dal JSON-LD e verifica che il testo di ogni domanda e risposta compaia alla lettera nel testo visibile della pagina. Se c'è una divergenza, la compilazione fallisce. I dati strutturati sono un'affermazione sulla tua stessa pagina: vanno verificati come tali.
llms.txt: poco costoso, utile e sopravvalutato
Sii onesto su che cosa sia questo file. llms.txt è una convenzione proposta. Nessun grande motore promette di leggerlo e chiunque ti dica che è un canale di acquisizione dei contenuti sta facendo una supposizione.
La sua utilità reale è più circoscritta, ma vale comunque un'ora di lavoro: un unico posto stabile in cui i fatti ufficiali sono espressi con chiarezza — che cos'è il prodotto, come vengono gestiti modelli e dati, prezzi e URL importanti. Quando un crawler o una persona che sta facendo ricerche ci arriva, trova la versione senza enfasi promozionale, anziché doverla ricostruire dalle pagine di marketing. È anche un esercizio utile che ti costringe alla chiarezza. Se non riesci a esporre i fatti sul tuo prodotto in quaranta righe senza aggettivi, non possono riuscirci neppure le tue pagine: è un problema di contenuti che avresti avuto comunque.
Che cosa non è: una garanzia o un sostituto della presenza di quei fatti nelle pagine stesse.
Le contraddizioni ti fanno escludere
I motori di risposta fanno verifiche incrociate. Se la pagina dei prezzi dice una cosa, la documentazione un'altra e le FAQ della pagina iniziale una terza, il motore non decide chi ha ragione: si esprime con cautela oppure cita qualcuno che è stato coerente.
Quindi mantenere coerenti i fatti nei diversi punti in cui compaiono costituisce la maggior parte del lavoro concreto, e non c'è nulla di affascinante. Quando cambia un fatto relativo a un modello, ai prezzi o alla sicurezza, deve cambiare ovunque con lo stesso intervento — pagina, documentazione, FAQ della pagina iniziale, llms.txt — altrimenti hai creato una contraddizione che sopravvivrà alla modifica. La trattiamo come una regola rigida anziché come un'abitudine, perché le abitudini cedono di fronte alle scadenze.
Le conferme esterne valgono più delle proprie dichiarazioni
Ecco la parte più difficile da accettare: il tuo sito è la fonte meno autorevole disponibile su di te. I motori danno peso alle conferme esterne, e fanno bene. Un'affermazione che compare solo sul tuo dominio è un'affermazione di marketing. La stessa affermazione su GitHub, in un confronto di terze parti, in una discussione su un forum o nella documentazione scritta da qualcun altro è un fatto.
Ecco perché, una volta solide le basi sul sito, il lavoro al di fuori del sito rende più di un'altra pagina di destinazione: repository, elenchi, articoli in forma di lista, discussioni autentiche. Detto senza giri di parole: il lavoro sul sito ti rende citabile; quello al di fuori del sito ti fa citare. I team tendono sistematicamente a investire troppo nel primo, perché è la metà che controllano.
Come misurare senza ingannarsi
È qui che gli articoli sulla GEO di solito diventano vaghi, quindi diciamolo: non puoi misurare con precisione le citazioni di ChatGPT. Non esiste una dashboard. Hai a disposizione tre segnali imperfetti:
- Log del server. Cerca con grep
OAI-SearchBoteChatGPT-User. La frequenza delle scansioni e gli URL recuperati ti dicono se sei nell'indice e quali contenuti vengono recuperati in tempo reale. È il segnale più attendibile di cui disponi. - Traffico proveniente dall'assistente. Reale, ma parziale: molte citazioni vengono lette senza che nessuno faccia clic, ed è proprio questo il senso di un motore di risposta.
- Controlli manuali a campione. Poni le dieci domande per cui vuoi essere il riferimento; annota chi viene citato. Un lavoro noioso, indicativo e ancora l'unico modo per osservare direttamente le risposte.
Considera tutti e tre come segnali indicativi. Chiunque ti venda un "punteggio GEO" preciso ti sta vendendo un numero inventato.
Da dove inizieremmo davvero
In ordine di rendimento, non di quanto faccia bella figura in una presentazione:
- 1. Usa
curl -Aper provare i bot di recupero sull'ambiente di produzione. Se l'edge li blocca, nient'altro in questo elenco conta. - 2. Verifica le tue affermazioni principali con
curl | grep. Sposta nell'HTML restituito dal server tutto ciò che esiste solo in JavaScript. - 3. Riscrivi la prima frase sotto ogni titolo in modo che sia la risposta, con soggetti espliciti.
- 4. Rendi identici il testo delle FAQ e i relativi dati strutturati ed elimina tutti i dati strutturati che non puoi supportare con testo visibile.
- 5. Allinea i fatti che si contraddicono tra pagine, documentazione e
llms.txt. - 6. Poi — e solo allora — cerca di ottenere conferme esterne al sito.
I passaggi 1 e 2 sono di solito quelli in cui si nasconde la causa delle citazioni mancanti. Sono anche i due di cui nessuno scrive, perché non riguardano il marketing dei contenuti.
Conclusioni
Farsi citare da ChatGPT è meno misterioso di quanto suggerisca l'acronimo che circonda l'argomento. Renditi raggiungibile dal bot di recupero. Renditi leggibile senza JavaScript. Renditi citabile in una singola frase autonoma. Mantieni la coerenza in tutti i tuoi contenuti. Ottieni conferme da qualche parte che non sia il tuo sito di marketing. Gli strumenti cambiano di continuo; questi cinque principi restano validi.
Eseguiamo questi controlli sul nostro sito e li abbiamo integrati in un flusso di lavoro Orkas che verifica la visibilità di un sito nella ricerca e nelle risposte dell'IA e restituisce un elenco di correzioni in ordine di priorità. Se vuoi conoscere il livello sottostante — come un agente principale pianifica il lavoro e assegna le attività agli specialisti — leggi l'orchestrazione multiagente nella pratica.