La pregunta "¿Cómo consigo que ChatGPT me cite?" suele responderse con un artículo en forma de lista: escribe buen contenido, añade marcado de esquema, crea un archivo llms.txt. El problema de esos consejos no es tanto que estén equivocados como que apuntan a la capa equivocada. Describen cómo debería ser una página y omiten las dos preguntas que realmente deciden el resultado: ¿puede el sistema de recuperación acceder siquiera a tu página? y ¿hay en ella un fragmento que siga teniendo sentido al sacarlo de contexto?
Esta publicación explica el mecanismo en el orden en que realmente se ejecuta. Aplicamos estas comprobaciones a nuestro propio sitio, y un par de ellas nos permitieron encontrar problemas que ningún trabajo sobre el contenido habría solucionado.
Conseguir citas es un problema de recuperación de información, no de posicionamiento
Cuando ChatGPT responde con enlaces, no está leyendo la web en directo para cada pregunta. Una etapa de recuperación extrae de un índice fragmentos candidatos; el modelo compone una respuesta a partir de lo recuperado y atribuye las partes en las que se apoyó. De ello se derivan dos consecuencias, y ambas resultan poco intuitivas si vienes del SEO clásico:
- La unidad es el fragmento, no la página. Una página puede estar bien posicionada y no aportar nada porque el dato que merece citarse está en una imagen, en un gráfico sin equivalente textual o en un párrafo que solo existe después de ejecutar JavaScript.
- Poder recuperarse y merecer una cita son requisitos distintos. Estar en el índice es una condición previa. Ofrecer la frase más clara disponible sobre la pregunta es lo que consigue que se te atribuya la información. La mayoría de las listas de comprobación de GEO solo abordan lo primero y luego se preguntan por qué no cambió el tráfico.
El posicionamiento y las citas no van de la mano en la práctica. Puedes ocupar la tercera posición para una palabra clave y no recibir nunca una cita, porque las dos páginas que tienes por delante expresan la respuesta en una sola frase autónoma y tú la escondes en el cuarto párrafo de una sección titulada "Nuestra filosofía".
Tres bots, tres trabajos distintos
Aquí se cometen los errores más costosos, porque la gente piensa en "el rastreador de OpenAI" como si fuera una sola cosa. OpenAI documenta tres agentes separados, y no hacen el mismo trabajo:
- GPTBot: rastreo masivo para entrenar modelos. Bloquearlo cambia lo que los futuros modelos absorben de tu sitio. No te elimina de las citas que ChatGPT obtiene en directo.
- OAI-SearchBot: construye el índice de búsqueda que consulta el sistema de recuperación. Este es el que decide si pueden citarte siquiera.
- ChatGPT-User: accede a una URL específica cuando la pregunta de un usuario activa la navegación en directo. Si lo bloqueas, el acceso falla justo cuando alguien pregunta por ti.
El fallo habitual: un equipo decide que no quiere que su contenido se use para entrenar modelos, bloquea GPTBot y cree haber tomado una decisión meditada. Y así es, pero sobre el entrenamiento. No ha decidido nada sobre la recuperación. La versión peor: alguien bloquea todos los agentes de OpenAI con una sola regla comodín y elimina silenciosamente a la empresa de las respuestas de IA; después pasa un trimestre preguntándose por qué se cita a la competencia.
Son decisiones independientes, así que tómalas por separado. Nuestro propio robots.txt permite los tres y bloquea /api/ y los enlaces compartidos, porque estos contienen contenido de usuarios que no debería estar en un índice. Tu configuración puede ser distinta: el entrenamiento y la recuperación implican condiciones realmente diferentes. Simplemente decide por bot, no por proveedor, y vuelve a leer de vez en cuando la documentación del proveedor, porque estas políticas cambian.
robots.txt no es la barrera que realmente te bloquea
Robots es una solicitud, y es la capa que todo el mundo inspecciona. La capa que realmente causa problemas es tu CDN o WAF. Muchas configuraciones predeterminadas de las plataformas de borde exigen verificaciones a los agentes de usuario desconocidos o los bloquean, y el resultado es silencioso: robots.txt dice Allow, el servidor de borde devuelve 403 y no se te puede rastrear mientras todos los archivos de tu repositorio insisten en que el sitio está abierto.
La comprobación tarda diez segundos y casi nadie la ejecuta:
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/200 significa que el sitio es accesible. Un 403, un 503 o una página de verificación significan que tienes un problema de visibilidad que ningún trabajo sobre el contenido solucionará. Ejecuta la prueba contra el entorno de producción, desde fuera de tu propia red, para cada dominio que operes: cada dominio suele tener su propia configuración de borde, y esas configuraciones van divergiendo.
Si solo haces una cosa de esta publicación, haz esta. Es la comprobación que más aporta por segundo invertido, y resulta invisible para cualquier auditoría de contenido.
Si un dato necesita JavaScript, no existe
Los rastreadores de recuperación suelen analizar el HTML sin procesar sin ejecutar JavaScript. Por eso, la prueba para saber si una afirmación puede citarse no es lo que muestra tu navegador, sino esto:
curl -s https://your-site/page/ | grep -i "the claim you want quoted"Si no aparece nada en la salida, no hay nada que citar. Esto tiene una consecuencia real para el diseño: el texto esencial para las citas —tu definición, los datos clave, las respuestas a preguntas frecuentes, los precios y las afirmaciones sobre seguridad— tiene que estar en el HTML que se entrega. Un diccionario que sustituye texto en tiempo de ejecución después de la hidratación está bien como mejora; no puede ser el único lugar donde existe el dato.
Esto afecta especialmente a los sitios multilingües, y es la trampa que evitamos deliberadamente en nuestro diseño. Si tu texto en chino solo existe en un diccionario i18n de JavaScript, para un rastreador de HTML sin procesar tu contenido en chino no existe en absoluto. Nuestra solución consiste en incluir cada idioma directamente como marcado real y dejar que CSS decida cuál ve la persona. Los rastreadores reciben los cuatro idiomas; los lectores, uno. Aumenta el peso de la página, y vale la pena.
Escribe fragmentos que sigan teniendo sentido fuera de contexto
Esta es la parte que consiste realmente en escribir y no en ajustar la infraestructura, y es donde puedes marcar la diferencia una vez que la infraestructura funciona.
Un fragmento recuperado llega al modelo sin el resto de tu página. Sin jerarquía de encabezados, sin el párrafo anterior, sin navegación. Escribe teniendo eso en cuenta:
- Primero, la respuesta. La primera frase bajo un encabezado debe ser la respuesta, no un preámbulo. "X es Y" supera a "En el panorama actual, que evoluciona rápidamente…", que no responde a nada y nunca se cita.
- Mantén los sujetos explícitos. "Es compatible con OAuth" resulta inutilizable al extraerlo; "Orkas es compatible con OAuth" sigue teniendo sentido. Los pronombres pierden su referente al dividir el texto en fragmentos.
- Haz que cada afirmación se sostenga por sí sola. Entidad, condición y límite en una frase: "Con tu propio proveedor, el tráfico del modelo va directamente a ese proveedor y no pasa por Orkas como intermediario." Esa frase puede citarse sola sin convertirse en una falsedad, y precisamente por eso es citable.
- Prefiere lo comprobable a lo impresionante. Los superlativos vagos nunca se citan porque no responden a ninguna pregunta que alguien haya hecho.
La pregunta es la clave de recuperación
Los usuarios hacen preguntas y el sistema de recuperación busca coincidencias con textos formulados como preguntas. Un encabezado que contiene la pregunta literal —"¿Orkas actúa como intermediario del tráfico del modelo?"— encaja mejor que una expresión nominal como "Arquitectura del modelo". Esto, y no una supuesta magia del marcado de esquema, explica por qué los bloques de preguntas frecuentes aportan tanto a la visibilidad en IA: son literalmente pares de pregunta y respuesta, que es la forma de lo que se está recuperando.
Los datos estructurados facilitan el análisis, no la preferencia
JSON-LD no consigue citas. Consigue una clasificación inequívoca: qué es esta página, quién la publicó, qué texto es una pregunta y cuál es su respuesta. Dos reglas importan más que las demás:
- El marcado de esquema de preguntas frecuentes debe coincidir uno a uno con el texto visible. Un marcado que afirma algo que la página no dice es un problema de confianza, y los buscadores tratan la discrepancia como una señal de spam, no como un descuido de formato.
- Nunca inventes valoraciones, premios ni recuentos. Un motor que detecta una sola valoración agregada inventada tiene motivos para restar credibilidad a todo lo demás que afirmes.
La regla 1:1 es de las que se deterioran sin que nadie lo note: alguien edita las preguntas frecuentes visibles, se olvida del marcado y seis meses después ya no coinciden. La hacemos cumplir mediante una prueba que recorre cada página de nuestro mapa del sitio, extrae las preguntas frecuentes del JSON-LD y comprueba que el texto de cada pregunta y respuesta aparece literalmente en el texto visible de esa página. Si hay divergencias, la compilación falla. Los datos estructurados son una afirmación sobre tu propia página; deben comprobarse como tal.
llms.txt: económico, útil y sobrevalorado
Sé honesto sobre lo que es este archivo. llms.txt es una convención propuesta. Ningún motor importante promete leerlo, y cualquiera que te diga que es un canal de incorporación de datos está haciendo una conjetura.
Su utilidad real es más limitada y aun así merece una hora: un lugar estable donde se expongan con claridad los datos oficiales de tu producto, qué es, cómo se gestionan los modelos y los datos, los precios y las URL importantes. Cuando un rastreador o una persona que investiga llega a él, obtiene la versión sin adornos en vez de reconstruirla a partir de páginas de marketing. También es un ejercicio útil que te obliga a concretar. Si no puedes exponer los hechos de tu producto en cuarenta líneas sin adjetivos, tus páginas tampoco podrán hacerlo, y ese es un problema de contenido que ibas a tener de todos modos.
Lo que no es: una garantía ni un sustituto de que esos datos estén en las propias páginas.
Las contradicciones hacen que te descarten
Los motores de respuestas contrastan la información. Si tu página de precios dice una cosa, tu documentación dice otra y las preguntas frecuentes de tu página de inicio dicen una tercera, el motor no decide quién tiene razón: responde con reservas o cita a alguien que haya sido coherente.
Por eso, mantener la coherencia de los datos entre todos los lugares donde aparecen constituye la mayor parte del trabajo real, y nada de ello es vistoso. Cuando cambia un dato sobre modelos, precios o seguridad, tiene que cambiar en todas partes dentro de la misma actualización —página, documentación, preguntas frecuentes de la página de inicio, llms.txt— o habrás creado una contradicción que perdurará después de la edición. Lo tratamos como una regla estricta y no como un hábito, porque los hábitos ceden ante los plazos.
La corroboración pesa más que lo que afirmas sobre ti
Esta es la parte más difícil de aceptar: tu propio sitio es la fuente más débil disponible sobre ti. Los motores dan peso a la corroboración, y hacen bien. Una afirmación que solo aparece en tu propio dominio es una afirmación de marketing. Esa misma afirmación en GitHub, en una comparativa de terceros, en un hilo de un foro o en documentación escrita por otra persona es un hecho.
Por eso, una vez que los fundamentos del sitio están realmente resueltos, el trabajo fuera de él rinde más que otra página de destino: repositorios, directorios, artículos en forma de lista, conversaciones auténticas. Dicho sin rodeos: el trabajo dentro del sitio hace que puedan citarte; el trabajo fuera del sitio hace que te citen. Los equipos tienden a invertir demasiado en lo primero porque es la mitad que controlan.
Cómo medir sin engañarte
Aquí es donde los textos sobre GEO suelen perder precisión, así que seamos claros: no puedes medir con exactitud las citas de ChatGPT. No hay un panel de control. Lo que tienes son tres señales imperfectas:
- Registros del servidor. Busca con grep
OAI-SearchBotyChatGPT-User. La frecuencia de rastreo y las URL a las que acceden te indican si estás en el índice y qué se está consultando en directo. Es la señal más fiel que tienes a tu disposición. - Tráfico de referencia desde el asistente. Es real, pero parcial: muchas citas se leen y nunca reciben un clic, que es precisamente la razón de ser de un motor de respuestas.
- Comprobaciones manuales puntuales. Haz las diez preguntas en las que quieres ser la referencia; registra a quién se cita. Es tedioso y orientativo, pero sigue siendo la única forma de observar las propias respuestas.
Trata las tres como orientativas. Cualquiera que te venda una "puntuación GEO" precisa te está vendiendo un número que se ha inventado.
Qué haríamos realmente primero
Ordenado por resultados, no por lo bien que queda en una presentación:
- 1. Ejecuta
curl -Acon los agentes de los bots de recuperación contra el entorno de producción. Si la capa de borde los bloquea, nada más de esta lista importa. - 2. Comprueba tus afirmaciones clave con
curl | grep. Traslada al HTML que se entrega todo lo que solo exista en JavaScript. - 3. Reescribe la primera frase bajo cada encabezado para que sea la respuesta, con sujetos explícitos.
- 4. Haz que el texto de las preguntas frecuentes y su marcado de esquema sean idénticos, y elimina cualquier marcado que no puedas respaldar con texto visible.
- 5. Corrige los datos que se contradigan entre las páginas, la documentación y
llms.txt. - 6. Después, y solo después, busca corroboración fuera de tu sitio.
Los pasos 1 y 2 suelen ser donde se esconde la causa de las citas que faltan. También son los dos sobre los que nadie escribe publicaciones, porque no son marketing de contenidos.
Para terminar
Conseguir que ChatGPT te cite es menos misterioso de lo que sugiere la sigla que lo rodea. Haz que el bot de recuperación pueda acceder a ti. Haz que tu contenido pueda leerse sin JavaScript. Ofrece una frase autónoma que pueda citarse. Mantén la coherencia entre tus propios canales. Consigue corroboración en algún lugar que no sea tu sitio de marketing. Las herramientas cambian sin cesar; esos cinco principios se mantienen.
Aplicamos estas comprobaciones a nuestro propio sitio y las incorporamos a un flujo de trabajo de Orkas que audita la visibilidad de un sitio en búsquedas y respuestas de IA y devuelve una lista priorizada de correcciones. Si quieres conocer la capa subyacente —cómo un agente principal planifica el trabajo y asigna su ejecución a especialistas—, lee orquestación de múltiples agentes en la práctica.