Auf "Wie werde ich von ChatGPT zitiert?" folgt meist eine Liste von Tipps: gute Inhalte schreiben, Schema ergänzen, eine llms.txt erstellen. Diese Ratschläge sind weniger falsch, als vielmehr auf die falsche Ebene gerichtet. Sie beschreiben, wie eine Seite aussehen sollte, und überspringen die zwei Fragen, die tatsächlich entscheiden: Kann das Abrufsystem Ihre Seite überhaupt erreichen, und enthält sie eine Passage, die auch aus dem Zusammenhang gerissen Bestand hat?
Dieser Beitrag beschreibt den Mechanismus in seiner tatsächlichen Reihenfolge. Wir führen diese Prüfungen auf unserer eigenen Website durch. Einige davon haben uns Probleme finden lassen, die sich durch noch so viel Inhaltsarbeit nicht hätten beheben lassen.
Zitiert zu werden ist eine Frage des Abrufs, nicht des Rankings
Wenn ChatGPT mit Links antwortet, liest es nicht für jede Frage live das Web. Ein Abrufschritt holt mögliche Passagen aus einem Index; das Modell formuliert aus dem Ergebnis eine Antwort und nennt Quellen für die Teile, auf die es sich stützt. Daraus folgen zwei Dinge, die beide ungewohnt sind, wenn Sie aus der klassischen SEO kommen:
- Die Einheit ist die Passage, nicht die Seite. Eine Seite kann gut ranken und trotzdem nichts beitragen, weil der zitierenswerte Fakt in einem Bild, einem Diagramm ohne Textentsprechung oder einem Absatz steckt, der erst nach der JavaScript-Ausführung existiert.
- Abrufbar und zitierbar sind unterschiedliche Hürden. Im Index zu sein ist eine Voraussetzung. Als Quelle genannt werden Sie, wenn Sie den klarsten verfügbaren Satz zur Frage liefern. Die meisten GEO-Checklisten behandeln nur Ersteres und wundern sich dann, warum der Traffic unverändert bleibt.
Ranking und Zitierung fallen in der Praxis auseinander. Sie können für ein Keyword auf Platz drei stehen und nie zitiert werden, weil die beiden Seiten vor Ihnen die Antwort zufällig in einem eigenständigen Satz formulieren, während Ihre im vierten Absatz eines Abschnitts namens "Unsere Philosophie" vergraben ist.
Drei Bots, drei unterschiedliche Aufgaben
Hier passieren die teuersten Fehler, weil Menschen über "den Crawler von OpenAI" sprechen, als wäre es ein einziges System. OpenAI dokumentiert drei separate Agenten, und sie erfüllen nicht dieselbe Aufgabe:
- GPTBot — umfangreiches Crawling für das Modelltraining. Ihn zu blockieren verändert, was künftige Modelle von Ihrer Website aufnehmen. Es entfernt Sie nicht aus den aktuellen Quellenangaben von ChatGPT.
- OAI-SearchBot — baut den Suchindex auf, auf den der Abruf zugreift. Dieser Bot entscheidet darüber, ob Sie überhaupt zitiert werden können.
- ChatGPT-User — ruft eine konkrete URL ab, wenn eine Nutzerfrage einen Live-Webzugriff auslöst. Blockieren Sie ihn, scheitert der Abruf genau in dem Moment, in dem jemand nach Ihnen fragt.
Der häufige Fehler: Ein Team beschließt, seine Inhalte nicht zum Modelltraining freizugeben, blockiert GPTBot und glaubt, eine durchdachte Entscheidung getroffen zu haben. Das hat es — zum Training. Über den Abruf hat es nichts entschieden. Die schlimmere Variante: Jemand blockiert mit einer Platzhalterregel alle OpenAI-Agenten und entfernt das Unternehmen unbemerkt aus KI-Antworten. Anschließend wundert man sich ein Quartal lang, warum Wettbewerber zitiert werden.
Diese Entscheidungen sind trennbar, also treffen Sie sie getrennt. Unsere eigene robots.txt erlaubt alle drei und sperrt /api/ sowie Freigabelinks, denn Freigabelinks enthalten Nutzerinhalte, die nichts in einem Index zu suchen haben. Ihre Entscheidung kann anders ausfallen — Training und Abruf sind tatsächlich unterschiedliche Abwägungen. Entscheiden Sie nur pro Bot, nicht pro Anbieter, und lesen Sie gelegentlich erneut die Anbieterdokumentation, denn diese Regeln ändern sich.
robots.txt ist nicht die Schranke, die Sie tatsächlich aufhält
Robots ist eine Bitte und die Ebene, die alle prüfen. Die Ebene, die tatsächlich zugreift, ist Ihr CDN oder Ihre WAF. Edge-Plattformen fordern bei unbekannten User-Agents in vielen Standardkonfigurationen eine Prüfung an oder blockieren sie. Das Ergebnis bleibt unbemerkt: robots.txt sagt Allow, die Edge liefert 403 und Ihre Seite ist nicht crawlbar, während jede Datei im Repository Offenheit verspricht.
Die Prüfung dauert zehn Sekunden und fast niemand führt sie aus:
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/200 bedeutet erreichbar. 403, 503 oder eine Prüfseite bedeuten, dass Sie ein Sichtbarkeitsproblem haben, das keine Inhaltsarbeit beheben wird. Prüfen Sie die Produktion von außerhalb Ihres eigenen Netzwerks für jede betriebene Domain — jede Domain hat meist eine eigene Edge-Konfiguration, und diese entwickeln sich auseinander.
Wenn Sie aus diesem Beitrag nur eine Sache umsetzen, dann diese. Diese Prüfung liefert den höchsten Nutzen pro investierter Sekunde und bleibt bei jedem Inhaltsaudit unsichtbar.
Wenn ein Fakt JavaScript braucht, existiert er nicht
Abruf-Crawler analysieren häufig rohes HTML, ohne JavaScript auszuführen. Der Test dafür, ob eine Aussage zitierbar ist, besteht daher nicht in dem, was Ihr Browser anzeigt, sondern darin:
curl -s https://your-site/page/ | grep -i "the claim you want quoted"Keine Ausgabe bedeutet: nichts zu zitieren. Daraus folgt eine konkrete Gestaltungsanforderung: Für Zitate entscheidender Text — Ihre Definition, zentrale Fakten, FAQ-Antworten, Preis- und Sicherheitsaussagen — muss im ausgelieferten HTML stehen. Ein Laufzeitwörterbuch, das nach der Hydration Text austauscht, ist als Ergänzung in Ordnung; es darf nicht der einzige Ort sein, an dem der Fakt existiert.
Das trifft mehrsprachige Websites am stärksten, und genau diese Falle haben wir bei unserem Entwurf bewusst vermieden. Wenn Ihr chinesischer Text nur in einem JavaScript-i18n-Wörterbuch steht, existiert Ihr chinesischer Inhalt aus Sicht eines Crawlers für rohes HTML überhaupt nicht. Unsere Lösung bindet jede Sprache als echtes Markup ein und lässt CSS entscheiden, welche ein Mensch sieht. Crawler bekommen alle vier Sprachen, Leser eine. Das erhöht die Seitengröße und ist es wert.
Schreiben Sie Passagen, die auch aus dem Zusammenhang gerissen Bestand haben
Hier geht es tatsächlich ums Schreiben statt um technische Infrastruktur. Sobald die Infrastruktur funktioniert, liegt hier der größte Hebel.
Ein abgerufener Abschnitt erreicht das Modell ohne die umgebende Seite. Keine Überschriftenhierarchie, kein vorheriger Absatz, keine Navigation. Schreiben Sie entsprechend:
- Die Antwort zuerst. Der erste Satz unter einer Überschrift sollte die Antwort sein, kein Anlauf. "X ist Y" ist besser als "In der heutigen, sich rasant entwickelnden Welt …" — das beantwortet nichts und wird nie zitiert.
- Subjekte ausdrücklich benennen. "Es unterstützt OAuth" ist herausgelöst unbrauchbar; "Orkas unterstützt OAuth" bleibt verständlich. Pronomen überleben die Aufteilung in Abschnitte nicht.
- Jede Aussage muss für sich stehen. Entität, Einschränkung und Grenze in einem Satz: "Bei Ihrem eigenen Anbieter geht der Modellverkehr direkt an diesen Anbieter und wird nicht über Orkas weitergeleitet." Dieser Satz lässt sich allein zitieren, ohne zur Unwahrheit zu werden. Genau deshalb ist er zitierbar.
- Überprüfbar ist besser als beeindruckend. Vage Superlative werden nie zitiert, weil sie keine tatsächlich gestellte Frage beantworten.
Die Frage ist der Schlüssel zum Abruf
Nutzer stellen Fragen, und der Abruf gleicht Texte in Frageform ab. Eine Überschrift, die die konkrete Frage enthält — "Leitet Orkas Modellverkehr weiter?" — passt besser als eine Nominalphrase wie "Modellarchitektur". Das, nicht irgendeine Schema-Magie, erklärt die überproportionale Wirkung von FAQ-Blöcken auf die KI-Sichtbarkeit: Sie bestehen buchstäblich aus Frage-Antwort-Paaren und entsprechen damit der Form dessen, was abgerufen wird.
Strukturierte Daten machen Sie auswertbar, nicht bevorzugt
JSON-LD verschafft keine Zitate. Es ermöglicht eine eindeutige Einordnung: Was diese Seite ist, wer sie veröffentlicht hat, welcher Text eine Frage ist und welcher ihre Antwort. Zwei Regeln sind wichtiger als alle anderen:
- Das FAQ-Schema muss dem sichtbaren Text eins zu eins entsprechen. Ein Schema, das etwas behauptet, was die Seite nicht sagt, ist ein Vertrauensproblem. Suchmaschinen behandeln diese Abweichung als Spam-Signal statt als Formatierungsfehler.
- Erfinden Sie niemals Bewertungen, Auszeichnungen oder Zahlen. Erkennt eine Suchmaschine eine einzige erfundene Gesamtbewertung, hat sie einen Grund, alle Ihre übrigen Aussagen abzuwerten.
Die 1:1-Regel veraltet leicht unbemerkt — jemand bearbeitet die sichtbare FAQ, vergisst das Schema, und sechs Monate später widersprechen sie sich. Wir erzwingen sie mit einem Test, der jede Seite unserer Sitemap durchgeht, die FAQ aus dem JSON-LD liest und prüft, ob jede Frage und Antwort wortwörtlich im sichtbaren Seitentext steht. Bei Abweichungen schlägt der Build fehl. Strukturierte Daten sind eine Aussage über Ihre eigene Seite; sie sollten entsprechend geprüft werden.
llms.txt: günstig, nützlich und überbewertet
Seien Sie ehrlich darüber, was diese Datei ist. llms.txt ist eine vorgeschlagene Konvention. Keine große Such- oder Antwortmaschine verspricht, sie zu lesen. Wer sie als Kanal zur Datenaufnahme bezeichnet, stellt eine Vermutung an.
Ihr tatsächlicher Nutzen ist enger gefasst und trotzdem eine Stunde wert: ein beständiger Ort, an dem Ihre maßgeblichen Fakten klar stehen — was das Produkt ist, der Umgang mit Modellen und Daten, Preise und wichtige URLs. Wenn ein Crawler oder ein recherchierender Mensch darauf landet, bekommt er die ungeschönte Fassung, statt sie aus Marketingseiten rekonstruieren zu müssen. Die Datei zwingt außerdem zu Klarheit. Wenn Sie die Fakten Ihres Produkts nicht in vierzig Zeilen ohne Adjektive formulieren können, können Ihre Seiten das auch nicht. Dieses Inhaltsproblem hätten Sie ohnehin.
Was sie nicht ist: eine Garantie oder ein Ersatz dafür, dass diese Fakten auf den Seiten selbst stehen.
Widersprüche führen zum Ausschluss
Antwortmaschinen gleichen Aussagen ab. Wenn Ihre Preisseite eines sagt, Ihre Dokumentation etwas anderes und die FAQ auf der Startseite ein Drittes, entscheidet die Maschine nicht, wer recht hat — sie relativiert oder zitiert jemanden, der konsistent ist.
Der größte Teil der eigentlichen Arbeit besteht deshalb darin, Fakten über alle Auftritte hinweg konsistent zu halten, und nichts daran ist glamourös. Wenn sich ein Fakt zu Modellen, Preisen oder Sicherheit ändert, muss er im selben Änderungsschritt überall angepasst werden — Seite, Dokumentation, Startseiten-FAQ, llms.txt. Sonst haben Sie einen Widerspruch erzeugt, der die Bearbeitung überdauert. Wir behandeln das als feste Regel statt als Gewohnheit, denn Gewohnheiten verlieren gegen Fristen.
Bestätigung von außen schlägt Selbstauskunft
Das ist der am schwersten zu akzeptierende Teil: Ihre eigene Website ist die schwächste verfügbare Quelle über Sie. Such- und Antwortmaschinen gewichten unabhängige Bestätigung, und das zu Recht. Eine Aussage, die nur auf Ihrer eigenen Domain steht, ist eine Marketingaussage. Dieselbe Aussage auf GitHub, in einem Vergleich eines Dritten, einem Forenbeitrag oder einer fremden Dokumentation ist ein Fakt.
Deshalb bringt Arbeit außerhalb der eigenen Website mehr als eine weitere Landingpage, sobald die Grundlagen auf Ihrer Website stimmen — Repositorys, Verzeichnisse, Listenartikel, echte Diskussionen. Grob gesagt: Arbeit auf der Website macht Sie zitierbar; Arbeit außerhalb sorgt dafür, dass Sie zitiert werden. Teams investieren regelmäßig zu viel in Ersteres, weil sie diesen Teil kontrollieren.
Messen, ohne sich selbst etwas vorzumachen
Hier werden Texte über GEO meist vage. Deshalb klar gesagt: ChatGPT-Zitate lassen sich nicht sauber messen. Es gibt kein Dashboard. Sie haben drei unvollkommene Signale:
- Serverprotokolle. Suchen Sie nach
OAI-SearchBotundChatGPT-User. Crawl-Häufigkeit und abgerufene URLs zeigen, ob Sie im Index sind und was live abgerufen wird. Das ist das ehrlichste Signal, über das Sie verfügen. - Verweistraffic vom Assistenten. Echt, aber unvollständig — viele Quellenangaben werden gelesen und nie angeklickt, was gerade der Sinn einer Antwortmaschine ist.
- Manuelle Stichproben. Stellen Sie die zehn Fragen, bei denen Sie präsent sein möchten, und notieren Sie, wer zitiert wird. Mühsam, richtungsweisend und dennoch die einzige Möglichkeit, die Antworten selbst zu beobachten.
Betrachten Sie alle drei als Richtungshinweise. Wer Ihnen einen präzisen "GEO-Score" verkauft, verkauft Ihnen eine selbst erfundene Zahl.
Was wir tatsächlich zuerst tun würden
Nach Nutzen geordnet, nicht danach, wie gut es auf Folien aussieht:
- 1. Prüfen Sie die Abruf-Bots mit
curl -Agegen die Produktion. Wenn die Edge sie blockiert, ist alles andere auf dieser Liste bedeutungslos. - 2. Prüfen Sie Ihre Kernaussagen mit
curl | grep. Verschieben Sie alles, was nur in JavaScript existiert, in das ausgelieferte HTML. - 3. Formulieren Sie den ersten Satz unter jeder Überschrift als Antwort mit ausdrücklich benanntem Subjekt.
- 4. Machen Sie FAQ-Text und FAQ-Schema identisch und löschen Sie jedes Schema, das sich nicht durch sichtbaren Text belegen lässt.
- 5. Gleichen Sie widersprüchliche Fakten auf Seiten, in der Dokumentation und in
llms.txtab. - 6. Sorgen Sie dann — und erst dann — für unabhängige Bestätigung außerhalb Ihrer Website.
In Schritt 1 und 2 verbergen sich meist die fehlenden Zitate. Es sind zugleich die beiden Schritte, über die niemand Beiträge schreibt, weil sie kein Content-Marketing sind.
Zum Abschluss
Von ChatGPT zitiert zu werden ist weniger rätselhaft, als das dazugehörige Akronym vermuten lässt. Seien Sie für den Abruf-Bot erreichbar. Ohne JavaScript lesbar. In einem eigenständigen Satz zitierbar. Über Ihre eigenen Auftritte hinweg konsistent. Und an einem Ort bestätigt, der nicht Ihre Marketingwebsite ist. Die Werkzeuge wechseln; diese fünf Punkte bleiben.
Wir führen diese Prüfungen auf unserer eigenen Website durch und haben sie in einen Orkas-Workflow eingebaut, der die Sichtbarkeit einer Website in Suche und KI-Antworten prüft und eine priorisierte Korrekturliste zurückgibt. Wenn Sie die Ebene darunter interessiert — wie ein leitender Agent Arbeit plant und Spezialisten einsetzt —, lesen Sie Multi-Agenten-Orchestrierung in der Praxis.