"Bagaimana cara saya mendapatkan kutipan dari ChatGPT?" Biasanya dijawab dengan daftar: menulis konten yang bagus, menambahkan skema, membuat sebuah llms.txt. Saran itu tidak terlalu salah karena ditujukan pada lapisan yang salah. Ini menjelaskan seperti apa tampilan halaman, dan melewati dua pertanyaan yang benar-benar menentukan hasilnya: Dapatkah sistem pengambilan mencapai halaman Anda sama sekali, dan Apakah ada bagian di atasnya yang bertahan dari sobek di luar konteks?
Pos ini adalah mekanismenya, dalam urutan yang benar-benar berjalan. Kami menjalankan pemeriksaan ini di situs kami sendiri, dan beberapa di antaranya adalah alasan kami menemukan masalah yang tidak akan diperbaiki oleh jumlah pekerjaan konten.
Kutipan adalah masalah pengambilan, bukan masalah peringkat
Ketika ChatGPT menjawab dengan tautan, itu tidak membaca web secara langsung untuk setiap pertanyaan. Langkah pengambilan menarik bagian kandidat keluar dari indeks; model menyusun jawaban dari apa yang kembali, dan atribut bagian-bagian yang menjadi sandarannya. Dua konsekuensi jatuh dari itu, dan keduanya tidak intuitif jika Anda berasal dari SEO klasik:
- Unitnya adalah bagiannya, bukan halamannya. Sebuah halaman dapat mendapat peringkat dengan baik dan tidak memberikan kontribusi apa pun, karena fakta yang layak dikutip ada dalam sebuah gambar, bagan tanpa teks yang setara, atau paragraf yang hanya ada setelah JavaScript berjalan.
- Dapat diambil dan dapat dikutip adalah bar yang berbeda. Berada dalam indeks adalah prasyarat. Menjadi kalimat terbersih yang tersedia pada pertanyaan adalah apa yang membuat Anda dikaitkan. Sebagian besar daftar periksa GEO hanya membahas yang pertama, dan kemudian bertanya-tanya mengapa lalu lintas tidak bergerak.
Peringkat dan kutipan terpisah dalam praktik. Anda dapat duduk di posisi tiga untuk kata kunci dan tidak pernah dikutip, karena dua halaman di atas Anda kebetulan menyatakan jawaban dalam satu kalimat mandiri dan Anda mengubur jawaban Anda di paragraf keempat dari bagian berjudul "Filosofi Kami".
Tiga bot, tiga pekerjaan yang berbeda
Di sinilah kesalahan paling mahal dibuat, karena orang-orang beralasan tentang "perayap OpenAI" seolah-olah itu adalah satu hal. OpenAI mendokumentasikan tiga agen terpisah, dan mereka melakukannya Tidak Lakukan pekerjaan yang sama:
- Bot GPT — merangkak massal untuk pelatihan model. Memblokirnya mengubah apa yang diserap model masa depan dari situs Anda. Itu tidak menghapus Anda dari kutipan langsung ChatGPT.
- OAI-SearchBot — membangun indeks pencarian yang dibaca kembali. Ini adalah salah satu yang menentukan apakah Anda dapat dikutip sama sekali.
- ChatGPT-Pengguna — mengambil URL tertentu ketika pertanyaan pengguna memicu penelusuran langsung. Blokir itu dan pengambilannya gagal pada saat yang tepat seseorang bertanya tentang Anda.
Kegagalan umum: sebuah tim memutuskan tidak menginginkan model pelatihan kontennya, memblokir GPTBot, dan percaya telah membuat keputusan yang dipertimbangkan. Itu memiliki — tentang pelatihan. Itu tidak mengatakan apa-apa tentang pengambilan. Versi yang lebih buruk: seseorang memblokir setiap agen OpenAI dengan satu aturan wildcard dan diam-diam menghapus perusahaan dari jawaban AI, lalu menghabiskan seperempat bertanya-tanya mengapa pesaing dikutip.
Ini adalah pilihan yang dapat dipisahkan, jadi buatlah secara terpisah. Milik kita sendiri robots.txt Memungkinkan ketiga dan blok /api/ Dan tautan berbagi, karena tautan berbagi adalah konten pengguna yang tidak memiliki bisnis dalam indeks. Milik Anda bisa berbeda - pelatihan dan pengambilan adalah penawaran yang benar-benar berbeda. Putuskan saja per bot, bukan per vendor, dan baca kembali dokumen vendor sesekali, karena kebijakan ini bergerak.
Robots.txt bukanlah gerbang yang benar-benar menghentikanmu
Robot adalah sebuah permintaan, dan itu adalah lapisan yang diperiksa semua orang. Lapisan yang benar-benar menggigit adalah CDN atau WAF Anda. Platform Edge menantang atau memblokir agen pengguna yang tidak dikenal di bawah banyak konfigurasi default, dan hasilnya diam: robots.txt Mengatakan Allow, tepinya mengembalikan 403, dan Anda tidak dapat dirayapi sementara setiap file di repo Anda bersikeras bahwa Anda terbuka untuk bisnis.
Pemeriksaan membutuhkan waktu sepuluh detik dan hampir tidak ada yang menjalankannya:
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/200 Berarti dapat dijangkau. Sebuah 403, sebuah 503, atau halaman tantangan berarti Anda memiliki masalah visibilitas yang tidak akan diperbaiki oleh sejumlah pekerjaan konten. Jalankan terhadap produksi, dari luar jaringan Anda sendiri, untuk setiap domain yang Anda operasikan — setiap domain biasanya memiliki konfigurasi tepinya sendiri, dan mereka terpisah.
Jika Anda hanya melakukan satu hal dari postingan ini, lakukan yang ini. Ini adalah pemeriksaan dengan hasil tertinggi per detik yang dihabiskan, dan tidak terlihat oleh setiap audit konten.
Jika sebuah fakta membutuhkan JavaScript, itu tidak ada
Perayap pengambilan biasanya mengurai HTML mentah tanpa menjalankan JavaScript. Jadi tes untuk mengetahui apakah klaim dapat dikutip bukanlah apa yang ditunjukkan browser Anda — ini:
curl -s https://your-site/page/ | grep -i "the claim you want quoted"Tidak ada dalam output yang berarti tidak ada yang perlu dikutip. Ini memiliki konsekuensi desain yang nyata: teks kutipan-kritis — definisi Anda, fakta penting, jawaban FAQ, penetapan harga, dan klaim keamanan — harus ada di HTML yang dilayani. Kamus runtime yang menukar teks setelah hidrasi baik-baik saja sebagai peningkatan; itu tidak bisa menjadi satu-satunya tempat fakta itu ada.
Ini menggigit paling keras di situs multibahasa, dan ini adalah jebakan yang kami rancang secara eksplisit. Jika salinan bahasa Mandarin Anda hanya ada di kamus JavaScript i18n, maka sejauh menyangkut perayap mentah-HTML, konten bahasa Mandarin Anda tidak ada di sana sama sekali. Perbaikan kami adalah untuk inline setiap bahasa sebagai markup nyata dan membiarkan CSS memutuskan mana yang dilihat manusia. Perayap mendapatkan keempat bahasa; pembaca mendapatkan satu. Itu membutuhkan berat halaman dan itu sepadan.
Tulis bagian-bagian yang bertahan dari terkoyak di luar konteks
Ini adalah bagian yang sebenarnya menulis daripada pipa ledeng, dan di situlah pengaruhnya begitu pipa ledeng bekerja.
Potongan yang diambil tiba di model tanpa halaman Anda di sekitarnya. Tidak ada hierarki judul, tidak ada paragraf sebelumnya, tidak ada navigasi. Tulis untuk itu:
- Jawab dulu. Kalimat pertama di bawah judul seharusnya menjadi jawabannya, bukan landasan pacu. "X is Y" mengalahkan "Dalam lanskap yang berkembang pesat saat ini..." — yang tidak menjawab apa pun dan tidak pernah dikutip.
- Jaga subjek tetap eksplisit. "Itu mendukung OAuth" tidak dapat digunakan setelah dicabut; "Orkas mendukung OAuth" bertahan. Kata ganti mati dalam chunking.
- Buat setiap klaim mandiri. Entitas, kualifikasi, dan batas dalam satu kalimat: "Dengan penyedia Anda sendiri, lalu lintas model langsung menuju penyedia itu dan tidak diproksikan melalui Orkas." Kalimat itu dapat dikutip sendiri tanpa menjadi kebohongan, itulah mengapa itu dapat dikutip.
- Lebih suka dapat diperiksa daripada mengesankan. Superlatif yang tidak jelas tidak pernah dikutip, karena mereka tidak menjawab pertanyaan yang ditanyakan siapa pun.
Pertanyaannya adalah kunci pengambilan
Pengguna mengajukan pertanyaan, dan pengambilan cocok dengan teks berbentuk pertanyaan. Judul yang merupakan pertanyaan harfiah - "Apakah Orkas proxy model lalu lintas?" - lebih cocok daripada frasa kata benda seperti "Arsitektur model". Ini, dan bukan sihir skema, adalah mengapa blok FAQ pukulan jauh di atas beratnya untuk visibilitas AI: mereka secara harfiah adalah pasangan pertanyaan-ke-jawaban, yang merupakan bentuk dari hal yang diambil.
Data terstruktur membuat Anda dapat diuraikan, tidak disukai
JSON-LD tidak membeli kutipan. Itu membeli klasifikasi yang tidak ambigu: apa halaman ini, siapa yang menerbitkannya, teks mana yang merupakan pertanyaan dan mana yang merupakan jawabannya. Dua aturan lebih penting daripada yang lainnya:
- Skema FAQ harus cocok dengan teks yang terlihat satu-ke-satu. Skema yang mengklaim sesuatu yang tidak dikatakan halaman adalah masalah kepercayaan, dan mesin pencari memperlakukan ketidakcocokan sebagai sinyal spam daripada slip pemformatan.
- Jangan pernah mengarang peringkat, penghargaan, atau hitungan. Sebuah mesin yang menangkap satu peringkat agregat yang dibuat telah mendapatkan alasan untuk mengabaikan semua hal lain yang Anda tegaskan.
Aturan 1:1 adalah jenis hal yang diam-diam membusuk — seseorang mengedit FAQ yang terlihat, melupakan skemanya, dan enam bulan kemudian mereka tidak setuju. Kami menegakkannya dengan tes yang menelusuri setiap halaman di peta situs kami, menarik FAQ dari JSON-LD, dan menegaskan setiap pertanyaan dan string jawaban yang muncul kata demi kata dalam teks yang terlihat di halaman itu. Jika melayang, pembangunannya gagal. Data terstruktur adalah klaim tentang halaman Anda sendiri; itu harus diperiksa seperti itu.
Llms.txt: murah, berguna, dan oversold
Jujurlah tentang apa itu file ini. llms.txt Adalah sebuah konvensi yang diusulkan. Tidak ada mesin utama yang berjanji untuk membacanya, dan siapa pun yang memberi tahu Anda bahwa itu adalah saluran konsumsi sedang menebak.
Apa yang sebenarnya bagus untuk lebih sempit dan masih bernilai satu jam: satu tempat yang stabil di mana fakta kanonik Anda dinyatakan dengan jelas — apa produknya, model dan penanganan data, harga, URL yang penting. Ketika perayap atau peneliti manusia mendarat di atasnya, mereka mendapatkan versi yang tidak berputar alih-alih merekonstruksinya dari halaman pemasaran. Ini juga merupakan fungsi pemaksaan yang berguna. Jika Anda tidak dapat menyatakan fakta produk Anda dalam empat puluh baris tanpa kata sifat, halaman Anda juga tidak dapat, dan itu adalah masalah konten yang akan Anda alami.
Apa yang bukan: jaminan, atau pengganti fakta-fakta yang ada di halaman itu sendiri.
Kontradiksi membuatmu jatuh
Mesin jawaban memeriksa silang. Jika halaman harga Anda mengatakan satu hal, dokumen Anda mengatakan hal lain, dan FAQ beranda Anda mengatakan yang ketiga, mesin tidak mengadili - itu lindung nilai, atau itu mengutip seseorang yang konsisten.
Jadi konsistensi fakta di seluruh permukaan adalah sebagian besar pekerjaan yang sebenarnya, dan tidak ada yang glamor. Ketika model, harga, atau fakta keamanan berubah, itu harus berubah di mana-mana dalam perubahan yang sama — halaman, dokumen, FAQ beranda, llms.txt — atau Anda telah membuat sebuah kontradiksi yang akan bertahan lebih lama dari pengeditan. Kami memperlakukan itu sebagai aturan keras daripada kebiasaan, karena kebiasaan kalah dengan tenggat waktu.
Pengesahan mengalahkan penegasan diri
Inilah bagian yang paling sulit untuk diterima: Situs Anda sendiri adalah sumber terlemah yang tersedia tentang Anda. Mesin menguatkan berat, dan mereka benar. Klaim yang hanya muncul di domain Anda sendiri adalah klaim pemasaran. Klaim yang sama di GitHub, dalam perbandingan pihak ketiga, dalam utas forum, dalam dokumentasi yang ditulis orang lain, adalah fakta.
Inilah sebabnya, begitu dasar-dasar di situs menjadi nyata, pekerjaan di luar situs mengungguli halaman arahan lainnya — repos, direktori, daftar, diskusi asli. Secara kasar: pekerjaan di tempat membuat Anda Dapat dikutip; pekerjaan di luar lokasi membuat Anda Dikutip. Tim dapat diandalkan untuk berinvestasi secara berlebihan di yang pertama karena itu adalah setengah yang mereka kendalikan.
Bagaimana mengukur tanpa membohongi diri sendiri
Di sinilah penulisan GEO biasanya menjadi lunak, jadi: Anda tidak dapat mengukur kutipan ChatGPT dengan bersih. Tidak ada dasbor. Apa yang Anda miliki adalah tiga sinyal yang tidak sempurna:
- Log server. Grep untuk
OAI-SearchBotDanChatGPT-User. Frekuensi perayapan dan URL mana yang diambil memberi tahu Anda apakah Anda berada di indeks dan apa yang ditarik secara langsung. Ini adalah sinyal paling jujur yang Anda miliki. - Lalu lintas rujukan dari asisten. Nyata, tetapi parsial - banyak kutipan dibaca dan tidak pernah diklik, yang merupakan inti dari mesin jawaban.
- Pemeriksaan tempat secara manual. Ajukan sepuluh pertanyaan yang ingin Anda miliki; catat siapa yang dikutip. Membosankan, terarah, dan masih satu-satunya cara untuk mengamati permukaan jawaban itu sendiri.
Perlakukan ketiganya sebagai arah. Siapa pun yang menjual kepada Anda "skor GEO" yang tepat menjual kepada Anda nomor yang mereka ciptakan.
Apa yang sebenarnya akan kita lakukan terlebih dahulu
Diurutkan berdasarkan hasil, bukan berdasarkan seberapa bagus tampilannya di dek:
- 1.
curl -ABot pengambilan terhadap produksi. Jika tepi menghalangi mereka, tidak ada hal lain dalam daftar ini yang penting. - 2.
curl | grepKlaim kunci Anda. Pindahkan apa pun yang hanya JavaScript ke HTML yang dilayani. - 3. Tulis ulang kalimat pertama di bawah setiap judul untuk menjadi jawabannya, dengan subjek yang eksplisit.
- 4. Buat teks FAQ dan skema FAQ identik, dan hapus skema apa pun yang tidak dapat Anda kembalikan dengan teks yang terlihat.
- 5. Rekonsiliasi fakta yang saling bertentangan di seluruh halaman, dokumen, dan
llms.txt. - 6. Kemudian - dan hanya kemudian - dapatkan dukungan di luar lokasi.
Langkah 1 dan 2 biasanya di mana kutipan yang hilang disembunyikan. Mereka juga dua orang yang tidak ada yang menulis posting tentang, karena mereka bukan pemasaran konten.
Membungkus
Mendapatkan kutipan oleh ChatGPT kurang misterius daripada yang disarankan oleh akronim di sekitarnya. Dapat dijangkau oleh bot pengambilan. Dapat dibaca tanpa JavaScript. Dapat dikutip dalam satu kalimat mandiri. Jadilah konsisten di seluruh permukaan Anda sendiri. Dikuatkan di suatu tempat yang bukan situs pemasaran Anda. Perkakas itu bergejolak; kelimanya bertahan.
Kami menjalankan pemeriksaan ini di situs kami sendiri, dan kami membangunnya ke dalam alur kerja Orkas yang mengaudit situs Pencarian dan visibilitas jawaban AI Dan mengembalikan daftar perbaikan yang diprioritaskan. Jika Anda menginginkan lapisan di bawahnya — bagaimana agen utama berencana bekerja dan mengirim spesialis untuk melakukannya — baca Orkestrasi multi-agen dalam praktiknya.