Orkas Orkas
डाउनलोड GitHub
मुखपृष्ठ ब्लॉग शोध
शोध

ChatGPT से अपनी सामग्री का हवाला कैसे दिलाएँ: वास्तव में क्या तय करता है कि आपकी सामग्री उद्धृत होगी या नहीं

स्रोत के रूप में उद्धृत होना रैंक पाना नहीं है। इसका मतलब है जानकारी खोजकर लाने की प्रक्रिया में चुने जाना, और फिर उद्धृत करने लायक अंश होना। यहाँ इसकी कार्यप्रणाली, सचमुच असर डालने वाली जाँचें और बेअसर जाँचें दी गई हैं।

"ChatGPT मेरे पेज को स्रोत के रूप में कैसे उद्धृत करे?" इसका जवाब आमतौर पर एक सूची वाले लेख से मिलता है: अच्छा कंटेंट लिखें, स्कीमा जोड़ें, एक llms.txtबनाएँ। यह सलाह गलत कम है, गलत स्तर पर केंद्रित ज़्यादा है। यह बताती है कि पेज कैसा दिखना चाहिए, लेकिन नतीजा तय करने वाले दो सवाल छोड़ देती है: क्या जानकारी खोजकर लाने वाला सिस्टम आपके पेज तक पहुँच भी सकता है, और क्या उस पर ऐसा अंश है जो संदर्भ से अलग किए जाने पर भी उपयोगी रहे?

यह लेख कार्यप्रणाली को उसी क्रम में बताता है जिसमें वह वास्तव में चलती है। हम ये जाँचें अपनी साइट पर करते हैं, और इनमें से कुछ की वजह से ही हमें ऐसी समस्याएँ मिलीं जिन्हें कंटेंट पर कितना भी काम करके ठीक नहीं किया जा सकता था।

संक्षिप्त विवरण उल्लेख होना, स्रोत के रूप में उद्धृत होना नहीं है SeoGeoAgent जाँचता है कि कौन-से जवाब वास्तव में आपके डोमेन को स्रोत के रूप में उद्धृत करते हैं और इसे याददाश्त से बताए गए ब्रांड नाम से अलग रखता है। देखें खोज और AI जवाबों में दृश्यता.
Orkas डाउनलोड करें — मुफ़्त

स्रोत के रूप में उद्धृत होना जानकारी खोजकर लाने की समस्या है, रैंकिंग की नहीं

जब ChatGPT लिंक के साथ जवाब देता है, तो वह हर सवाल के लिए वेब को उसी समय नहीं पढ़ता। जानकारी खोजकर लाने का एक चरण इंडेक्स से संभावित अंश निकालता है; मॉडल मिली हुई जानकारी से जवाब तैयार करता है और जिन हिस्सों पर निर्भर रहा, उनके स्रोत बताता है। इसके दो नतीजे निकलते हैं, और पारंपरिक SEO के नज़रिए से दोनों सहज नहीं लगते:

  • इकाई अंश है, पेज नहीं। कोई पेज अच्छी रैंकिंग के बावजूद कोई योगदान नहीं दे सकता, क्योंकि उद्धृत करने योग्य तथ्य किसी छवि में, बिना पाठ वाले चार्ट में, या ऐसे पैराग्राफ़ में है जो JavaScript चलने के बाद ही मौजूद होता है।
  • खोजकर लाया जा सकना और उद्धृत करने योग्य होना अलग मानदंड हैं। इंडेक्स में होना एक पूर्वशर्त है। सवाल पर उपलब्ध सबसे स्पष्ट वाक्य होना आपको स्रोत के रूप में जगह दिलाता है। अधिकतर GEO जाँच-सूचियाँ सिर्फ़ पहली बात पर ध्यान देती हैं, और फिर सोचती हैं कि ट्रैफ़िक क्यों नहीं बढ़ा।

व्यवहार में रैंकिंग और स्रोत के रूप में उद्धृत होना अलग-अलग हैं। आप किसी कीवर्ड पर तीसरे स्थान पर होकर भी कभी उद्धृत नहीं हो सकते, क्योंकि आपसे ऊपर के दोनों पेज एक स्वतंत्र, पूर्ण वाक्य में जवाब देते हैं, जबकि आपने अपना जवाब "हमारा दर्शन" नाम के सेक्शन के चौथे पैराग्राफ़ में दबा रखा है।

तीन बॉट, तीन अलग काम

सबसे महँगी गलतियाँ यहीं होती हैं, क्योंकि लोग "OpenAI के क्रॉलर" को एक ही चीज़ मानकर सोचते हैं। OpenAI के दस्तावेज़ों में तीन अलग एजेंट बताए गए हैं, और वे नहीं करते एक ही काम:

  • GPTBot — मॉडल प्रशिक्षण के लिए बड़े पैमाने पर क्रॉल करता है। इसे ब्लॉक करने से यह बदलता है कि भविष्य के मॉडल आपकी साइट से क्या सीखते हैं। इससे आप ChatGPT के लाइव स्रोत उद्धरणों से नहीं हटते।
  • OAI-SearchBot — वह सर्च इंडेक्स बनाता है जिससे जानकारी खोजकर लाई जाती है। यही तय करता है कि आपको स्रोत के रूप में उद्धृत किया भी जा सकता है या नहीं।
  • ChatGPT-User — जब उपयोगकर्ता के सवाल के कारण लाइव ब्राउज़िंग होती है, तो यह एक विशिष्ट URL खोलता है। इसे ब्लॉक करने पर ठीक उसी समय पेज लाना विफल हो जाता है जब कोई आपके बारे में पूछता है।

आम गलती: कोई टीम तय करती है कि वह अपने कंटेंट से मॉडल को प्रशिक्षित नहीं होने देना चाहती, GPTBot को ब्लॉक करती है और मान लेती है कि उसने सोच-समझकर निर्णय लिया है। उसने लिया है — प्रशिक्षण के बारे में। जानकारी खोजकर लाने के बारे में उसने कुछ तय नहीं किया। इससे भी बुरा रूप: कोई एक वाइल्डकार्ड नियम से OpenAI के हर एजेंट को ब्लॉक कर देता है और चुपचाप कंपनी को AI जवाबों से गायब कर देता है, फिर पूरी तिमाही सोचता रहता है कि प्रतिस्पर्धियों को स्रोत के रूप में क्यों उद्धृत किया जा रहा है।

ये अलग-अलग विकल्प हैं, इसलिए इनके निर्णय भी अलग लें। हमारा अपना robots.txt तीनों को अनुमति देता है और ब्लॉक करता है /api/ और शेयर लिंक को, क्योंकि शेयर लिंक उपयोगकर्ताओं का कंटेंट हैं जिन्हें इंडेक्स में नहीं होना चाहिए। आपका निर्णय अलग हो सकता है — प्रशिक्षण और जानकारी खोजकर लाने की अनुमति सचमुच अलग समझौते हैं। बस निर्णय हर बॉट के अनुसार लें, विक्रेता के अनुसार नहीं, और समय-समय पर विक्रेता के दस्तावेज़ फिर पढ़ें, क्योंकि ये नीतियाँ बदलती रहती हैं।

robots.txt वह दरवाज़ा नहीं है जो वास्तव में आपको रोकता है

Robots एक अनुरोध है, और हर कोई इसी स्तर की जाँच करता है। असली बाधा आपका CDN या WAF होता है। कई डिफ़ॉल्ट कॉन्फ़िगरेशन में एज प्लेटफ़ॉर्म अपरिचित यूज़र एजेंट को चुनौती देते हैं या ब्लॉक करते हैं, और इसका नतीजा चुपचाप सामने आता है: robots.txt कहता है Allow, एज 403 लौटाता है, और आपको क्रॉल नहीं किया जा सकता, जबकि आपके रेपो की हर फ़ाइल कहती है कि पहुँच खुली है।

इस जाँच में दस सेकंड लगते हैं और लगभग कोई इसे नहीं करता:

curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User"  https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/

200 का मतलब है कि पहुँच संभव है। कोई 403, कोई 503, या सत्यापन चुनौती वाला पेज बताता है कि आपकी दृश्यता में ऐसी समस्या है जिसे कंटेंट पर कितना भी काम करके ठीक नहीं किया जा सकता। इसे प्रोडक्शन पर, अपने नेटवर्क के बाहर से, अपने हर डोमेन के लिए चलाएँ — हर डोमेन का आमतौर पर अपना एज कॉन्फ़िगरेशन होता है, और समय के साथ उनमें अंतर आ जाता है।

अगर आप इस लेख से सिर्फ़ एक काम करें, तो यही करें। लगाए गए हर सेकंड के बदले सबसे अधिक फायदा देने वाली जाँच यही है, और यह हर कंटेंट ऑडिट से छिपी रहती है।

अगर किसी तथ्य को JavaScript चाहिए, तो उसका अस्तित्व ही नहीं है

जानकारी खोजकर लाने वाले क्रॉलर आमतौर पर JavaScript चलाए बिना मूल HTML पढ़ते हैं। इसलिए किसी दावे को उद्धृत किया जा सकता है या नहीं, इसकी कसौटी वह नहीं है जो आपका ब्राउज़र दिखाता है — बल्कि यह है:

curl -s https://your-site/page/ | grep -i "the claim you want quoted"

आउटपुट में कुछ नहीं है, तो उद्धृत करने के लिए भी कुछ नहीं है। इसका डिज़ाइन पर सीधा असर पड़ता है: उद्धरण के लिए ज़रूरी पाठ — आपकी परिभाषा, मुख्य तथ्य, FAQ के जवाब, कीमत और सुरक्षा संबंधी दावे — सर्वर से भेजे गए HTML में होने चाहिए। हाइड्रेशन के बाद पाठ बदलने वाला रनटाइम शब्दकोश अतिरिक्त सुविधा के रूप में ठीक है; लेकिन तथ्य सिर्फ़ वहीं मौजूद नहीं हो सकता।

इसका सबसे अधिक असर बहुभाषी साइटों पर पड़ता है, और हमने अपना डिज़ाइन खास तौर पर इस जाल से बचने के लिए बनाया। अगर आपका चीनी पाठ सिर्फ़ JavaScript के i18n शब्दकोश में है, तो मूल HTML पढ़ने वाले क्रॉलर के लिए आपका चीनी कंटेंट मौजूद ही नहीं है। हमारा समाधान हर भाषा को वास्तविक मार्कअप के रूप में इनलाइन रखना और CSS को तय करने देना है कि इंसान कौन-सी भाषा देखे। क्रॉलर को चारों भाषाएँ मिलती हैं; पाठक को एक। इससे पेज का आकार बढ़ता है, लेकिन यह उचित कीमत है।

ऐसे अंश लिखें जो संदर्भ से अलग किए जाने पर भी अर्थपूर्ण रहें

यह हिस्सा तकनीकी व्यवस्था के बजाय सचमुच लेखन का है, और व्यवस्था ठीक चलने के बाद यहीं सबसे अधिक असर पैदा किया जा सकता है।

खोजकर लाया गया अंश मॉडल तक आपके बाकी पेज के बिना पहुँचता है। न शीर्षकों का क्रम, न पिछला पैराग्राफ़, न नेविगेशन। इसी बात को ध्यान में रखकर लिखें:

  • पहले जवाब दें। किसी शीर्षक के नीचे पहला वाक्य जवाब होना चाहिए, भूमिका नहीं। "X, Y है" का असर "आज के तेज़ी से बदलते परिवेश में…" से बेहतर है — क्योंकि दूसरा कुछ भी जवाब नहीं देता और कभी उद्धृत नहीं होता।
  • विषय स्पष्ट रखें। "यह OAuth का समर्थन करता है" को संदर्भ से निकाल देने पर वह बेकार हो जाता है; "Orkas OAuth का समर्थन करता है" उपयोगी बना रहता है। पाठ को टुकड़ों में बाँटने पर सर्वनाम अपना अर्थ खो देते हैं।
  • हर दावे को अपने आप में पूर्ण बनाएँ। इकाई, शर्त और सीमा एक ही वाक्य में रखें: "अपने प्रदाता का उपयोग करने पर, मॉडल ट्रैफ़िक सीधे उस प्रदाता के पास जाता है और Orkas के ज़रिए प्रॉक्सी नहीं होता।" इस वाक्य को अकेले उद्धृत करने पर भी यह झूठ नहीं बनता, और ठीक इसी वजह से यह उद्धृत करने योग्य है।
  • प्रभावशाली लगने के बजाय जाँचने योग्य बातों को प्राथमिकता दें। अस्पष्ट श्रेष्ठता-दावे कभी उद्धृत नहीं होते, क्योंकि वे किसी के पूछे गए सवाल का जवाब नहीं देते।

सवाल ही जानकारी खोजने की कुंजी है

उपयोगकर्ता सवाल पूछते हैं, और जानकारी खोजने की प्रक्रिया सवाल के रूप वाले पाठ से मिलान करती है। ऐसा शीर्षक जो सीधे सवाल हो — "क्या Orkas मॉडल ट्रैफ़िक को प्रॉक्सी करता है?" — "मॉडल आर्किटेक्चर" जैसे संज्ञा-आधारित शीर्षक से बेहतर मेल खाता है। यही वजह है, स्कीमा का कोई जादू नहीं, कि AI दृश्यता के लिए FAQ खंड अपने आकार से कहीं अधिक असर डालते हैं: वे सचमुच सवाल-जवाब के जोड़े होते हैं, ठीक उसी रूप में जिसे खोजकर लाया जा रहा होता है।

संरचित डेटा आपको मशीन के लिए समझने योग्य बनाता है, पसंदीदा नहीं

JSON-LD स्रोत उद्धरण नहीं दिलाता। वह स्पष्ट वर्गीकरण देता है: यह पेज क्या है, इसे किसने प्रकाशित किया, कौन-सा पाठ सवाल है और कौन-सा उसका जवाब। बाकी सभी से अधिक दो नियम मायने रखते हैं:

  • FAQ स्कीमा को दिखने वाले पाठ से हूबहू मेल खाना चाहिए। ऐसा स्कीमा जो पेज पर न कही गई बात का दावा करे, भरोसे की समस्या है, और सर्च इंजन इस अंतर को फ़ॉर्मैट की चूक के बजाय स्पैम का संकेत मानते हैं।
  • रेटिंग, पुरस्कार या संख्याएँ कभी न गढ़ें। एक भी मनगढ़ंत समेकित रेटिंग पकड़ लेने वाले इंजन को आपके बाकी सभी दावों पर कम भरोसा करने की वजह मिल जाती है।

1:1 नियम ऐसी चीज़ है जो चुपचाप बिगड़ती जाती है — कोई दिखने वाले FAQ में बदलाव करता है, स्कीमा भूल जाता है, और छह महीने बाद दोनों अलग बातें कहते हैं। हम इसे एक टेस्ट से लागू करते हैं जो हमारे साइटमैप के हर पेज पर जाता है, JSON-LD से FAQ निकालता है और सुनिश्चित करता है कि हर सवाल और जवाब का पाठ उस पेज के दिखाई देने वाले पाठ में हूबहू मौजूद हो। अंतर आते ही बिल्ड विफल हो जाता है। संरचित डेटा आपके अपने पेज के बारे में एक दावा है; उसकी जाँच भी दावे की तरह होनी चाहिए।

llms.txt: कम लागत वाला, उपयोगी, और बढ़ा-चढ़ाकर बेचा गया

यह फ़ाइल क्या है, इस बारे में ईमानदार रहें। llms.txt एक प्रस्तावित परंपरा है। कोई प्रमुख इंजन इसे पढ़ने का वादा नहीं करता, और जो भी आपको इसे जानकारी ग्रहण करने का माध्यम बताता है, वह अनुमान लगा रहा है।

इसका वास्तविक उपयोग सीमित है, फिर भी इस पर एक घंटा देना उचित है: एक स्थिर जगह जहाँ आपके आधिकारिक तथ्य साफ़ शब्दों में दिए हों — उत्पाद क्या है, मॉडल और डेटा कैसे सँभाले जाते हैं, कीमतें और ज़रूरी URL। जब कोई क्रॉलर या मानव शोधकर्ता वहाँ पहुँचता है, तो उसे मार्केटिंग पेजों से बातें जोड़कर समझने के बजाय बिना लाग-लपेट का विवरण मिलता है। यह स्पष्टता लाने के लिए मजबूर करने का भी उपयोगी तरीका है। अगर आप अपने उत्पाद के तथ्य बिना विशेषणों के चालीस पंक्तियों में नहीं बता सकते, तो आपके पेज भी नहीं बता सकते, और कंटेंट की यह समस्या आपको वैसे भी होने वाली थी।

यह क्या नहीं है: कोई गारंटी, या उन तथ्यों को पेजों पर रखने का विकल्प।

विरोधाभास आपको बाहर करवा देते हैं

जवाब देने वाले इंजन तथ्यों का आपस में मिलान करते हैं। अगर आपका मूल्य निर्धारण पेज एक बात कहता है, दस्तावेज़ दूसरी और होमपेज का FAQ तीसरी, तो इंजन फैसला नहीं करता — वह बचकर जवाब देता है, या किसी सुसंगत स्रोत को उद्धृत करता है।

इसलिए अलग-अलग जगहों पर तथ्यों को सुसंगत रखना ही असली काम का बड़ा हिस्सा है, और इसमें कोई चमक-दमक नहीं है। जब मॉडल, कीमत या सुरक्षा से जुड़ा कोई तथ्य बदले, तो उसी बदलाव में उसे हर जगह बदलना चाहिए — पेज, दस्तावेज़, होमपेज FAQ, llms.txt — वरना आपने ऐसा विरोधाभास बना दिया है जो संपादन के बाद भी बना रहेगा। हम इसे आदत के बजाय पक्का नियम मानते हैं, क्योंकि समय-सीमाओं के आगे आदतें हार जाती हैं।

बाहरी पुष्टि अपने दावे से अधिक असरदार होती है

यह वह बात है जिसे स्वीकार करना सबसे मुश्किल है: आपके बारे में उपलब्ध स्रोतों में आपकी अपनी साइट सबसे कमज़ोर है। इंजन पुष्टि को महत्व देते हैं, और ऐसा करना सही है। सिर्फ़ आपके अपने डोमेन पर दिखने वाला दावा मार्केटिंग का दावा है। वही दावा GitHub पर, किसी तीसरे पक्ष की तुलना में, फ़ोरम की चर्चा में या किसी और के लिखे दस्तावेज़ों में हो, तो वह तथ्य है।

इसीलिए, साइट की बुनियादी चीज़ें ठीक हो जाने के बाद, एक और लैंडिंग पेज बनाने से बेहतर नतीजे साइट के बाहर का काम देता है — रेपो, डायरेक्टरी, सूची वाले लेख और वास्तविक चर्चाएँ। सीधे शब्दों में: साइट पर किया गया काम आपको बनाता है उद्धृत करने योग्य; साइट के बाहर का काम आपको बनाता है उद्धृत किया जाने वाला स्रोत। टीमें अक्सर पहले हिस्से में ज़रूरत से अधिक निवेश करती हैं, क्योंकि वही हिस्सा उनके नियंत्रण में होता है।

खुद को धोखा दिए बिना कैसे मापें

यहीं GEO से जुड़े लेख आमतौर पर अस्पष्ट हो जाते हैं, इसलिए साफ़ बात: आप ChatGPT के स्रोत उद्धरणों को सटीक ढंग से नहीं माप सकते। कोई डैशबोर्ड नहीं है। आपके पास तीन अधूरे संकेत हैं:

  • सर्वर लॉग। इसके लिए grep चलाएँ OAI-SearchBot और ChatGPT-User। क्रॉल की आवृत्ति और लाए जाने वाले URL बताते हैं कि आप इंडेक्स में हैं या नहीं और क्या लाइव लाया जा रहा है। आपके पास मौजूद यह सबसे विश्वसनीय संकेत है।
  • असिस्टेंट से आने वाला रेफ़रल ट्रैफ़िक। वास्तविक, लेकिन अधूरा — बहुत से स्रोत उद्धरण पढ़े जाते हैं, पर क्लिक नहीं किए जाते, और जवाब देने वाले इंजन का उद्देश्य ही यही है।
  • हाथ से की गई नमूना जाँचें। वे दस सवाल पूछें जिनके जवाब में आप अपनी जगह बनाना चाहते हैं; दर्ज करें कि किसे स्रोत के रूप में उद्धृत किया गया। यह उबाऊ है, सिर्फ़ रुझान बताता है, और फिर भी जवाबों में वास्तव में क्या दिखता है, उसे देखने का यही एक तरीका है।

तीनों को रुझान बताने वाले संकेत मानें। जो भी आपको सटीक "GEO स्कोर" बेच रहा है, वह अपना गढ़ा हुआ नंबर बेच रहा है।

हम वास्तव में सबसे पहले क्या करेंगे

फायदे के क्रम में, प्रस्तुति में अच्छा दिखने के क्रम में नहीं:

  • 1. curl -A से जानकारी खोजकर लाने वाले बॉट को प्रोडक्शन पर जाँचें। अगर एज उन्हें ब्लॉक कर रहा है, तो इस सूची की बाकी कोई चीज़ मायने नहीं रखती।
  • 2. curl | grep से अपने मुख्य दावे जाँचें। सिर्फ़ JavaScript में मौजूद किसी भी चीज़ को सर्वर से भेजे जाने वाले HTML में ले जाएँ।
  • 3. हर शीर्षक के नीचे पहला वाक्य फिर लिखें ताकि वह स्पष्ट विषय के साथ जवाब दे।
  • 4. FAQ के पाठ और FAQ स्कीमा को एक जैसा करें, और ऐसा हर स्कीमा हटा दें जिसका समर्थन दिखाई देने वाला पाठ नहीं करता।
  • 5. पेजों, दस्तावेज़ों और इन जगहों पर मौजूद परस्पर विरोधी तथ्यों को एकरूप करें: llms.txt.
  • 6. फिर — और सिर्फ़ इसके बाद — साइट के बाहर पुष्टि हासिल करें।

स्रोत उद्धरण न मिलने की वजह आमतौर पर चरण 1 और 2 में छिपी होती है। यही वे दो चरण भी हैं जिनके बारे में कोई लेख नहीं लिखता, क्योंकि वे कंटेंट मार्केटिंग नहीं हैं।

समापन

ChatGPT से स्रोत के रूप में उद्धृत होना उतना रहस्यमय नहीं है जितना इसके आसपास इस्तेमाल होने वाला संक्षिप्त नाम जताता है। जानकारी खोजने वाले बॉट के लिए पहुँच योग्य बनें। JavaScript के बिना पढ़े जा सकें। एक स्वतंत्र, पूर्ण वाक्य में उद्धृत करने योग्य बनें। अपनी सभी जगहों पर सुसंगत रहें। अपनी मार्केटिंग साइट के बाहर कहीं पुष्टि पाएँ। टूल बदलते रहते हैं; ये पाँच बातें कायम रहती हैं।

हम ये जाँचें अपनी साइट पर चलाते हैं, और इन्हें Orkas के एक वर्कफ़्लो में शामिल किया है जो किसी साइट का ऑडिट करता है: खोज और AI जवाबों में दृश्यता और प्राथमिकता के अनुसार सुधारों की सूची लौटाता है। अगर आप इसके नीचे का स्तर समझना चाहते हैं — मुख्य एजेंट काम की योजना कैसे बनाता है और उसे करने के लिए विशेषज्ञों को कैसे भेजता है — तो पढ़ें व्यवहार में बहु-एजेंट समन्वय.