Orkas Orkas
الرئيسية المدونة الأبحاث
الأبحاث

كيف تجعل ChatGPT يستشهد بك: ما الذي يحدد فعلًا ما إذا كان سيقتبس منك

الاستشهاد بك ليس ترتيبًا في نتائج البحث. بل هو اجتياز مرحلة الاسترجاع، ثم تقديم المقطع الجدير بالاقتباس. إليك الآلية، والفحوص التي تُحدث فرقًا فعلًا، وتلك التي لا تفعل.

عادةً ما يُجاب عن سؤال «كيف أجعل ChatGPT يستشهد بي؟» بمقال على هيئة قائمة: اكتب محتوى جيدًا، وأضف بيانات منظّمة، وأنشئ ملف llms.txt. ليست هذه النصائح خاطئة بقدر ما هي موجّهة إلى الطبقة الخطأ. فهي تصف ما ينبغي أن تبدو عليه الصفحة، وتتجاوز السؤالين اللذين يحسمان النتيجة فعلًا: هل يستطيع نظام الاسترجاع الوصول إلى صفحتك أصلًا، و هل تتضمن مقطعًا يحتفظ بمعناه حين يُنتزع من سياقه?

يشرح هذا المقال الآلية بالترتيب الذي تعمل به فعلًا. نجري هذه الفحوص على موقعنا، وكان اثنان منها سببًا في اكتشاف مشكلات لم يكن أي قدر من العمل على المحتوى ليصلحها.

الخلاصة الموجزة ذِكرك لا يعني الاستشهاد بك يفحص SeoGeoAgent الإجابات التي تستشهد فعلًا بنطاقك، ويميّز ذلك عن استدعاء اسم علامة تجارية من الذاكرة. انظر الظهور في البحث وإجابات الذكاء الاصطناعي.
نزّل Orkas — مجانًا

الاستشهاد مسألة استرجاع، لا مسألة ترتيب

عندما يجيب ChatGPT بروابط، فإنه لا يقرأ الويب مباشرةً لكل سؤال. تسحب خطوة استرجاع مقاطع مرشحة من فهرس؛ ثم يصوغ النموذج إجابة مما استُرجع، وينسب الأجزاء التي اعتمد عليها إلى مصادرها. وتترتب على ذلك نتيجتان، وكلتاهما غير بديهية لمن اعتاد تحسين محركات البحث التقليدي:

  • الوحدة هي المقطع، لا الصفحة. قد تحتل الصفحة ترتيبًا جيدًا ولا تسهم بشيء، لأن المعلومة الجديرة بالاقتباس موجودة في صورة، أو رسم بياني بلا مقابل نصي، أو فقرة لا تظهر إلا بعد تشغيل JavaScript.
  • قابلية الاسترجاع وقابلية الاقتباس معياران مختلفان. وجودك في الفهرس شرط مسبق. أما ما يجلب نسبة الإجابة إليك فهو تقديم أوضح جملة متاحة تجيب عن السؤال. تتناول معظم قوائم فحص GEO المعيار الأول فقط، ثم تتساءل لماذا لم تتغير الزيارات.

ينفصل الترتيب عن الاستشهاد عمليًا. قد تحتل المرتبة الثالثة لكلمة مفتاحية ولا يُستشهد بك أبدًا، لأن الصفحتين اللتين تسبقانك تصوغان الإجابة في جملة واحدة مكتفية بذاتها، بينما تدفن إجابتك في الفقرة الرابعة من قسم بعنوان «فلسفتنا».

ثلاثة روبوتات، وثلاث وظائف مختلفة

هنا تقع الأخطاء الأعلى تكلفة، لأن الناس يفكرون في «زاحف OpenAI» وكأنه شيء واحد. توثّق OpenAI ثلاثة وكلاء منفصلين، وهم لا يؤدون الوظيفة نفسها:

  • GPTBot — زحف جماعي لتدريب النماذج. يؤثر حظره في ما تستوعبه النماذج المستقبلية من موقعك. لكنه لا يزيلك من استشهادات ChatGPT المباشرة.
  • OAI-SearchBot — يبني فهرس البحث الذي يقرأ منه نظام الاسترجاع. هذا هو الذي يحدد ما إذا كان يمكن الاستشهاد بك أصلًا.
  • ChatGPT-User — يجلب عنوان URL محددًا عندما يستدعي سؤال المستخدم تصفحًا مباشرًا. احظره وسيفشل الجلب في اللحظة نفسها التي يسأل فيها شخص عنك.

الخطأ الشائع: يقرر فريق أنه لا يريد استخدام محتواه لتدريب النماذج، فيحظر GPTBot ويظن أنه اتخذ قرارًا مدروسًا. وقد فعل، بشأن التدريب. لكنه لم يقرر شيئًا بشأن الاسترجاع. والأسوأ: يحظر أحدهم جميع وكلاء OpenAI بقاعدة واحدة تستخدم رمزًا بديلًا، فيحذف الشركة بصمت من إجابات الذكاء الاصطناعي، ثم يقضي ربع سنة يتساءل لماذا يُستشهد بالمنافسين.

هذه خيارات قابلة للفصل، فاتخذها كلًا على حدة. ملف robots.txt لدينا يسمح للثلاثة جميعًا ويحظر /api/ وروابط المشاركة، لأن روابط المشاركة محتوى مستخدمين لا مكان له في الفهرس. وقد يختلف اختيارك؛ فالتدريب والاسترجاع مقايضتان مختلفتان فعلًا. فقط اتخذ القرار لكل روبوت، لا لكل مزوّد، وأعد قراءة وثائق المزوّد من حين إلى آخر، لأن هذه السياسات تتغير.

ملف robots.txt ليس البوابة التي تمنعك فعلًا

توجيهات Robots طلب، وهي الطبقة التي يفحصها الجميع. أما الطبقة التي تعرقل الوصول فعلًا فهي CDN أو WAF لديك. ففي كثير من الإعدادات الافتراضية، تفرض منصات الحافة اختبارات تحقق على وكلاء المستخدم غير المألوفين أو تحظرهم، وتحدث النتيجة بصمت: robots.txt يقول Allow، لكن الحافة تُرجع 403، فيتعذر الزحف إليك بينما يؤكد كل ملف في مستودعك أنك متاح.

يستغرق الفحص عشر ثوانٍ، ولا يجريه أحد تقريبًا:

curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User"  https://your-site/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://your-site/

200 يعني إمكان الوصول. أما 403، أو 503، أو صفحة اختبار تحقق، فتعني أن لديك مشكلة ظهور لن يصلحها أي قدر من العمل على المحتوى. شغّل الفحص على بيئة الإنتاج، من خارج شبكتك، لكل نطاق تديره؛ فعادةً ما يكون لكل نطاق إعداد حافة خاص به، وتتباعد هذه الإعدادات مع الوقت.

إذا طبّقت شيئًا واحدًا فقط من هذا المقال، فليكن هذا. إنه الفحص الأعلى عائدًا لكل ثانية تقضيها، ولا يظهر في أي تدقيق للمحتوى.

إذا احتاجت المعلومة إلى JavaScript، فهي غير موجودة

عادةً ما تحلّل زواحف الاسترجاع HTML الخام من دون تنفيذ JavaScript. لذا فإن اختبار قابلية الاستشهاد بعبارة ليس ما يعرضه متصفحك، بل هذا:

curl -s https://your-site/page/ | grep -i "the claim you want quoted"

عدم ظهور شيء في المخرجات يعني عدم وجود شيء يُستشهد به. ولهذا تبعات فعلية على التصميم: يجب أن تكون النصوص الحاسمة للاستشهاد، مثل تعريفك والحقائق الأساسية وإجابات الأسئلة الشائعة والأسعار وادعاءات الأمان، موجودة في HTML المُقدَّم. لا بأس بقاموس يُبدّل النص وقت التشغيل بعد تهيئة الصفحة تفاعليًا بوصفه تحسينًا؛ لكنه لا يمكن أن يكون الموضع الوحيد الذي توجد فيه المعلومة.

تشتد هذه المشكلة في المواقع متعددة اللغات، وهي الفخ الذي صمّمنا حلّنا لتفاديه صراحةً. فإذا كان نصك الصيني موجودًا فقط في قاموس i18n بلغة JavaScript، فإن محتواك الصيني غير موجود أصلًا بالنسبة إلى زاحف يقرأ HTML الخام. حلّنا هو تضمين كل لغة مباشرةً بوصفها ترميزًا فعليًا، وترك CSS يحدد ما يراه القارئ. تحصل الزواحف على اللغات الأربع، ويحصل القارئ على واحدة. يزيد ذلك حجم الصفحة، لكنه يستحق.

اكتب مقاطع تحتفظ بمعناها حين تُنتزع من سياقها

هذا هو الجزء الذي يتعلق فعلًا بالكتابة بدلًا من البنية التقنية، وهو موضع التأثير الأكبر بعد أن تعمل تلك البنية.

يصل المقطع المسترجع إلى النموذج من دون بقية صفحتك حوله. لا تسلسل للعناوين، ولا فقرة سابقة، ولا عناصر تنقل. اكتب على هذا الأساس:

  • الإجابة أولًا. ينبغي أن تكون الجملة الأولى تحت العنوان هي الإجابة، لا تمهيدًا لها. «X هو Y» أفضل من «في المشهد سريع التطور اليوم…»، وهي عبارة لا تجيب عن شيء ولا تُقتبس أبدًا.
  • اذكر المقصود صراحةً. «إنه يدعم OAuth» عبارة غير قابلة للاستخدام بعد اقتطاعها؛ أما «Orkas يدعم OAuth» فتحافظ على معناها. تفقد الضمائر مرجعها عند التجزئة.
  • اجعل كل ادعاء مكتفيًا بذاته. الكيان والقيد والحدود في جملة واحدة: «عند استخدام مزوّدك الخاص، تذهب حركة بيانات النموذج مباشرةً إلى ذلك المزوّد، ولا تمر عبر Orkas بوصفه وسيطًا». يمكن اقتباس هذه الجملة وحدها من دون أن تصبح غير صحيحة، وهذا بالضبط ما يجعلها قابلة للاقتباس.
  • فضّل القابل للتحقق على المبهر. لا يُستشهد بصيغ التفضيل المبهمة أبدًا، لأنها لا تجيب عن أي سؤال طرحه أحد.

السؤال هو مفتاح الاسترجاع

يطرح المستخدمون أسئلة، ويطابق الاسترجاع نصوصًا مصاغة على هيئة أسئلة. العنوان الذي يطابق السؤال حرفيًا، مثل «هل يعمل Orkas وسيطًا لحركة بيانات النموذج؟»، يطابق أفضل من عبارة اسمية مثل «معمارية النموذج». لهذا السبب، لا لسحر البيانات المنظّمة، تحقق أقسام الأسئلة الشائعة أثرًا يفوق حجمها بكثير في الظهور ضمن إجابات الذكاء الاصطناعي: فهي حرفيًا أزواج من أسئلة وإجابات، وهذا هو شكل المحتوى الذي يُسترجع.

البيانات المنظّمة تجعلك قابلًا للتحليل، لا مفضّلًا

لا تشتري لك JSON-LD استشهادات. بل توفر تصنيفًا لا لبس فيه: ما هذه الصفحة، ومن نشرها، وأي نص سؤال وأي نص إجابته. وهناك قاعدتان أهم من سواهما:

  • يجب أن يتطابق مخطط الأسئلة الشائعة مع النص المرئي واحدًا بواحد. المخطط الذي يدّعي شيئًا لا تقوله الصفحة يخلق مشكلة ثقة، وتتعامل محركات البحث مع هذا الاختلاف بوصفه إشارة إلى محتوى مزعج، لا هفوة تنسيق.
  • لا تختلق تقييمات أو جوائز أو أعدادًا أبدًا. المحرك الذي يكتشف تقييمًا تجميعيًا مختلقًا واحدًا يصبح لديه سبب للتقليل من موثوقية كل ما تؤكده.

قاعدة 1:1 من الأمور التي تتدهور بصمت: يعدّل أحدهم الأسئلة الشائعة المرئية وينسى المخطط، وبعد ستة أشهر يختلفان. نفرضها باختبار يمر على كل صفحة في خريطة موقعنا، ويستخرج الأسئلة الشائعة من JSON-LD، ويتحقق من ظهور نص كل سؤال وإجابة حرفيًا في النص المرئي للصفحة. وإذا حدث اختلاف، تفشل عملية البناء. البيانات المنظّمة ادعاء عن صفحتك نفسها؛ وينبغي التحقق منها على هذا الأساس.

llms.txt: قليل التكلفة، ومفيد، ومبالَغ في الترويج له

كن صادقًا بشأن ماهية هذا الملف. llms.txt عرف مقترح. لا يعد أي محرك رئيسي بقراءته، ومن يخبرك بأنه قناة لاستيعاب المحتوى إنما يخمّن.

فائدته الفعلية أضيق، لكنها لا تزال تستحق ساعة: موضع ثابت واحد تُذكر فيه حقائقك المرجعية بوضوح؛ ما المنتج، وكيفية التعامل مع النماذج والبيانات، والأسعار، وعناوين URL المهمة. عندما يصل إليه زاحف أو باحث بشري، يحصل على الرواية الخالية من الزخرفة التسويقية بدلًا من إعادة تركيبها من صفحات التسويق. وهو أيضًا وسيلة مفيدة لفرض الوضوح. إن لم تستطع عرض حقائق منتجك في أربعين سطرًا بلا صفات، فلن تستطيع صفحاتك ذلك أيضًا، وهذه مشكلة محتوى كنت ستواجهها على أي حال.

أما ما ليس عليه: ضمان، أو بديل عن وجود تلك الحقائق في الصفحات نفسها.

التناقضات تؤدي إلى استبعادك

تجري محركات الإجابة تحققًا متقاطعًا. فإذا قالت صفحة الأسعار شيئًا، والوثائق شيئًا آخر، والأسئلة الشائعة في الصفحة الرئيسية شيئًا ثالثًا، فلن يفصل المحرك بينها؛ بل سيتحفظ، أو يستشهد بمن كان متسقًا.

لذا يشكّل اتساق الحقائق عبر المواضع معظم العمل الفعلي، وليس فيه ما يبهر. عندما تتغير حقيقة تتعلق بنموذج أو سعر أو أمان، يجب أن تتغير في كل مكان ضمن التعديل نفسه: الصفحة والوثائق والأسئلة الشائعة في الصفحة الرئيسية، llms.txt — وإلا صنعت تناقضًا سيبقى بعد انتهاء التعديل. نتعامل مع ذلك بوصفه قاعدة صارمة لا عادة، لأن العادات تنهزم أمام المواعيد النهائية.

التأييد من مصادر أخرى أقوى من الادعاء الذاتي

إليك الجزء الأصعب تقبّلًا: موقعك هو أضعف مصدر متاح للمعلومات عنك. تعطي المحركات وزنًا للتأييد من مصادر أخرى، وهي محقة في ذلك. الادعاء الذي لا يظهر إلا على نطاقك هو ادعاء تسويقي. والادعاء نفسه على GitHub، أو في مقارنة أعدّها طرف ثالث، أو نقاش في منتدى، أو وثائق كتبها شخص آخر، يصبح حقيقة.

لهذا السبب، بعد إرساء أساسيات الموقع فعلًا، يتفوق العمل خارج الموقع على إنشاء صفحة هبوط أخرى: مستودعات وأدلة ومقالات قوائم ونقاشات حقيقية. وبعبارة مباشرة: العمل داخل الموقع يجعلك قابلًا للاستشهاد بك؛ والعمل خارج الموقع يجعلك مصدرًا يُستشهد به. تميل الفرق باستمرار إلى الإفراط في الاستثمار في الأول لأنه النصف الذي تتحكم فيه.

كيف تقيس من دون أن تخدع نفسك

هنا تصبح الكتابات عن GEO عادةً غير دقيقة، لذا نقولها بوضوح: لا يمكنك قياس استشهادات ChatGPT بدقة كاملة. لا توجد لوحة مؤشرات. ما لديك هو ثلاث إشارات غير مثالية:

  • سجلات الخادم. ابحث باستخدام grep عن OAI-SearchBot و ChatGPT-User. يخبرك تكرار الزحف وعناوين URL التي تُجلب بما إذا كنت ضمن الفهرس وما يُسحب مباشرةً. هذه أصدق إشارة تملكها.
  • زيارات الإحالة من المساعد. حقيقية، لكنها جزئية؛ فكثير من الاستشهادات تُقرأ من دون النقر عليها، وهذا هو المغزى الأساسي من محرك الإجابة.
  • فحوص يدوية بالعينة. اطرح الأسئلة العشرة التي تريد أن تكون مرجعًا لها، وسجّل بمن يُستشهد. عمل ممل ويعطي مؤشرًا عامًا، لكنه يظل السبيل الوحيد لمراقبة واجهة الإجابة نفسها.

تعامل مع الثلاثة بوصفها مؤشرات عامة. أي شخص يبيعك «درجة GEO» دقيقة يبيعك رقمًا اخترعه.

ما الذي سنفعله أولًا بالفعل

مرتّبًا حسب العائد، لا حسب مدى جمال عرضه في الشرائح:

  • 1. curl -A لاختبار روبوتات الاسترجاع على بيئة الإنتاج. إذا كانت الحافة تحظرها، فلا أهمية لأي شيء آخر في هذه القائمة.
  • 2. curl | grep للتحقق من ادعاءاتك الأساسية. انقل كل ما لا يوجد إلا في JavaScript إلى HTML المُقدَّم.
  • 3. أعد كتابة الجملة الأولى تحت كل عنوان لتكون الإجابة، مع ذكر المقصود صراحةً.
  • 4. اجعل نص الأسئلة الشائعة ومخططها متطابقين، واحذف أي مخطط لا يمكنك دعمه بنص مرئي.
  • 5. وحّد الحقائق المتناقضة عبر الصفحات والوثائق و llms.txt.
  • 6. ثم، وعندها فقط، اعمل على اكتساب تأييد من مصادر خارج الموقع.

عادةً ما تكمن أسباب غياب الاستشهادات في الخطوتين 1 و2. وهما أيضًا الخطوتان اللتان لا يكتب أحد مقالات عنهما، لأنهما لا تتعلقان بتسويق المحتوى.

ختامًا

الاستشهاد بك في ChatGPT أقل غموضًا مما يوحي به الاختصار المحيط به. اجعل روبوت الاسترجاع قادرًا على الوصول إليك. واجعل محتواك مقروءًا من دون JavaScript. وقابلًا للاقتباس في جملة واحدة مكتفية بذاتها. وحافظ على الاتساق عبر مواضعك المختلفة. واحصل على تأييد من موضع غير موقعك التسويقي. تتبدل الأدوات؛ وتبقى هذه المبادئ الخمسة ثابتة.

نجري هذه الفحوص على موقعنا، وضمّنّاها في سير عمل ضمن Orkas يدقّق في الظهور في البحث وإجابات الذكاء الاصطناعي ويعيد قائمة إصلاحات مرتّبة حسب الأولوية. وإذا أردت فهم الطبقة التي تحت ذلك، أي كيف يخطط الوكيل القائد للعمل ويوزّعه على المختصين لتنفيذه، فاقرأ تنسيق الوكلاء المتعددين عمليًا.