معظم مساعدي الذكاء الاصطناعي يعملون بمنطق «استخدمه ثم انسَ الأمر». تصحح عادة اليوم فيكرر الخطأ نفسه غدًا؛ تعلّمه سير العمل الخاص بفريقك الأسبوع الماضي، فيتصرف هذا الأسبوع وكأنه لم يسمع به قط. تبدأ كل محادثة من الصفر — ومهما بلغ ذكاء النموذج، يظل شخصًا ذكيًا مصابًا بفقدان الذاكرة.
يسعى Orkas إلى شيء آخر: تمكين الوكيل من التعلّم من استخدامه اليومي، واستخلاص الخبرات المتكررة ليطبّقها بنفسه في المرة التالية. ببساطة — تزداد فائدته كلما استخدمته أكثر، وتنمو هذه «الفائدة» باتجاه اخترته أنت، وتفضيلاتك، ومجالك، بدلًا من شيء أعدّه مزوّد النموذج مسبقًا للجميع.
تشرح هذه المقالة كيفية بناء تلك الآلية. الأمر ليس ببساطة «جعل النموذج يتذكر المحادثة» — فخلفه حلقة كاملة: يراقب نفسه → يقرر هل يتأمل → يتأمل فعلًا → يدوّن الاستنتاجات في صيغة قابلة لإعادة الاستخدام → يستخدمها مجددًا في المرة التالية. سنتناولها جزءًا جزءًا.
الأهم أولًا: كل ما يلي — كل «المراقبة» و«التسجيل» و«التأمل» — يحدث بالكامل على جهازك. بيانات التنفيذ والمهارات وفهم الوكيل لذاته — كلها محفوظة محليًا كملفات عادية. لا يُرفع أيٌّ منها إلى خوادم Orkas، ولا يُستخدم أيٌّ منها للتحليل عبر المستخدمين أو لتدريب النماذج. يعني «التطور الذاتي» أن يقرأ برنامج سجلات تنفيذه محليًا ويحسّن نفسه محليًا — لا أن يجمع بياناتك. هذه الخبرة لا تغادر الجهاز أبدًا، ولا تخدم سوى أنت، على هذا الجهاز وحده.
الحلقة من البداية إلى النهاية
استخدام فعلي، مرة بعد مرة
│ تسجيل محلي: الأدوات المستدعاة، وهل وقعت أخطاء، وهل حدث تصحيح
▼
تتراكم الإشارات
│ تُستخرج الإشارات من المحادثة في موضعها، وتبقى كلها على الجهاز
▼
اتخاذ قرار بشأن التأمل
│ تقييم موزون للإشارات، لا يتفعّل إلا بعد عتبة؛ اضطرابات الشبكة لا تُحتسب
▼
التأمل في الخلفية
│ ليس كل جولة — بل دوريًا، مع اختيار الوكلاء المستوفين للشروط
▼
استخلاص شيئين
│ ① «مهارات» قابلة لإعادة الاستخدام ② «فهم» لذاته
▼
إدراجهما تلقائيًا في الجولة التالية
└──────────► العودة إلى البداية، ومواصلة الدورانلكل خطوة في هذه الحلقة تفاصيلها الدقيقة. وأكثر موضعين عرضة للخطأ هما تحديدًا الخطوتان اللتان تبدوان الأبسط للوهلة الأولى: متى يتأمل، وماذا يسجّل حين يفعل. لنبدأ من البداية.
الخطوة 1: مراقبة نفسه بتكلفة تكاد تكون صفرًا
للتعلّم من الخبرة، تحتاج أولًا إلى «خبرة» تنظر فيها. في نهاية كل تشغيل للوكيل، يحصي البرنامج — محليًا وفي الحال — بضعة حقائق خفيفة عن التنفيذ: العدد التقريبي للأدوات المستدعاة في هذه الجولة، وهل وقع خطأ، وهل كان عابرًا (كمشكلة شبكة) أم حقيقيًا، وهل صححه المستخدم فورًا. مجرد بضعة أعداد ومؤشرات، تُحسب كلها على الجهاز، دون استدعاء أي نموذج أو إرسالها إلى أي مكان.
هذا مهم لأن تكلفته من إنفاق النموذج تساوي صفرًا. تُحصى هذه مباشرة من سجل محادثة الجولة الحالية؛ فلا حاجة إلى استدعاء إضافي للنموذج لمجرد «تحليل نفسه». لو تطلبت كل جولة استدعاءً آخر للنموذج للتأمل الذاتي، لأصبحت التكلفة وزمن الانتظار غير محتملين، ولما أُطلقت الآلية أصلًا.
أما مؤشر «حدث تصحيح أم لا» ففيه بعض ما يثير الاهتمام. إنه حكم محلي استدلالي بحت، يُقدَّر بمطابقة بضع صيغ في الرسالة على جهازك — عبارات صينية مثل «غير صحيح» / «ينبغي أن يكون» / «أعِد»، وعبارات إنجليزية مثل wrong, actually, instead. لا يهدف إلى الدقة التامة — إنه مجرد إشارة، لا حكم نهائي، ولا بأس بنتيجة إيجابية خاطئة أحيانًا، لأنه يُوزن لاحقًا مع إشارات أخرى؛ ولا يُتخذ أي قرار بناءً عليه وحده.
الخطوة 2: متى يستحق الأمر التأمل فعلًا
هذا هو الجزء الذي أراه الأكثر إتقانًا في الآلية كلها.
النهج الساذج هو «تأمل بعد تراكم N حالات». لكنه نهج خشن: من الواضح أن ثلاث حالات انتهاء مهلة للشبكة على التوالي وثلاثة تصحيحات من المستخدم على التوالي ليست الشيء نفسه، ولا ينبغي معاملتها بالطريقة نفسها. يستخدم Orkas تقييمًا موزونًا متعدد الإشارات: كل ظاهرة جديرة بالانتباه إشارة تحمل وزنًا؛ تُجمع أوزان الإشارات التي فعّلتها هذه الجولة، ولا يحدث التأمل إلا إذا تجاوز المجموع عتبة (0.7 افتراضيًا).
تبدو الإشارات الرئيسية تقريبًا هكذا:
| الإشارة | الوزن | شرط التفعيل |
|---|---|---|
| تصحيح المستخدم | 0.9 | رُصد تصحيح من المستخدم في هذه الجولة |
| مهارة غير فعّالة | 0.85 | حُمّلت مهارة، لكن الجولة انتهت بخطأ رغم ذلك |
| التعافي من خطأ | 0.8 | حدث خطأ، لكن جرى تداركه في النهاية |
| مواجهة نقطة ضعف معروفة | 0.7 | واجهت المهمة نقطة ضعف مسجّلة في التقييم الذاتي |
| تعقيد المهمة | 0.5 | تجاوز عدد استدعاءات الأدوات عددًا معينًا |
مثلًا: جولة تجمع تصحيحًا من المستخدم (0.9) وبعض التعقيد (0.5) يبلغ مجموعها 1.4، متجاوزًا 0.7 بكثير، فتؤدي إلى التأمل؛ أما جولة فيها بعض التعقيد فقط (0.5) فلا تبلغ العتبة ويُتجاوز عنها. ويعكس الترجيح أيضًا حكمًا تقديريًا — فالتصحيح المباشر من المستخدم يحصل على أعلى وزن، 0.9، لأنه التغذية الراجعة ذات أعلى نسبة إشارة إلى ضجيج: لقد قال المستخدم بوضوح إنك مخطئ، لذا يُرجّح جدًا أن الأمر يستحق التسجيل.
ذلك الاستثناء الحاسم
في منطق التقييم كله، توجد قاعدة واحدة أعدّها الفيصل في ما إذا كانت هذه الآلية «تتعلّم الأشياء الصحيحة»: الأخطاء العابرة لا تُحتسب أبدًا.
انتهاء مهلة الشبكة، وانقطاع الاتصالات، وحدود معدل الطلبات — هذه مشكلات في البيئة، وليست أوجه قصور في قدرة الوكيل نفسه. وإذا لم تستبعدها، يحدث أمر سيئ: تتعطل أداة بسبب اضطراب عارض واحد في الشبكة، فتسجّل آلية التأمل ذلك بصيغة «هذه الأداة غير موثوقة، قلّل استخدامها» — أو حتى تفسد مهارة سليمة تمامًا أو تحذفها. ومنذ ذلك الحين يكون الوكيل قد تعلّم درسًا خاطئًا، ويظل ذلك الخطأ يلاحقه.
لذلك تستبعد إشارات «التعافي من خطأ» و«مهارة غير فعّالة» و«مواجهة نقطة ضعف معروفة» جميعها الأخطاء العابرة البحتة صراحةً. ويكرر توجيه التأمل التذكير أيضًا: أخطاء الشبكة بيئية، فلا تسجّلها كنقاط ضعف، ولا تمس المهارات المرتبطة بها. أكثر ما ينبغي أن يخشاه نظام يتحسن ذاتيًا ليس بطء التعلّم — بل التعلّم في الاتجاه الخاطئ. وهذا الاستثناء يحمي من ذلك تحديدًا.
الخطوة 3: يجري التأمل في الخلفية، لا أمامك
من السهل الوقوع في فخ: بمجرد اكتشاف أن «وقت التأمل قد حان»، يتوقف الوكيل ويتأمل فورًا. وهذا يجعله يبدو متقطع الأداء بين حين وآخر، شاردًا إلى «التفكير في الحياة» — وهي تجربة سيئة.
ينقل Orkas التأمل إلى الخلفية بوتيرة ثابتة. وقواعد الجدولة، تقريبًا:
- بدء دورة تأمل كل فترة (مثلًا، كل نحو اثنتي عشرة ساعة أو أكثر).
- فرض حد أدنى لفترة الانتظار بين تأملين للوكيل نفسه (بضع ساعات)، كي لا يتكرر كثيرًا.
- لكن إذا طال انقطاع التأمل أكثر من اللازم (مثلًا، أكثر من أسبوع)، يُفرض تأمل حتى لا يتأخر إلى ما لا نهاية.
- وضع حد لعدد الوكلاء المختارين في كل دورة، حتى لا تتشتت الموارد دفعة واحدة.
ثمة تصميم صغير يعجبني اسمه بوابة التغيّر: عند بدء دورة، يُفحص أولًا ما إذا كان لدى هذا الوكيل أي جديد منذ تأمله الأخير — إشارات جديدة أو سجلات محادثة محدّثة. إن لم يحدث أي تغيّر، يُتجاوز عنه هذه المرة ولا يُهدر تأمل يكلّف استخدام النموذج. بسيط، لكنه يوفّر كثيرًا عمليًا.
الخطوة 4: كيف يعمل التأمل فعليًا
حين يحين وقت التأمل فعلًا، يكون التدفق كالتالي: يُنظّم النشاط الأخير أولًا في «حزمة»، ثم تُقرن بتوجيه مكتوب بعناية وتُسلّم إلى النموذج لقراءتها وتلخيصها.
للحزمة ميزانية: تأخذ على الأكثر عددًا قليلًا من المحادثات الحديثة، وتضيف بضعة أصناف من أحداث النظام، وتدمجها زمنيًا، وتحصر المجموع دون حد للرموز النصية (مثلًا، عشرة آلاف أو أكثر). لا يُلقى السجل كله فيها — فلن يتسع، وستكون نسبة الإشارة إلى الضجيج ضعيفة.
ما يتطلب عناية حقيقية هو التوجيه. فهو يطلب من النموذج إنتاج تعليمات أمرية قابلة للتنفيذبدلًا من «أوصاف». يبدو الفرق صغيرًا، لكنه بالغ الأهمية. قارن:
✗ «تكون مخرجات الوكيل مطوّلة أكثر من اللازم أحيانًا؛ انتبه لذلك.»
✓ «عند الإجابة عن أسئلة المكاتب العائلية، لا تتجاوز 5 نقاط مطلقًا.»
✗ «يبدو أن المستخدم يفضّل المخرجات الموجزة.»
✓ «عند الإجابة في سياق المكاتب العائلية، ابدأ دائمًا بالخلاصة ثم التعليل.»
يوجّه النص النموذج صراحة نحو تراكيب «لا تفعل أبدًا / افعل دائمًا / عندما يحدث كذا افعل كذا» بشروط تفعيل محددة. والسبب عملي: ملاحظة تقول «احرص على الإيجاز» لا تمنح الوكيل شيئًا قابلًا للتطبيق حين يقرأها لاحقًا، بينما يمكن اتباع «لا تتجاوز 5 نقاط مطلقًا» مباشرة. لكي يكون التحسّن الذاتي مفيدًا، يجب أن يكون ما يُستخلص تعليمة تؤتي أثرها — لا عبارة عامة صحيحة.
بعد التأمل، يستطيع النموذج فعل بضعة أشياء: إنشاء مهارة أو تعديلها، أو تحديث فهمه لذاته، أو — إن لم يوجد فعلًا ما يستحق التسجيل في هذه الفترة — الاكتفاء بقول «لا شيء للحفظ». والسماح له بألا يفعل شيئًا خيار تصميم مهم بحد ذاته: لا تفرض حصيلة تعلّم، كي لا تتراكم كومة من الضجيج عديم الفائدة.
الاستخلاص في شيئين
تصل مخرجات التأمل إلى موضعين.
الأول هو المهارات. كل مهارة مستند Markdown ببيانات وصفية — كتلة تمهيدية تسجّل الاسم والوصف ووقت الإنشاء والتحديث وعدد مرات تعديلها وآخر وقت استُخدمت فيه — تتبعها الخطوات الفعلية أو النقاط الأساسية:
---
name: "Weekly Report Export"
description: "Compile this week's data into the standard weekly-report format"
createdAt: "2025-01-01T00:00:00Z"
updatedAt: "2025-01-08T00:00:00Z"
patchCount: 2
lastUsedAt: "2025-01-09T10:00:00Z"
---
## Steps
1. ...
2. ...حفظ المهارات كملفات خيار عملي: يستطيع الشخص قراءتها وتعديلها مباشرة — فلا تكون حبيسة قاعدة بيانات مبهمة.
والثاني هو فهمه لذاته. يشبه هذا الجزء مذكرة يكتبها الوكيل لنفسه، في قسمين: يسجّل أحدهما «ما أجيده وأين أميل إلى التعثر»، ويسجّل الآخر «الأساليب التي طوّرتها لهذا المستخدم وهذا المجال». لكليهما حد للطول يفرض الإيجاز — فالأفضل ليس الأطول، بل الأدق. في بداية المحادثة التالية، يُدرج هذا المحتوى في توجيه النظام، فيدخل الوكيل حاملًا «فهمًا لذاته».
المهارات ليست للكتابة فقط
إن اكتفيت بإنشاء المهارات، فستتراكم مع الوقت كساحة خردة. لذلك تتمتع المهارات بدورة حياة كاملة.
إلى جانب الإنشاء، العملية الأكثر شيوعًا هي في الواقع التعديل الجزئي: تغيير جزء صغير من مهارة موجودة بدلًا من هدمها وإعادة كتابتها. يزيد كل تعديل عدّادًا ويجدّد وقت التحديث. وهذا يتيح للمهارة أن تنمو تدريجيًا مع الخبرة، بدلًا من إعادة كتابتها بالكامل في كل جولة.
وهناك سقف للعدد أيضًا. العدد الإجمالي للمهارات محدود (مثلًا، 200)؛ وعند امتلائه، تؤدي إضافة مهارة جديدة إلى إخراج مهارة قديمة باستخدام LRU (الأقل استخدامًا مؤخرًا) لإفساح المجال. وللإخراج أولوية: تُخرَج أولًا المهارات التي لم تُستخدم منذ إنشائها — فالمهارة التي لم تُقرأ قط يُرجّح أنها لم تُستخلص بشكل صحيح أصلًا، والأفضل أن تفسح المجال.
كلما قرأ الوكيل مهارة، يتجدد «وقت آخر استخدام» لها. ويغذّي هذا الطابع الزمني قرار الإخراج وفق LRU، ويتيح للآلية المحلية معرفة المهارات المستخدمة فعلًا وتلك التي لا تفعل سوى شغل مساحة.
كيف تعرف إن كانت المهارة مفيدة فعلًا
هذه هي الخطوة التي تتجاوزها كثير من أنظمة «التعلّم التلقائي» تكاسلًا: لقد تعلّم شيئًا — لكن هل هو مفيد؟ يحوّل Orkas ذلك إلى بضعة مقاييس محليًا. تُحسب هذه المقاييس لاستخدام آلية التطور على الجهاز نفسها — لتقرير أي مهارة تُراجع أو تُحذف — وهي أيضًا لا تغادر هذا الجهاز أبدًا.
الآلية: في بداية كل جولة، تظهر المهارات المتاحة في فهرس توجيه النظام — وهذا «ظهور» واحد؛ وإذا قرأ الوكيل مهارة فعلًا في تلك الجولة، فهذا «استدعاء» واحد. قارن الاثنين لتحصل على المقياس الأول —
- معدل الاستدعاء = الاستدعاءات / مرات الظهور. المهارة التي تبقى يومًا بعد يوم دون أن يستخدمها أحد لها معدل استدعاء منخفض، أي إنها إما عديمة الفائدة أو موصوفة بطريقة لا تُظهر متى ينبغي استخدامها.
- معدل التعديل بعد الاستخدام = نسبة المرات التي استُدعيت فيها مهارة ثم عدّل المستخدم النتيجة يدويًا. ارتفاعه يعني أن ما أنتجته المهارة لا يوافق ذوق المستخدم تمامًا.
- معدل عدم الفعالية = نسبة المرات التي استُدعيت فيها مهارة لكن الجولة انتهت بخطأ (غير عابر). ارتفاعه يوحي باحتمال وجود خلل في المهارة نفسها.
هنا ترى أثر ذلك الاستثناء مجددًا: عند حساب معدل عدم الفعالية، لا تُحتسب الأخطاء العابرة، ولا الجولات التي أوقفها المستخدم يدويًا في منتصفها — فلا يصح أن تسجّل نقطة سلبية على مهارة سليمة تمامًا بسبب اضطراب واحد في الشبكة.
بهذه الأرقام القليلة، تنتقل المهارات من «التراكم داخل صندوق أسود» إلى «شيء يمكن تقييمه وتحسينه». ولا يعود اختيار المهارة التي تُراجع أو تُحذف قرارًا حدسيًا.
إغلاق الحلقة
بجمع ما سبق، تسير دورة كاملة على النحو التالي:
ينفّذ الوكيل مهام حقيقية، ويسجّل بيانات التنفيذ محليًا ويعلّم الإشارات في موضعها أثناء العمل. وعندما يحين موعد دورة التأمل في الخلفية، تختار الوكلاء الذين لديهم تغيّرات جديدة وانقضت فترة انتظارهم، وتنظّم النشاط الأخير لكل منهم في حزمة، وتكلّف النموذج بمراجعته في ضوء فهمه الحالي لذاته — فيدمج ما ينبغي دمجه، ويستبعد ما ينبغي استبعاده، ويستخلص ما ينبغي استخلاصه في مهارات جديدة. تتحول مخرجات المراجعة إلى مهارات وفهم للذات. في المحادثة التالية، تُدرج تلك المهارات في فهرس التوجيه، ويُدرج فهم الذات في توجيه النظام، ويعود الوكيل حاملًا ما تعلّمه في الجولة السابقة. ثم تنتج هذه الجولة مقاييس وإشارات جديدة تُعاد إلى البداية.
تستمر الحلقة جولة بعد جولة. لا تحقق كل جولة قفزة هائلة، لكن الاتجاه واحد: فهمك بصورة أفضل وتكرار أقل للأخطاء نفسها.
بعض المفاضلات التي تستحق الذكر
عند النظر إلى الوراء، نجد بضعة قرارات أساسية في هذه الآلية.
يجب أن يكون التأمل الذاتي قليل التكلفة. تستخدم مراقبة الذات مقاييس بلا تكلفة للنموذج؛ أما التأمل المكلف فعلًا فيُنقل إلى الخلفية، ويُنفّذ على فترات متباعدة، ويُشترط له أولًا فحص وجود تغيّرات. بضبط الجزء «المكلف» بصرامة، يصبح تشغيل الآلية كلها ممكنًا فعلًا.
عدم التعلّم أفضل من التعلّم الخاطئ. استثناء الأخطاء العابرة، والسماح للتأمل بألا «يحفظ شيئًا»، وكتابة تعليمات أمرية قابلة للتنفيذ بدلًا من أوصاف مبهمة — كلها تشير إلى الحكم نفسه: في نظام يتحسن ذاتيًا، التعلّم في الاتجاه الخاطئ أخطر بكثير من التعلّم ببطء.
يجب أن يكون ما يُتعلَّم مرئيًا وقابلًا للتعديل وتحت سيطرتك. المهارات ملفات نصية عادية، وفهم الذات مذكرة نصية عادية، ويمكن التحقق من فعالية المهارات بالمقاييس — وكل هذه الملفات موجودة على جهازك، لا في السحابة. لا صندوق أسود في أي موضع؛ يستطيع الإنسان فتحها وتعديلها في أي وقت.
ضع مكابح للتعلّم. حدود للعدد، وإخراج وفق LRU، وحدود للطول — دون ذلك، يتحول «التعلّم المستمر» عاجلًا أم آجلًا إلى «تضخم مستمر». النسيان والإسقاط والتشذيب لا تقل أهمية عن التذكر.
ختامًا
التطور الذاتي في Orkas هو، في جوهره، إضافة حلقة بطيئة إلى الوكيل: الحلقة السريعة هي الاستجابة الفورية في كل محادثة؛ والحلقة البطيئة هي مراجعة الماضي دوريًا واستخلاص الخبرة في شيء يمكن استخدامه لاحقًا. الجزء الصعب ليس «جعل النموذج يتذكر» — بل الأحكام الهندسية التي يسهل إغفالها: كيف نميّز الخبرات الجديرة بالتسجيل، وكيف لا نضل بسبب إخفاق عارض، وكيف نجعل ما يُتعلَّم قابلًا للتنفيذ فعلًا، وكيف نشذّبه قبل أن يتضخم.
تحوّل هذه الأحكام مجتمعة عبارة «تزداد فائدته كلما استخدمته أكثر» من شعار تسويقي إلى آلية تعمل فعلًا. قد يكون المساعد الذي يتعلّم منك — ولا يتعلّم الأشياء الخاطئة — أقرب إلى ما يريده معظم الناس فعلًا من مساعد أذكى فحسب.