يبلغ وكيلك 80% من نافذة سياقه. يتفعّل الضغط ويسقط أقدم الجولات. وبعد عشر دقائق، يعيد قراءة ملف سبق أن قرأه، ويعيد طرح سؤال سبق أن أجاب عنه.
عرفت العتبة أن المساحة نفدت. لكنها لم تعرف شيئًا عما يمكن فقدانه بأمان.
هذه الملاحظة الثالثة في سلسلة عن تصميم الوكلاء ذوي المهام طويلة الأمد، استلهمناها من قراءة متأنية لـ BEACON (جامعة تشجيانغ، arXiv:2605.06078). تناولت الأولى كشف التعثر، وتناولت الثانية تصميم مراحل الإنجاز.
البداية من تطبيقنا نحن
Orkas تطبيق سطح مكتب متعدد الوكلاء. المهام الطويلة هي الحالة المعتادة هنا، لذا يبرز الضغط يوميًا. يبدأ تطبيقنا الضغط عند عتبة للرموز النصية، حين يبلغ السياق نحو 80% من النافذة. وحتى كتبنا هذا، لم يظن أحد منا أن في ذلك مشكلة.
توجد في الاستخدام الفعلي نحو ثلاثة حدود شائعة: نسبة من النافذة، أو عدد الجولات، أو ترك النموذج يكتب ملخصًا يغطي المحتوى القديم. تطبيقنا من النوع الأول.
النوعان الأولان لا ينظران إلى المحتوى مطلقًا. والثالث ينظر، لكنه يسلّم للنموذج كامل قرار ما يهم.
تجيب الثلاثة عن سؤال متى يجب أن أتخلّص من شيء. أما السؤال الحقيقي فهو ممّا يمكن التخلّص بأمان. الحذف عند العتبة يسقط أقدم المحتوى، لا أقلّه أهمية.
حدّ مرحلة الإنجاز، والافتراض الكامن تحته
قد توفّر مراحل الإنجاز الواردة في الملاحظة السابقة حدًا أفضل من الخيارات الثلاثة. لكن ثمة فخًا هنا، وقد مرّت عليه الملاحظة السابقة بسلاسة أكثر مما ينبغي.
يتضمن BEACON افتراضًا يسمى خاصية ماركوف لمراحل الإنجاز. ببساطة: بمجرد بلوغ مرحلة إنجاز، يعتمد ما يحدث بعد ذلك فقط على الأهداف الفرعية المتبقية، لا على كيفية الوصول إليها. بمجرد امتلاك المفتاح، المهم هو الباب الذي ستفتحه، لا كيف وجدته.
يبدو ذلك كأنه ترخيص بالضغط: بعد مرحلة إنجاز، يمكن طيّ الجزء السابق وإبعاده.
لكنه افتراض، لا حقيقة. تستخدم الورقة ≈، لا =، ويناقش المؤلفون مواضع إخفاقه.
كافٍ للتدريب، غير كافٍ للضغط
الافتراض نفسه، واستخدامان تفصل بينهما مرتبة كاملة في درجة الصرامة.
في التدريب، يكفي أن يتحقق إحصائيًا. إذا خالفته بضع عشرات من بين بضعة آلاف من مسارات التنفيذ، يتلاشى الانحياز عند أخذ المتوسط. ويشغّل التدريب أيضًا إشارة أساسية على مستوى المسار كشبكة أمان؛ وعند استبعاد تلك الطبقة، يهبط ALFWorld من 91.4 إلى 23.4، إلى ما دون عدم فعل شيء أصلًا بكثير.
في الضغط، يجب أن يتحقق في كل حالة على حدة، في عملية التنفيذ الوحيدة أمامك. أسقط الشيء الخطأ مرة واحدة، وتنتهي تلك المهمة. لا توجد مجموعة لأخذ متوسطها.
لذلك فإن اعتماد الورقة على هذا الافتراض لا يعني إمكان نقله إلى الضغط. الاستخدامان لا يطلبان منه الشيء نفسه.
أربع حالات يفشل فيها
نستخدم هذه الحالات كقائمة تحقق عند التفكير في سياسة الضغط.
1. المعرفة الضمنية المتراكمة أثناء العمل. في موضع مبكر، تثبت خطوة أن واجهة API معينة تعيد الطوابع الزمنية بتوقيت UTC. هذه المعلومة لا تنتمي إلى أي مرحلة إنجاز، لكن كل خطوة لاحقة تحتاج إليها.
2. الموارد المستهلكة بالفعل. ميزانية الرموز النصية، وحصة الاستدعاءات، والوقت المتبقي. مرحلة الإنجاز لا تسجّل لقد أنفقت 60% من الميزانية، لكن هذا الرقم يحدد ما إذا كانت إعادة المحاولة لا تزال ممكنة التكلفة.
3. الآثار الجانبية المعتمدة على المسار. تقول مرحلة الإنجاز اكتملت إعادة الهيكلة. وبمجرد بدء تصحيح الأخطاء، تحتاج إلى معرفة الملفات الخمسة التي عُدّلت فعلًا.
4. مرحلة الإنجاز نفسها غير محددة بما يكفي. هذه أسوأ الحالات الأربع. في الورقة، تمثل مرحلة الإنجاز حالة بيئية كاملة — إما أنك تملك المفتاح أو لا تملكه، دون غموض. أما خطوة الخطة فهي جملة واحدة بلغة طبيعية. عبارة «إنهاء تنظيف البيانات» لا تقترب حتى من تغطية ما حدث في تلك الفترة.
ما الذي ينبغي نقله بدلًا من ذلك
لا تحتفظ بملخص فقط. فالملخص يكتبه النموذج، وهو يقرر حدسيًا ما كان مهمًا.
احتفظ بمجموعة ثابتة من الحقول يختارها إنسان. أربعة على الأقل:
- كيف تبدو مساحة العمل الآن — أي الملفات عُدّلت، وإلى أي حالة وصلت.
- ما تبقى من الميزانية — الرموز النصية، وحصة الاستدعاءات، والوقت.
- ما ثبت — حقيقة UTC، وكل ما يشبهها مما سيؤثر في القرارات اللاحقة.
- ما لم يُحسم بعد — العائق الذي ظهر مرة، وجرى الالتفاف عليه، وقد يعود.
قارن ذلك بحالات الإخفاق الأربع أعلاه، وستجد تطابقًا واحدًا لواحد. وهذه المطابقة أبسط طريقة للحكم على كفاية سياسة الضغط.
نصف هذا شبه مجاني. كما وصفت الملاحظة السابقة، يسجّل المضيف أصلًا حقائق حتمية بعد كل استدعاء أداة: هل أُعيدت كتابة ملف فعلًا، وهل نُفّذ أمر حقًا. جُمعت تلك البيانات للتحقق من مراحل الإنجاز، لكنها هو لقطة حالة مساحة العمل، لذا يستطيع الضغط نقلها مباشرة دون مطالبة نموذج بتلخيصها من جديد.
النصف الصعب هو الحقلان الآخران. ما ثبت وما لم يُحسم بعد لا يوجدان حاليًا إلا إذا دوّنهما النموذج، ولهذا تحديدًا يكونان أول ضحايا الضغط.
هذا قابل للقياس، لا للجدال
بعد الضغط، إذا أعاد الوكيل قراءة ملف أُزيل من السياق المضغوط، أو أعاد طرح سؤال سبق أن أُجيب عنه، فقد فشل الافتراض في تلك المهمة والدليل موجود أمامك.
أدوات الرصد بسيطة: خذ تقاطع مسارات الملفات المقروءة بعد نقطة الضغط مع ما سُجّل قبلها.
بهذا الرقم، يصبح سؤال أي أنواع المهام يمكن ضغطها بقوة وأيها لا يمكن استعلامًا بدلًا من جدال تصميمي. إنه النهج نفسه في الملاحظة الأولى من هذه السلسلة: قِس أولًا، ثم غيّر شيئًا.
مواضع التحفّظ على هذا الطرح
لم يُطلق شيء من هذا بعد. نحن في مرحلة التصميم وإضافة أدوات الرصد.
ينبغي أن يأتي تحديد الحقول التي نحتفظ بها ومستوى تفصيلها من بيانات ما يُعاد جلبه فعلًا. اتخاذ القرار الآن طريقة جيدة لاتخاذ قرار خاطئ.
وهذا نهج واحد بين عدة نُهج. فقد يبدو موضع الحد وطريقة تعريف الحقول مختلفين تمامًا في منتج آخر. قائمة الحالات الأربع قابلة للنقل؛ أما الإجابة المحددة فلا.
تتناول الملاحظة التالية والأخيرة في هذه السلسلة التأمل الذاتي: لماذا تظل دروس الوكيل المستخلصة عامة بقدر عبارة «كن أكثر حذرًا»، وأمرًا مفاجئًا حقًا بشأن ما تحتويه مدخلاته وما لا تحتويه.