लंबी अवधि वाले एजेंट — जो किसी चीज़ के सत्यापन योग्य ढंग से पूरा होने से पहले दर्जनों चरण चलते हैं — ऐसे तरीक़े से विफल होते हैं जैसे छोटी अवधि वाले एजेंट नहीं होते। कार्य लंबे होने पर प्रदर्शन धीरे-धीरे नहीं गिरता। वह अचानक धराशायी हो जाता है।
Zhejiang University की ZJU-REAL प्रयोगशाला का एक हालिया शोधपत्र, लंबी अवधि वाले भाषा एजेंटों के लिए मील के पत्थरों द्वारा निर्देशित नीति अधिगम, इस गिरावट का इतना सटीक निदान करता है कि आप खुद कभी नीति प्रशिक्षित न करें, तब भी यह उपयोगी है। विधि का नाम BEACON है; इसका कोड ओपन सोर्स है.
हमने इसे ध्यान से पढ़ा, क्योंकि इसमें वर्णित समस्या वही है जिसका सामना हमें उत्पाद बनाते समय बार-बार होता है। आगे शोधपत्र का तर्क है, एक जगह जहाँ परिणाम को समझने के लिए हमें गणित की तह तक जाना पड़ा, और वे बातें हैं जो हमारे अनुसार एजेंट की संरचना में लागू होती हैं।
विफलता के दो प्रकार, दोनों मापने योग्य
हमें सबसे अच्छी बात यह लगी कि शोधपत्र किसी विधि से शुरू नहीं होता। वह विश्लेषण से शुरू होता है: ALFWorld पर GRPO से प्रशिक्षित Qwen2.5-1.5B, जिसके पतन को दो मात्रात्मक रूप से मापे गए कारणों में बाँटा गया है।
श्रेय का गलत निर्धारण
प्रक्षेपवक्र-स्तरीय RL किसी निष्पादन को क्रियाओं का सपाट क्रम मानता है। हर क्रिया का अंतिम स्कोर एक ही होता है। इसलिए वही सही क्रिया सफल निष्पादन में धनात्मक ग्रेडिएंट और विफल निष्पादन में ऋणात्मक ग्रेडिएंट पाती है — वह "सही" थी या नहीं, यह इस पर निर्भर करता है कि क्या हुआ बाद में.
लेखक इसे इस मापदंड से मापते हैं: विरोधाभासी क्रिया अनुपात: समान अवस्थाओं में की गई क्रियाओं का वह अंश, जिन्हें अलग-अलग प्रक्षेपवक्रों में विपरीत चिह्न वाले एडवांटेज मिलते हैं। इसका शिखर पहुँचता है 40% से ऊपर। उन ग्रेडिएंट के एक-दूसरे को रद्द कर देने के बाद प्रभावी अधिगम संकेत गिर जाता है 20% से नीचे.
नमूनों के उपयोग में अक्षमता
प्रक्षेपवक्रों को तीन समूहों में बाँटें — पूर्ण सफलता, आंशिक सफलता (कम-से-कम एक उपलक्ष्य पूरा, फिर भी कार्य विफल), और पूर्ण विफलता:
- आंशिक सफलताओं की हिस्सेदारी स्थिर रहती है 39–47% नमूनों में, पूरे प्रशिक्षण के दौरान।
- पूर्ण सफलताएँ रहती हैं 27% से नीचे.
GRPO में आंशिक सफलता और पूर्ण विफलता, दोनों का स्कोर शून्य होता है। 73% से अधिक नमूने कोई अधिगम संकेत पैदा ही नहीं करते।
अवधि बढ़ने पर दोनों समस्याएँ बढ़ती हैं: लंबे कार्य कम सफल होते हैं (अधिक आंशिक सफलताएँ) और बाद की यादृच्छिकता को श्रेय बिगाड़ने के अधिक अवसर मिलते हैं। ALFWorld पर ठोस आँकड़े: छोटे कार्यों पर 76.7%, लंबे कार्यों पर 53.5%।
अंतर्दृष्टि: लंबे कार्यों में संरचना पहले से होती है
लंबी अवधि के कार्य ऐसे चरणों में बँटते हैं जिनकी सीमाएँ तय करते हैं मील के पत्थर — सत्यापन योग्य अवस्था-परिवर्तन, जो उपलक्ष्य पूरा होने का संकेत देते हैं। सपाट अनुकूलन इस संरचना को बस फेंक देता है।
लेखक इसे औपचारिक रूप देते हैं: मील का पत्थर मार्कोव गुण: एक बार मील के पत्थर वाली अवस्था पर पहुँचने के बाद, शेष प्रक्षेपवक्र का वितरण मुख्यतः इस पर निर्भर करता है कि कौन-से उपलक्ष्य बाकी हैं, न कि वहाँ पहुँचने के पूरे इतिहास पर।
चाबी मिल जाने के बाद आगे क्या होता है, यह इस पर निर्भर करता है कि आप उससे क्या करते हैं — इस पर नहीं कि वह कैसे मिली।
यही अनुमानित मार्कोव गुण अलग-अलग खंडों के श्रेय को अलग करना संभव बनाता है।
विधि, तीन चरणों में
1. मील के पत्थरों पर विभाजन
एक डिटेक्टर Φ मील के पत्थर वाले समय-चरणों को चिह्नित करता है और प्रक्षेपवक्र को खंडों में काटता है। हमारे विचार में इस डिज़ाइन निर्णय को पर्याप्त महत्त्व नहीं मिला: Φ को न सीखे हुए मॉडल की ज़रूरत है, न मानव एनोटेशन की। यह पर्यावरण की प्रतिक्रिया से सीधे प्रत्यक्ष अवस्था-परिवर्तन पढ़ता है — ALFWorld में वस्तुओं के अवस्था-परिवर्तन, WebShop में पृष्ठ-परिवर्तन, ScienceWorld में स्पष्ट उपलक्ष्य संकेत।
शून्य अतिरिक्त मॉडल, शून्य अतिरिक्त रोलआउट। प्रक्रिया पुरस्कार मॉडल और मोंटे कार्लो मूल्य अनुमान के मुकाबले लागत का पूरा लाभ यही है।
2. हर खंड के भीतर समय-आधारित पुरस्कार निर्धारण
r_t = R_ms * γ^(t_k − t) if segment k ends in a completed milestone
= 0 otherwiseकेवल वे खंड जो समाप्त होते हैं किसी मील के पत्थर पर, पुरस्कार पाते हैं, और ऐसे खंड में मील के पत्थर के करीब की क्रियाओं को अधिक पुरस्कार मिलता है। पूरे हुए खंड की हर क्रिया अब संकेत देती है, इसलिए आंशिक सफलताएँ फेंकी नहीं जातीं।
3. दो पैमानों पर एडवांटेज
प्रक्षेपवक्र स्तर पर अंतिम पुरस्कारों का मानक GRPO सामान्यीकरण होता है। असली विचार खंड स्तर पर है — तुलना समूह की परिभाषा में:
G_k = { i : K_i ≥ k } # only trajectories that ALSO reached milestone k
A_seg(i,t) = r_t − (1/|G_k|) · Σ_{j∈G_k} R_k(j) / |Seg_k(j)|
└── group-average PER-STEP return ──┘खंड में क्रियाएँ k तुलना की जाती हैं केवल उन प्रक्षेपवक्रों से जो भी इस मील के पत्थर तक पहुँचे k। इससे लेखक विचरण पृथक्करण का गुण व्युत्पन्न करते हैं: बाद के खंड सफल हों या विफल, गणितीय रूप से वे मौजूदा खंड के श्रेय को दूषित नहीं कर सकते।
अंतिम एडवांटेज है A_traj + λ · A_seg, जिसे मानक PPO क्लिप्ड सरोगेट से अनुकूलित किया जाता है। हाइपरपैरामीटर γ=0.95, λ=1.0 हर बेंचमार्क पर स्थिर हैं — प्रत्येक कार्य के लिए अलग ट्यूनिंग नहीं होती।
परिणाम
ALFWorld, Qwen2.5-1.5B:
| विधि | छोटे | मध्यम | लंबे | औसत |
|---|---|---|---|---|
| GRPO | 76.7 | 73.9 | 53.5 | 72.8 |
| GiGPO | 90.7 | 84.3 | 79.5 | 86.1 |
| BEACON | 96.8 | 87.0 | 92.9 | 91.4 |
अन्य दो पर्यावरणों में सफलता दर:
| विधि | ScienceWorld | WebShop |
|---|---|---|
| GRPO | 21.1 | 56.8 |
| GiGPO | 25.8 | 65.0 |
| BEACON | 45.3 | 75.6 |
1.5B मॉडल ALFWorld (91.4 बनाम 48.0) और WebShop (75.6 बनाम 23.7) पर GPT-4o से अधिक स्कोर करता है, और ScienceWorld (45.3 बनाम 45.4) पर बराबरी करता है। उचित सावधानी: बंद मॉडल ReAct प्रॉम्प्ट से चलाए गए हैं, प्रशिक्षित नहीं किए गए। नमूना उपयोग 23.7% से बढ़कर 82.0% हो जाता है, और अभिसरण तेज़ है — पुनरावृत्ति 50 तक 60% सफलता, जिसके लिए GRPO को पुनरावृत्ति 120 चाहिए।
सबसे ठोस परिणाम यह है कि अवधि बढ़ने के साथ लाभ बढ़ते हैं। 7B पर, GRPO के मुकाबले सापेक्ष सुधार छोटे कार्यों में +13% से बढ़कर +39% हो जाता है लंबे कार्यों में; GiGPO केवल +11% से +22% तक जाता है। कारण महत्त्वपूर्ण है: GiGPO चरण-स्तरीय तुलना समूह बनाता है दोहराई गई अवस्थाओं से, और जैसे-जैसे नीति सुधरती है और उसके प्रक्षेपवक्र विविध होते हैं, अवस्थाओं का दोहराव कम होता जाता है — उसका अपना संकेत स्रोत क्षीण होता है। नीति मज़बूत होने पर मील के पत्थर वाले आधार क्षीण नहीं होते।
ऐसी विधि जिसका लाभ समस्या कठिन होने पर बढ़ता है, ऊँचे औसत स्कोर से कहीं अधिक मज़बूत दावा है।
वह मापदंड जो विरोधाभास लगता है
शोधपत्र परिभाषित करता है श्रेय संकेंद्रण अनुपात — औसत एडवांटेज परिमाण मील के पत्थर वाली क्रियाओं का, गैर-मील-पत्थर क्रियाओं के उसी परिमाण से भाग देने पर। 1 से अधिक का मतलब है कि श्रेय मील के पत्थरों पर केंद्रित है।
| विधि | CCR |
|---|---|
| GiGPO | 2.36 |
| GRPO | 1.37 |
| BEACON | 0.84 |
तो सबसे अच्छा प्रदर्शन करने वाली विधि वही है जो मुख्य चरणों पर श्रेय केंद्रित करती है सबसे कम — जो "मील के पत्थर के करीब की क्रियाओं को अधिक पुरस्कार मिलता है" का सीधा विरोध लगता है। ऐसा नहीं है। दोनों कथन अलग-अलग राशियाँ मापते हैं, जिनके बीच दो रूपांतरण हैं।
रूपांतरण 1 — आकार दिया गया पुरस्कार। किसी खंड के भीतर पुरस्कार मील के पत्थर की ओर एकदिश रूप से बढ़ता है। जब γ=0.95 और खंड की लंबाई 5 हो, तो पाँचों क्रियाओं को मिलता है 0.8145, 0.857, 0.9025, 0.95, 1.0। लेकिन यह पुरस्कार है, ग्रेडिएंट तक पहुँचने वाला श्रेय नहीं।
रूपांतरण 2 — समूह आधाररेखा घटाएँ। आधाररेखा समूह का औसत प्रति-चरण प्रतिफल है (खंड का प्रतिफल ÷ खंड की लंबाई)। इस लंबाई वाले खंड के लिए L, प्रति-चरण प्रतिफल है (1−γ^L) / (L(1−γ)):
| खंड की लंबाई | 3 | 5 | 8 | 10 |
|---|---|---|---|---|
| प्रति-चरण प्रतिफल | 0.951 | 0.905 | 0.842 | 0.803 |
यदि आपके खंड में 8 चरण लगे जबकि समूह का औसत 5 था, तो आपका प्रति-चरण प्रतिफल आधाररेखा से नीचे होता है और पूरा खंड का एडवांटेज ऋणात्मक दिशा में झुक जाता है। इसका अर्थ समझें: भटकने का दंड क्षय से सीधे नहीं आता — वह प्रति-चरण आधाररेखा के माध्यम से काम करने वाले क्षय से आता है। अकेला क्षय केवल क्रियाओं का क्रम तय करता है भीतर एक खंड के। इस बिंदु पर पूरे हुए खंड के भीतर CCR अब भी 1 से अधिक है।
रूपांतरण 3 — प्रक्षेपवक्र-स्तरीय पद जोड़ें। यहाँ दो असममित प्रभावों से CCR 1 से नीचे गिरता है। पहला, विफल प्रक्षेपवक्र का अंतिम खंड किसी भी तुलना समूह में शामिल नहीं होता: क्योंकि G_k = {i : K_i ≥ k} और अधूरे अंतिम खंड का सूचकांक है K_i + 1 > K_i, इसलिए वह प्रक्षेपवक्र बाहर रहता है। अंतिम खंड को खंड-स्तरीय एडवांटेज नहीं मिलता, केवल पूरे परिमाण वाला प्रक्षेपवक्र-स्तरीय पद मिलता है — और उसकी हर क्रिया गैर-मील-पत्थर क्रिया है, जिससे हर बढ़ता है। दूसरा, विफल प्रक्षेपवक्रों में ऋणात्मक प्रक्षेपवक्र-स्तरीय पद, मील के पत्थर वाली क्रियाओं के धनात्मक खंड-स्तरीय श्रेय को काटता है और उनका परिमाण शून्य की ओर घटाता है।
शोधपत्र का अपना चित्र 8 इसकी पुष्टि करता है। S3 और S4 मील के पत्थर पूरे करने वाले एक विफल प्रक्षेपवक्र पर:
| शौचालय जाएँ | साबुन की टिकिया रखें (S3✓) | काउंटर पर जाएँ (S4✓) | काउंटर पर जाएँ | होल्डर के पास जाएँ | |
|---|---|---|---|---|---|
| GRPO | −2.50 | −2.50 | −2.50 | −2.50 | −2.50 |
| BEACON | −0.92 | +0.51 | +0.32 | −2.20 | −2.20 |
अंतिम दो मान हैं एकसमान — यह "अंतिम खंड को केवल प्रक्षेपवक्र-स्तरीय पद मिलता है" की पहचान है, जिससे आप सीधे निकाल सकते हैं A_traj ≈ −2.20। दोनों मील के पत्थर वाली क्रियाएँ धनात्मक हैं, लेकिन उनका परिमाण केवल ~0.5 है, क्योंकि ऋणात्मक प्रक्षेपवक्र पद ने अधिकांश खंड-स्तरीय श्रेय काट दिया। इस प्रक्षेपवक्र का CCR 0.23 है; सफल प्रक्षेपवक्र का 2.95 है। समग्र 0.84 इनका मिश्रण है।
इसलिए CCR मापता है ग्रेडिएंट परिमाण का संकेंद्रण, यह नहीं कि पुरस्कार किसे मिला। कम CCR डिज़ाइन का लक्ष्य नहीं है — यह खंड के भीतर सघन आवंटन और दो पैमानों के संयोजन का उपोत्पाद है। लेखकों का निष्कर्ष फिर भी सही और उपयोगी है: अपनी सारी ग्रेडिएंट ऊर्जा मुख्य चरणों पर मत डालें। GiGPO के 2.36 का अर्थ है कि बीच की तैयारी वाली क्रियाओं को लगभग कोई संकेत नहीं मिलता, जबकि मील के पत्थर तक पहुँचना उन्हीं से संभव होता है।
एक बात जो शोधपत्र स्पष्ट नहीं करता
घटक-हटाव तालिका में एक अजीब खाना है। यह सेट करने पर γ=1 — हर खंड के भीतर समान श्रेय — स्कोर आता है 71.8, जो कोई पुरस्कार निर्धारण न करने से भी खराब है (γ=0, 81.2), और GRPO के 72.8 से भी कम। शोधपत्र इसे "भ्रामक ग्रेडिएंट" का परिणाम बताता है।
गणित हल करने पर उत्तर अधिक स्पष्ट होता है। जब γ=1 तो पूरे हुए खंड की हर क्रिया को समान पुरस्कार मिलता है, इसलिए हर पूरे हुए खंड का प्रति-चरण प्रतिफल — लंबाई चाहे जो हो — ठीक इतना होता है R_ms। आधाररेखा भी इतनी ही होती है, और:
A_seg(i,t) ≡ R_ms − R_ms = 0 for every actionखंड-स्तरीय माध्यम गुमराह नहीं करता। वह सर्वथा शून्य हो जाता है, और विधि ठीक GRPO बन जाती है। तालिका से मिलाएँ: GRPO के 72.8 के मुकाबले 71.8 — एक अंक का अंतर, जो अलग-अलग निष्पादनों का उतार-चढ़ाव है।
इससे क्षय की भूमिका की समझ बदलती है। यह केवल किसी खंड के भीतर क्रियाओं में अंतर करने के लिए नहीं है; यह है खंड-स्तरीय संकेत के अस्तित्व की ही एक आवश्यक शर्त। इसके बिना प्रति-चरण आधाररेखा संकेत को वहीं रद्द कर देती है।
तीन प्रयोग जो स्पष्ट आपत्तियों का उत्तर देते हैं
जहाँ श्रेय बनता है, वहाँ देना चाहिए — लेखक संदेहशील पाठक के तीन सवालों का पहले ही उत्तर देते हैं:
- क्या यह केवल व्यवहार की नकल है? ओरेकल प्रक्षेपवक्रों पर SFT 43% तक पहुँचता है; BEACON 91.4% तक। नीति ओरेकल से बेहतर निष्पादन रणनीतियाँ खोजती है, इसलिए वह नकल नहीं कर रही।
- क्या लाभ केवल खंडों में बाँटने से आते हैं? यादृच्छिक विभाजन का स्कोर 74.2% है, GRPO से केवल 1.4 अंक अधिक। वास्तविक मील के पत्थरों का स्कोर 91.4% है — 17.2 अंक का अंतर। लाभ कार्य की अंतर्निहित संरचना से आता है।
- यदि डिटेक्टर भरोसेमंद न हो तो? यादृच्छिक रूप से 50% मील के पत्थर हटाने पर भी 82.8% मिलता है, GRPO से दस अंक अधिक। गिरावट क्रमिक होती है।
एजेंट डिज़ाइन में क्या लागू होता है
BEACON एक प्रशिक्षण विधि है, और अधिकांश उत्पाद — हमारा भी — मॉडल प्रशिक्षित करने के बजाय उनका समन्वय करते हैं। सूत्र सीधे लागू नहीं होते। निदान होता है, और वह आश्चर्यजनक रूप से सीधे संरचना से जुड़ता है।
आंशिक प्रगति को प्राथमिक महत्त्व वाली, स्थायी रूप से सहेजी गई अवस्था होना चाहिए। शोधपत्र का सबसे प्रभावी आँकड़ा यह है कि 39–47% निष्पादन वास्तविक उपलक्ष्य पूरे करते हैं, फिर भी उनका स्कोर उन निष्पादनों जितना ही होता है जिन्होंने कुछ नहीं किया। लंबे समय तक चलने वाला एजेंट सत्र तीन उपलक्ष्य पूरे करके अटक जाए, तो यही समस्या होती है: यदि प्रणाली केवल "चल रहा है" और "पूरा हुआ" दर्ज करती है, तो वह प्रगति खो जाती है और दोबारा प्रयास शून्य से शुरू होता है। मील के पत्थर उसे दर्ज करने की शब्दावली देते हैं।
मील के पत्थर प्रत्यक्ष प्रभावों से तय होने चाहिए, स्वयं किए गए दावों से नहीं। इसका कारण कि Φ कम खर्चीला है, यह है कि वह नीति से प्रगति के बारे में पूछने के बजाय सत्यापन योग्य अवस्था-परिवर्तन पढ़ता है। एजेंट रनटाइम के पास भी यही साधन उपलब्ध है, जिसे वे अक्सर अनदेखा करते हैं: लिखी गई फ़ाइल, शून्य निकास कोड वाला परीक्षण, सफलता लौटाने वाली कनेक्टर कॉल, ज्ञान आधार में दर्ज दस्तावेज़। ये वास्तविक प्रमाण हैं। मॉडल का "पहला चरण पूरा" कहना नहीं।
मील के पत्थरों की सीमाएँ संदर्भ संक्षेपण और फिर से शुरू करने के तर्कसंगत बिंदु हैं। मील का पत्थर मार्कोव गुण कहता है कि किसी मील के पत्थर तक पहुँचने के बाद उससे पहले का इतिहास बहुत कम महत्त्व रखता है। संदर्भ संक्षेपण के लिए यह "हम टोकन सीमा तक पहुँच गए" से कहीं बेहतर आधार है, और यही सीमा विफलता के बाद दोबारा शुरू करने का स्वाभाविक जाँच-बिंदु है।
एक नहीं, दो पैमानों पर सत्यापन करें। एजेंट कार्यप्रवाह बनाने वाले हर व्यक्ति के लिए हम इस घटक-हटाव परिणाम को रेखांकित करेंगे: प्रक्षेपवक्र-स्तरीय संकेत हटाने पर ALFWorld 91.4% से गिरकर हो जाता है 23.4%। केवल खंड-स्तरीय प्रतिक्रिया मिलने पर नीति ऐसे व्यवहार को मज़बूत करती है जो बीच के मील के पत्थर पूरे करता है, लेकिन वास्तविक लक्ष्य से भटकता जाता है — हर उपकार्य शानदार ढंग से पूरा, पर अंतिम परिणाम गलत। उपकार्य की स्वीकृति और अंतिम परिणाम की स्वीकृति एक-दूसरे का विकल्प नहीं हैं। ध्यान दें कि आवश्यक भार कार्य के अनुसार बदलता है: प्रक्षेपवक्र स्तर के बिना भी WebShop 67.9% हासिल करता है, क्योंकि उसके मील के पत्थर अंतिम सफलता से निकटता से जुड़े हैं; ALFWorld ढह जाता है।
सीमाएँ, ईमानदारी से बताई गईं
सबसे बड़ी बाधा यह है कि क्या Φ प्राप्त किया भी जा सकता है। तीनों बेंचमार्क नियमों से मील के पत्थर निकालते हैं — पर्यावरण की प्रतिक्रियाओं पर पैटर्न मिलान, पृष्ठ-परिवर्तन, स्पष्ट उपलक्ष्य संकेत। ब्राउज़र स्वचालन, कोडबेस रिफ़ैक्टरिंग और गहन शोध जैसे खुले कार्यों में ऐसे तैयार सत्यापन योग्य परिवर्तन नहीं होते, और लेखक स्वचालित मील का पत्थर खोज को एक अनसुलझी समस्या बताते हैं। इसे संरचित पर्यावरणों में सत्यापित प्रतिमान समझना चाहिए, ज्यों-का-त्यों अपनाने योग्य इंजीनियरिंग नुस्खा नहीं।
मील के पत्थरों का सूक्ष्मता स्तर भी संवेदनशील है: वे बहुत विरल हों तो विधि GRPO की ओर लौटती है, बहुत सघन हों तो खंड एडवांटेज में शोर बढ़ता है। मार्कोव गुण केवल अनुमानित है, और विचरण पृथक्करण उसी पर निर्भर है। प्रयोग असतत पाठ-आधारित क्रिया-क्षेत्रों के साथ 7B तक सीमित हैं — सतत नियंत्रण और बहु-एजेंट परिस्थितियाँ अपरीक्षित हैं।
फिर भी, मूल दावे से असहमत होना हमें कठिन लगता है: लंबे कार्यों में उपयोगी संयोजनीय संरचना होती है, और उसे प्राथमिक महत्त्व वाली इकाई मानना इस उम्मीद से बेहतर है कि मॉडल उसे संदर्भ में याद रखेगा। हम इस सोच को Orkas में लंबी अवधि के कार्यों के समर्थन पर लागू कर रहे हैं, और डिज़ाइन लागू होते ही उसके बारे में और साझा करेंगे।
