Gli agenti a lungo orizzonte — quelli che eseguono decine di passaggi prima che qualcosa sia concluso in modo verificabile — falliscono in un modo che non si riscontra negli agenti a breve orizzonte. Le prestazioni non peggiorano gradualmente all'allungarsi delle attività. Crollano di colpo.
Un recente articolo del laboratorio ZJU-REAL dell'Università di Zhejiang, Apprendimento delle politiche guidato da traguardi per agenti linguistici a lungo orizzonte, diagnostica questo crollo con una precisione utile anche a chi non addestra mai una politica. Il metodo si chiama BEACON; il codice è open source.
Lo abbiamo letto attentamente perché il problema che descrive è lo stesso che continuiamo a incontrare nello sviluppo del prodotto. Di seguito presentiamo l'argomentazione dell'articolo, un punto in cui abbiamo dovuto ripercorrere i calcoli per spiegare un risultato e ciò che riteniamo trasferibile all'architettura degli agenti.
Due modalità di fallimento, entrambe misurabili
Ciò che apprezziamo di più è che l'articolo non si apre con un metodo. Si apre con un'autopsia: Qwen2.5-1.5B addestrato con GRPO su ALFWorld, con il crollo scomposto in due cause quantificate.
Attribuzione errata del credito
L'apprendimento per rinforzo a livello di traiettoria tratta un'esecuzione come una sequenza piatta di azioni. Tutte le azioni condividono un unico punteggio finale. Così la stessa azione corretta riceve un gradiente positivo in un'esecuzione riuscita e uno negativo in un'esecuzione fallita: il fatto che fosse "giusta" dipende da ciò che è successo dopo.
Gli autori quantificano questo fenomeno con il rapporto di azioni contraddittorie: la frazione di azioni che ricevono vantaggi di segno opposto in traiettorie diverse pur essendo eseguite in stati identici. Il valore massimo supera il 40%. Dopo che questi gradienti si annullano a vicenda, il segnale di apprendimento effettivo scende sotto il 20%.
Inefficienza nell'uso dei campioni
Suddividiamo le traiettorie in tre categorie: successo completo, successo parziale (almeno un sotto-obiettivo completato, ma attività comunque fallita) e fallimento totale:
- I successi parziali si mantengono stabili al 39–47% dei campioni durante tutto l'addestramento.
- I successi completi restano sotto il 27%.
Con GRPO, un successo parziale e un fallimento totale ricevono entrambi un punteggio pari a zero. Oltre il 73% dei campioni non produce alcun segnale di apprendimento.
Entrambi i problemi si aggravano all'aumentare dell'orizzonte: le attività più lunghe riescono meno spesso (più successi parziali) e offrono alla casualità dei passaggi successivi più occasioni di alterare l'attribuzione del credito. In concreto, su ALFWorld: 76.7% sulle attività brevi, 53.5% su quelle lunghe.
L'intuizione: le attività lunghe hanno già una struttura
Le attività a lungo orizzonte si scompongono in fasi delimitate da traguardi: transizioni di stato verificabili che segnano il completamento di sotto-obiettivi. L'ottimizzazione piatta si limita a scartare questa struttura.
Gli autori la formalizzano come proprietà di Markov dei traguardi: una volta raggiunto uno stato di traguardo, la distribuzione sulla parte restante della traiettoria dipende soprattutto dai sotto-obiettivi ancora da completare, non dall'intera storia del percorso compiuto per arrivarci.
Una volta ottenuta la chiave, ciò che accade dopo dipende da come la usi, non da come l'hai trovata.
Questa proprietà di Markov approssimata è ciò che permette di disaccoppiare l'attribuzione del credito tra i segmenti.
Il metodo, in tre passaggi
1. Suddivisione in corrispondenza dei traguardi
Un rilevatore Φ segnala gli istanti in cui si raggiungono i traguardi e divide la traiettoria in segmenti. La scelta progettuale che riteniamo sottovalutata è questa: Φ non richiede né un modello addestrato né annotazioni umane. Legge i cambiamenti di stato osservabili direttamente dai riscontri dell'ambiente: transizioni di stato degli oggetti in ALFWorld, transizioni tra pagine in WebShop, segnali espliciti sui sotto-obiettivi in ScienceWorld.
Zero modelli aggiuntivi, zero simulazioni aggiuntive di traiettorie. È questo l'intero vantaggio di costo rispetto ai modelli di ricompensa del processo e alla stima del valore con Monte Carlo.
2. Modellazione temporale della ricompensa all'interno di ogni segmento
r_t = R_ms * γ^(t_k − t) if segment k ends in a completed milestone
= 0 otherwiseSolo i segmenti che terminano con un traguardo ricevono una ricompensa e, all'interno di questi segmenti, le azioni più vicine al traguardo ne ricevono di più. Ora ogni azione in un segmento completato veicola un segnale, quindi i successi parziali smettono di essere scartati.
3. Vantaggio su due scale
A livello di traiettoria si usa la normale normalizzazione GRPO sulle ricompense finali. L'idea risiede nel livello di segmento, precisamente nel modo in cui viene definito il gruppo di confronto:
G_k = { i : K_i ≥ k } # only trajectories that ALSO reached milestone k
A_seg(i,t) = r_t − (1/|G_k|) · Σ_{j∈G_k} R_k(j) / |Seg_k(j)|
└── group-average PER-STEP return ──┘Le azioni del segmento k vengono confrontate solo con traiettorie che hanno anch'esse raggiunto il traguardo k. Da questo gli autori derivano una proprietà di isolamento della varianza: il successo o il fallimento dei segmenti successivi non può matematicamente contaminare l'attribuzione del credito per quello corrente.
Il vantaggio finale è A_traj + λ · A_seg, ottimizzato con la consueta funzione obiettivo surrogata di PPO con clipping. Gli iperparametri γ=0.95, λ=1.0 rimangono fissi in tutti i benchmark, senza regolazioni per singola attività.
Risultati
ALFWorld, Qwen2.5-1.5B:
| Metodo | Breve | Medio | Lungo | Media |
|---|---|---|---|---|
| GRPO | 76.7 | 73.9 | 53.5 | 72.8 |
| GiGPO | 90.7 | 84.3 | 79.5 | 86.1 |
| BEACON | 96.8 | 87.0 | 92.9 | 91.4 |
Tasso di successo negli altri due ambienti:
| Metodo | ScienceWorld | WebShop |
|---|---|---|
| GRPO | 21.1 | 56.8 |
| GiGPO | 25.8 | 65.0 |
| BEACON | 45.3 | 75.6 |
Il modello da 1.5B supera GPT-4o su ALFWorld (91.4 contro 48.0) e WebShop (75.6 contro 23.7), e lo eguaglia su ScienceWorld (45.3 contro 45.4). Una precisazione doverosa: i modelli chiusi ricevono prompt con ReAct, non vengono addestrati. L'utilizzo dei campioni sale dal 23.7% all'82.0% e la convergenza è più rapida: 60% di successo entro l'iterazione 50, mentre GRPO deve arrivare all'iterazione 120.
Il risultato più convincente è che i miglioramenti aumentano con l'orizzonte. Sul modello da 7B, il miglioramento relativo rispetto a GRPO passa da +13% sulle attività brevi a +39% su quelle lunghe; GiGPO passa soltanto da +11% a +22%. Il motivo conta: GiGPO costruisce gruppi di confronto a livello di singolo passaggio a partire da stati ripetuti e, man mano che una politica migliora e le sue traiettorie si diversificano, gli stati si ripresentano più raramente, erodendo la fonte stessa del suo segnale. I punti di riferimento costituiti dai traguardi non si deteriorano quando la politica diventa più efficace.
Un metodo il cui beneficio cresce all'aumentare della difficoltà del problema rappresenta un risultato molto più forte di un punteggio medio più alto.
La metrica che sembra una contraddizione
L'articolo definisce un rapporto di concentrazione del credito: il valore assoluto medio del vantaggio per le azioni di traguardo diviso per quello delle azioni che non corrispondono a un traguardo. Un valore superiore a 1 significa che il credito si concentra sui traguardi.
| Metodo | CCR |
|---|---|
| GiGPO | 2.36 |
| GRPO | 1.37 |
| BEACON | 0.84 |
Quindi il metodo con le migliori prestazioni è quello che concentra meno il credito sui passaggi chiave, il che sembra contraddire direttamente l'affermazione "le azioni più vicine al traguardo ricevono una ricompensa maggiore". Non è così. Le due affermazioni misurano grandezze diverse, separate da due trasformazioni.
Trasformazione 1 — ricompensa modellata. All'interno di un segmento, la ricompensa aumenta effettivamente in modo monotono verso il traguardo. Con γ=0.95 e un segmento di lunghezza 5, le cinque azioni ricevono 0.8145, 0.857, 0.9025, 0.95, 1.0. Ma questa è la ricompensa, non il credito che arriva al gradiente.
Trasformazione 2 — sottrazione del valore di riferimento del gruppo. Il valore di riferimento è il ritorno medio del gruppo per passaggio (ritorno del segmento ÷ lunghezza del segmento). Per un segmento di lunghezza L, il ritorno per passaggio è (1−γ^L) / (L(1−γ)):
| Lunghezza del segmento | 3 | 5 | 8 | 10 |
|---|---|---|---|---|
| Ritorno per passaggio | 0.951 | 0.905 | 0.842 | 0.803 |
Se il tuo segmento ha richiesto 8 passaggi mentre la media del gruppo era 5, il tuo ritorno per passaggio si colloca sotto il valore di riferimento e il vantaggio dell'intero segmento tende al negativo. Nota cosa significa: la penalità per i giri a vuoto non deriva dal decadimento in sé, ma dal decadimento che agisce attraverso il valore di riferimento per passaggio. Il decadimento da solo si limita a ordinare le azioni all'interno di un segmento. A questo punto il CCR all'interno di un segmento completato è ancora maggiore di 1.
Trasformazione 3 — aggiunta del termine a livello di traiettoria. È qui che il CCR scende sotto 1, per effetto di due fenomeni asimmetrici. Primo, il segmento finale di una traiettoria fallita non entra in alcun gruppo di confronto: poiché G_k = {i : K_i ≥ k} e la coda incompleta ha indice K_i + 1 > K_i, quella traiettoria è esclusa. La coda non riceve alcun vantaggio a livello di segmento, ma solo il termine a livello di traiettoria nella sua intera entità; e tutte quelle azioni sono azioni senza traguardo, il che gonfia il denominatore. Secondo, nelle traiettorie fallite il termine negativo a livello di traiettoria compensa il credito positivo a livello di segmento sulle azioni di traguardo, comprimendone il valore assoluto verso zero.
La Figura 8 dello stesso articolo lo conferma. Su una traiettoria fallita che ha completato i traguardi S3 e S4:
| vai al WC | posa la saponetta (S3✓) | vai al piano d'appoggio (S4✓) | vai al piano d'appoggio | vai al supporto | |
|---|---|---|---|---|---|
| GRPO | −2.50 | −2.50 | −2.50 | −2.50 | −2.50 |
| BEACON | −0.92 | +0.51 | +0.32 | −2.20 | −2.20 |
Gli ultimi due valori sono identici: il segno distintivo del fatto che "il segmento finale riceve solo il termine a livello di traiettoria", da cui si può ricavare direttamente A_traj ≈ −2.20. Le due azioni di traguardo sono positive, ma hanno un valore assoluto di appena ~0.5, perché il termine negativo della traiettoria ha assorbito gran parte del credito a livello di segmento. Il CCR di questa traiettoria è 0.23; per una traiettoria riuscita è 2.95. Lo 0.84 globale è il risultato della combinazione.
Quindi il CCR misura la concentrazione del valore assoluto del gradiente, non quali azioni siano state ricompensate. Un CCR basso non è un obiettivo progettuale: è un effetto collaterale dell'attribuzione densa all'interno dei segmenti e della sovrapposizione delle due scale. La conclusione degli autori resta valida, ed è una buona conclusione: non concentrare tutta l'energia del gradiente sui passaggi chiave. Il 2.36 di GiGPO significa che le azioni preparatorie intermedie ricevono pochissimo segnale, e sono proprio quelle a rendere possibile il raggiungimento di un traguardo.
Un punto che l'articolo non esplicita
C'è una cella insolita nella tabella di ablazione. Impostando γ=1 — credito uniforme all'interno di ogni segmento — si ottiene un punteggio di 71.8, peggiore di quello senza alcuna modellazione della ricompensa (γ=0, 81.2) e persino inferiore al 72.8 di GRPO. L'articolo lo attribuisce a "gradienti fuorvianti".
Ripercorrendo i calcoli, la risposta è più precisa. Con γ=1 ogni azione di un segmento completato riceve la stessa ricompensa, quindi ogni segmento completato, indipendentemente dalla lunghezza, ha un ritorno per passaggio esattamente pari a R_ms. Il valore di riferimento è uguale a questo valore, e:
A_seg(i,t) ≡ R_ms − R_ms = 0 for every actionIl canale a livello di segmento non è fuorviante. Si annulla identicamente, e il metodo si riduce esattamente a GRPO. Basta confrontarlo con la tabella: 71.8 contro il 72.8 di GRPO, un punto di differenza dovuto alla variabilità tra esecuzioni.
Questo ridefinisce la funzione del decadimento. Non serve solo a differenziare le azioni all'interno di un segmento; è una condizione necessaria perché il segnale a livello di segmento esista. Senza di esso, il valore di riferimento per passaggio annulla immediatamente il segnale.
Tre esperimenti che rispondono alle obiezioni più ovvie
Va riconosciuto agli autori il merito di aver anticipato le tre domande che un lettore scettico si pone:
- È soltanto clonazione del comportamento? L'SFT sulle traiettorie di un oracolo raggiunge il 43%; BEACON raggiunge il 91.4%. La politica trova strategie di esecuzione migliori di quelle dell'oracolo, quindi non sta imitando.
- I miglioramenti derivano soltanto dalla suddivisione in blocchi? La suddivisione casuale ottiene il 74.2%, appena 1.4 punti sopra GRPO. Con traguardi reali si arriva al 91.4%, una differenza di 17.2 punti. Il beneficio deriva dalla struttura intrinseca dell'attività.
- E se il rilevatore fosse inaffidabile? Eliminare casualmente il 50% dei traguardi produce comunque un 82.8%, dieci punti sopra GRPO. Il degrado è graduale.
Cosa si può trasferire alla progettazione degli agenti
BEACON è un metodo di addestramento, e la maggior parte dei prodotti, compreso il nostro, orchestra i modelli anziché addestrarli. Le formule non si trasferiscono. La diagnosi sì, e si traduce in architettura in modo sorprendentemente diretto.
Il progresso parziale deve essere uno stato primario e persistente. Il dato più incisivo dell'articolo è che il 39–47% delle esecuzioni completa sotto-obiettivi reali e riceve poi lo stesso punteggio delle esecuzioni che non hanno ottenuto nulla. Una sessione prolungata di un agente che completa tre sotto-obiettivi e poi si blocca ha lo stesso problema: se il sistema registra solo "in corso" e "completata", quei progressi vengono scartati e il nuovo tentativo riparte da zero. I traguardi forniscono il vocabolario per registrarli.
I traguardi devono derivare da effetti osservabili, non da autodichiarazioni. Il motivo per cui Φ è poco costoso è che legge transizioni di stato verificabili anziché chiedere alla politica se ha fatto progressi. Gli ambienti di esecuzione degli agenti dispongono della stessa risorsa e spesso la ignorano: un file scritto, un test terminato con codice zero, una chiamata a un connettore che ha restituito un esito positivo, un documento salvato nella base di conoscenza. Questi sono fatti verificabili. Un modello che afferma "primo passaggio completato" non lo è.
I confini dei traguardi sono punti di compattazione e ripresa con un fondamento teorico. La proprietà di Markov dei traguardi afferma che, una volta raggiunto un traguardo, ciò che è avvenuto prima conta molto meno. È una giustificazione per compattare il contesto molto migliore di "abbiamo raggiunto una soglia di token", e lo stesso confine è il punto naturale da cui riprendere dopo un fallimento.
Verificare su due scale, non su una sola. Questo è il risultato dell'ablazione che evidenzieremmo a chiunque costruisca flussi di lavoro per agenti: eliminando il segnale a livello di traiettoria, il risultato su ALFWorld scende dal 91.4% al 23.4%. Con i soli riscontri a livello di segmento, la politica rafforza comportamenti che raggiungono traguardi intermedi ma si allontanano dall'obiettivo effettivo: ogni sottoattività è eseguita magnificamente, il risultato finale è sbagliato. L'accettazione delle sottoattività e quella del risultato finale non sono intercambiabili. In particolare, il peso necessario varia a seconda dell'attività: WebShop raggiunge comunque il 67.9% senza il livello di traiettoria, perché i suoi traguardi sono strettamente allineati al successo finale; ALFWorld crolla.
Limiti, dichiarati con onestà
Il vincolo principale è la possibilità stessa di ottenere Φ. Tutti e tre i benchmark ricavano i traguardi da regole: riconoscimento di schemi nelle risposte dell'ambiente, transizioni tra pagine, segnali espliciti sui sotto-obiettivi. Contesti aperti come l'automazione del browser, il refactoring di una base di codice e la ricerca approfondita non dispongono di transizioni verificabili già pronte, e gli autori elencano l'individuazione automatica dei traguardi tra i problemi ancora aperti. Si tratta quindi di un paradigma convalidato in ambienti strutturati, non di una ricetta ingegneristica da adottare così com'è.
Anche la granularità dei traguardi è delicata: se sono troppo radi, il metodo degenera verso GRPO; se sono troppo fitti, i vantaggi dei segmenti diventano rumorosi. La proprietà di Markov è soltanto approssimata, e l'isolamento della varianza si basa su di essa. Gli esperimenti si fermano a 7B con spazi discreti di azioni testuali: il controllo continuo e i contesti con più agenti non sono stati testati.
Tuttavia, troviamo difficile contestare la tesi centrale: le attività lunghe hanno una struttura composizionale sfruttabile, e trattarla come un oggetto primario dà risultati migliori che sperare che un modello ne tenga traccia nel contesto. Stiamo applicando questo approccio al supporto delle attività a lungo orizzonte in Orkas e condivideremo altri dettagli progettuali man mano che verranno introdotti.
