Orkas Orkas
Startseite Blog Forschung
Recherche

BEACON: Meilensteingestützte Agenten für langwierige Aufgaben

Eine genaue Lektüre von BEACON aus dem ZJU-REAL-Labor der Zhejiang University. Es erklärt, warum Agenten für langfristige Aufgaben unter Reinforcement Learning zusammenbrechen, behebt das durch eine an Meilensteinen verankerte Zuordnung von Lernerfolg und berichtet eine Metrik, die ihrem eigenen Entwurf zu widersprechen scheint, bis man die Mathematik nachvollzieht.

Title page of the paper Milestone-Guided Policy Learning for Long-Horizon Language Agents by Zixuan Wang and colleagues at Zhejiang University
Meilensteingesteuertes Policy-Lernen für Sprachagenten mit langfristigen Aufgaben — Wang et al., Zhejiang University (ZJU-REAL), arXiv:2605.06078.

Agenten für langfristige Aufgaben — solche, die Dutzende Schritte ausführen, bevor etwas nachweislich abgeschlossen ist — scheitern anders als Agenten für kurze Aufgaben. Mit zunehmender Aufgabenlänge nimmt ihre Leistung nicht allmählich ab. Sie bricht abrupt ein.

Ein aktueller Fachartikel des ZJU-REAL-Labors der Zhejiang University, Meilensteingestütztes Strategielernen für Sprachagenten mit langfristigen Aufgaben, diagnostiziert diesen Einbruch präzise genug, um auch dann nützlich zu sein, wenn Sie nie selbst eine Strategie trainieren. Die Methode heißt BEACON; der Code ist Open Source.

Wir haben ihn genau gelesen, weil wir produktseitig immer wieder auf dasselbe Problem stoßen. Es folgen die Argumentation des Fachartikels, eine Stelle, an der wir die Mathematik durcharbeiten mussten, um ein Ergebnis einzuordnen, und unsere Einschätzung, was sich auf die Agentenarchitektur übertragen lässt.

Die Kurzfassung Meilensteine halten einen langen Lauf auf Kurs Orkas setzt dies im Produkt um: Eine lange Aufgabe meldet, welche Meilensteine erreicht wurden und welche nicht, und behauptet keinen Fortschritt mehr, den sie nicht zeigen kann.
Orkas herunterladen — kostenlos

Zwei Fehlermuster, beide messbar

Am meisten schätzen wir, dass der Fachartikel nicht mit einer Methode beginnt, sondern mit einer Untersuchung des Scheiterns: Qwen2.5-1.5B, mit GRPO auf ALFWorld trainiert, dessen Zusammenbruch in zwei quantifizierte Ursachen zerlegt wird.

Falsche Zuordnung von Erfolgsbeiträgen

Reinforcement Learning auf Trajektorienebene behandelt einen Lauf als flache Aktionsfolge. Alle Aktionen teilen eine einzige abschließende Bewertung. Dieselbe richtige Aktion erhält deshalb in einem erfolgreichen Lauf einen positiven Gradienten und in einem gescheiterten einen negativen. Ob sie „richtig“ war, hängt davon ab, was danach geschah.

Die Autoren quantifizieren dies als Contradictory Action Ratio: den Anteil der Aktionen, die über Trajektorien hinweg Advantages mit entgegengesetztem Vorzeichen erhalten, obwohl sie in identischen Zuständen ausgeführt wurden. Er erreicht Spitzenwerte von über 40%. Nachdem sich diese Gradienten aufheben, sinkt das effektive Lernsignal auf unter 20%.

Ineffiziente Stichprobennutzung

Teilen wir die Trajektorien in drei Gruppen ein: vollständiger Erfolg, Teilerfolg — mindestens ein Teilziel erreicht, Aufgabe dennoch gescheitert — und vollständiges Scheitern:

  • Teilerfolge machen während des gesamten Trainings konstant 39–47% der Stichproben aus.
  • Vollständige Erfolge bleiben unter 27%.

Unter GRPO erhalten ein Teilerfolg und vollständiges Scheitern beide null Punkte. Über 73% der Stichproben erzeugen überhaupt kein Lernsignal.

Beide Probleme verstärken sich mit längerem Zeithorizont: Lange Aufgaben gelingen seltener, erzeugen also mehr Teilerfolge, und nachgelagerter Zufall bekommt mehr Gelegenheiten, die Beitragszuordnung zu verfälschen. Konkret in ALFWorld: 76.7% bei kurzen Aufgaben, 53.5% bei langen.

Die Erkenntnis: Lange Aufgaben haben bereits eine Struktur

Langfristige Aufgaben zerfallen in Phasen, begrenzt durch Meilensteine — überprüfbare Zustandsübergänge, die den Abschluss von Teilzielen markieren. Eine flache Optimierung verwirft diese Struktur schlicht.

Die Autoren formalisieren dies als Meilenstein-Markov-Eigenschaft: Sobald ein Meilensteinzustand erreicht ist, hängt die Verteilung der restlichen Trajektorie hauptsächlich davon ab, welche Teilziele noch offen sind, nicht vom vollständigen bisherigen Verlauf.

Sobald Sie den Schlüssel haben, hängt das Weitere davon ab, was Sie damit tun — nicht davon, wie Sie ihn gefunden haben.

Diese näherungsweise Markov-Eigenschaft ermöglicht es, die Beitragszuordnung zwischen Segmenten zu entkoppeln.

Die Methode in drei Schritten

1. An Meilensteinen aufteilen

Ein Detektor Φ markiert Meilenstein-Zeitschritte und zerlegt die Trajektorie in Segmente. Die aus unserer Sicht unterschätzte Designentscheidung: Φ benötigt weder ein gelerntes Modell noch menschliche Annotationen. Er liest beobachtbare Zustandsänderungen direkt aus dem Umgebungsfeedback — Objektzustandsübergänge in ALFWorld, Seitenwechsel in WebShop und explizite Teilzielsignale in ScienceWorld.

Keine zusätzlichen Modelle, keine zusätzlichen Rollouts. Darin liegt der gesamte Kostenvorteil gegenüber Prozess-Belohnungsmodellen und Monte-Carlo-Wertschätzung.

2. Zeitabhängige Belohnungsformung innerhalb jedes Segments

r_t = R_ms * γ^(t_k − t)   if segment k ends in a completed milestone
    = 0                    otherwise

Nur Segmente, die in einem Meilenstein enden, erhalten eine Belohnung. Innerhalb eines solchen Segments bekommen Aktionen näher am Meilenstein mehr. Jede Aktion in einem abgeschlossenen Segment trägt nun ein Signal, sodass Teilerfolge nicht mehr verworfen werden.

3. Advantage auf zwei Ebenen

Die Trajektorienebene verwendet die standardmäßige GRPO-Normalisierung der abschließenden Belohnungen. Auf Segmentebene liegt die eigentliche Idee — darin, wie die Vergleichsgruppe definiert wird:

G_k = { i : K_i ≥ k }          # only trajectories that ALSO reached milestone k

A_seg(i,t) = r_t − (1/|G_k|) · Σ_{j∈G_k}  R_k(j) / |Seg_k(j)|
                               └── group-average PER-STEP return ──┘

Aktionen in Segment k werden nur mit Trajektorien verglichen, die ebenfalls Meilenstein k erreicht haben. Daraus leiten die Autoren eine Eigenschaft der Varianzisolation ab: Ob spätere Segmente gelingen oder scheitern, kann mathematisch die Beitragszuordnung des aktuellen Segments nicht verfälschen.

Der endgültige Advantage lautet A_traj + λ · A_seg und wird mit der üblichen begrenzten PPO-Ersatzzielfunktion optimiert. Die Hyperparameter γ=0.95, λ=1.0 sind über alle Benchmarks fest — ohne aufgabenspezifische Abstimmung.

Ergebnisse

ALFWorld, Qwen2.5-1.5B:

MethodeKurzMittelLangMittelwert
GRPO76.773.953.572.8
GiGPO90.784.379.586.1
BEACON96.887.092.991.4

Erfolgsrate in den beiden anderen Umgebungen:

MethodeScienceWorldWebShop
GRPO21.156.8
GiGPO25.865.0
BEACON45.375.6

Das 1.5B-Modell übertrifft GPT-4o in ALFWorld (91.4 gegenüber 48.0) und WebShop (75.6 gegenüber 23.7) und liegt in ScienceWorld gleichauf (45.3 gegenüber 45.4). Eine faire Einschränkung: Die geschlossenen Modelle werden mit ReAct gepromptet, nicht trainiert. Die Stichprobennutzung steigt von 23.7% auf 82.0%, und die Konvergenz ist schneller — 60% Erfolg bis Iteration 50, wofür GRPO Iteration 120 benötigt.

Das überzeugendste Ergebnis ist, dass die Gewinne mit dem Zeithorizont wachsen. Bei 7B steigt die relative Verbesserung gegenüber GRPO von +13% bei kurzen Aufgaben auf +39% bei langen; GiGPO steigt nur von +11% auf +22%. Der Grund ist wichtig: GiGPO bildet Vergleichsgruppen auf Schrittebene aus wiederholten Zuständen. Wenn eine Strategie besser wird und ihre Trajektorien vielfältiger werden, kehren Zustände seltener wieder — ihre eigene Signalquelle erodiert. Meilensteinanker verlieren nicht an Wirkung, wenn die Strategie stärker wird.

Eine Methode, deren Nutzen mit der Schwierigkeit des Problems wächst, ist eine viel stärkere Aussage als ein höherer Durchschnittswert.

Die Kennzahl, die wie ein Widerspruch aussieht

Der Fachartikel definiert eine Credit Concentration Ratio — den durchschnittlichen Betrag des Advantages für Meilensteinaktionen geteilt durch den für andere Aktionen. Ein Wert über 1 bedeutet, dass sich die Beitragszuordnung auf Meilensteine konzentriert.

MethodeCCR
GiGPO2.36
GRPO1.37
BEACON0.84

Die leistungsstärkste Methode konzentriert die Beitragszuordnung also am wenigsten auf Schlüsselschritte. Das wirkt wie ein direkter Widerspruch zu „Aktionen näher am Meilenstein bekommen mehr Belohnung“. Ist es aber nicht. Beide Aussagen messen unterschiedliche Größen, zwischen denen zwei Transformationen liegen.

Transformation 1 — geformte Belohnung. Innerhalb eines Segments steigt die Belohnung zum Meilenstein hin tatsächlich monoton. Bei γ=0.95 und einem Segment der Länge 5 erhalten die fünf Aktionen 0.8145, 0.857, 0.9025, 0.95, 1.0. Das ist jedoch die Belohnung, nicht der im Gradienten ankommende Beitrag.

Transformation 2 — die Gruppen-Baseline abziehen. Die Baseline ist die gruppengemittelte Rendite pro Schritt (Segmentrendite ÷ Segmentlänge). Für ein Segment der Länge L beträgt die Rendite pro Schritt (1−γ^L) / (L(1−γ)):

Segmentlänge35810
Rendite pro Schritt0.9510.9050.8420.803

Wenn Ihr Segment 8 Schritte benötigte, die Gruppe aber im Mittel 5, liegt Ihre Rendite pro Schritt unter der Baseline, und der Advantage des gesamten Segments wird ins Negative verschoben. Das bedeutet: Die Strafe für Umwege entsteht nicht durch den Abfall selbst, sondern durch dessen Wirkung über die Baseline pro Schritt. Der Abfall allein ordnet Aktionen nur innerhalb eines Segments. An diesem Punkt ist die CCR innerhalb eines abgeschlossenen Segments noch größer als 1.

Transformation 3 — den Term auf Trajektorienebene hinzufügen. Hier fällt die CCR durch zwei asymmetrische Effekte unter 1. Erstens gehört das Restsegment einer gescheiterten Trajektorie überhaupt keiner Vergleichsgruppe an: Da G_k = {i : K_i ≥ k} gilt und der unvollständige Rest den Index K_i + 1 > K_i hat, ist diese Trajektorie ausgeschlossen. Der Rest erhält keinen Advantage auf Segmentebene, sondern nur den Term auf Trajektorienebene in voller Höhe. Jede dieser Aktionen ist keine Meilensteinaktion und vergrößert daher den Nenner. Zweitens hebt bei gescheiterten Trajektorien der negative Term auf Trajektorienebene den positiven Segmentbeitrag für Meilensteinaktionen teilweise auf und drückt deren Betrag gegen null.

Abbildung 8 des Fachartikels bestätigt das. Für eine gescheiterte Trajektorie, die die Meilensteine S3 und S4 erreichte:

zur Toilette gehenSeifenstück ablegen (S3✓)zur Ablage gehen (S4✓)zur Ablage gehenzum Halter gehen
GRPO−2.50−2.50−2.50−2.50−2.50
BEACON−0.92+0.51+0.32−2.20−2.20

Die letzten beiden Werte sind identisch — der Fingerabdruck von „das Restsegment erhält nur den Term auf Trajektorienebene“. Daraus lässt sich A_traj ≈ −2.20 ablesen. Die beiden Meilensteinaktionen sind positiv, betragen aber nur etwa 0.5, weil der negative Trajektorienterm den Großteil des Segmentbeitrags aufgezehrt hat. Die CCR dieser Trajektorie beträgt 0.23, bei einer erfolgreichen Trajektorie 2.95. Der globale Wert 0.84 ist die Mischung.

Die CCR misst also die Konzentration des Gradientenbetrags, nicht, wer belohnt wurde. Eine niedrige CCR ist kein Entwurfsziel, sondern ein Nebenprodukt dichter Zuordnung innerhalb von Segmenten plus Kombination zweier Ebenen. Die Schlussfolgerung der Autoren gilt weiterhin und ist gut: Konzentrieren Sie nicht Ihre gesamte Gradientenenergie auf die Schlüsselschritte. Die 2.36 von GiGPO bedeuten, dass die vorbereitenden Aktionen dazwischen fast kein Signal erhalten — dabei ermöglichen gerade sie das Erreichen eines Meilensteins.

Was der Fachartikel nicht ausdrücklich sagt

In der Ablationstabelle gibt es eine merkwürdige Zelle. Mit γ=1, also gleichmäßiger Beitragszuordnung innerhalb jedes Segments, ergibt sich 71.8. Das ist schlechter als ganz ohne Formung (γ=0, 81.2) und sogar unter den 72.8 von GRPO. Der Fachartikel erklärt dies mit „irreführenden Gradienten“.

Rechnet man es durch, ist die Antwort präziser. Bei γ=1 erhält jede Aktion in einem abgeschlossenen Segment dieselbe Belohnung. Jedes abgeschlossene Segment hat daher unabhängig von seiner Länge eine Rendite pro Schritt von genau R_ms. Die Baseline entspricht ihr, und:

A_seg(i,t) ≡ R_ms − R_ms = 0    for every action

Der Kanal auf Segmentebene führt nicht in die Irre. Er verschwindet identisch, und die Methode reduziert sich exakt auf GRPO. Der Vergleich mit der Tabelle bestätigt das: 71.8 gegenüber 72.8 bei GRPO — ein Punkt Unterschied, also Schwankung zwischen Läufen.

Damit bekommt der Abfall eine andere Bedeutung. Es geht nicht nur darum, Aktionen innerhalb eines Segments zu unterscheiden. Er ist eine notwendige Bedingung dafür, dass das Signal auf Segmentebene überhaupt existiert. Ohne ihn hebt die Baseline pro Schritt das Signal unmittelbar auf.

Drei Experimente, die die offensichtlichen Einwände ausräumen

Anerkennung, wo sie verdient ist: Die Autoren nehmen die drei Fragen skeptischer Leser vorweg:

  • Ist das nur Verhaltensklonen? SFT auf Orakeltrajektorien erreicht 43%, BEACON 91.4%. Die Strategie findet bessere Ausführungswege als das Orakel, imitiert also nicht bloß.
  • Entstehen die Gewinne allein durch das Aufteilen? Zufällige Aufteilung erreicht 74.2%, nur 1.4 Punkte über GRPO. Echte Meilensteine erreichen 91.4% — ein Abstand von 17.2 Punkten. Der Nutzen entsteht aus der inneren Aufgabenstruktur.
  • Was, wenn der Detektor unzuverlässig ist? Selbst wenn zufällig 50% der Meilensteine entfernt werden, bleiben 82.8%, zehn Punkte über GRPO. Der Leistungsabfall verläuft allmählich.

Was sich auf Agentendesign übertragen lässt

BEACON ist eine Trainingsmethode. Die meisten Produkte, unseres eingeschlossen, orchestrieren Modelle, statt sie zu trainieren. Die Formeln lassen sich nicht übertragen. Die Diagnose schon, und sie lässt sich überraschend direkt auf die Architektur abbilden.

Teilfortschritt muss ein vollwertiger, dauerhaft gespeicherter Zustand sein. Die aussagekräftigste Zahl des Fachartikels: 39–47% der Läufe erreichen echte Teilziele und werden anschließend genauso bewertet wie Läufe, die nichts getan haben. Eine lange Agentensitzung, die drei Teilziele abschließt und dann stecken bleibt, hat dasselbe Problem: Erfasst das System nur „läuft“ und „fertig“, wird dieser Fortschritt verworfen, und der Wiederholungsversuch beginnt bei null. Meilensteine liefern das Vokabular, um ihn festzuhalten.

Meilensteine sollten aus beobachtbaren Nebenwirkungen entstehen, nicht aus Selbstauskünften. Φ ist günstig, weil es überprüfbare Zustandsübergänge liest, statt die Strategie nach Fortschritt zu fragen. Agentenlaufzeiten verfügen über dasselbe Potenzial und ignorieren es oft: eine geschriebene Datei, ein Test mit Exit-Code null, ein erfolgreicher Konnektoraufruf, ein in die Wissensdatenbank übernommenes Dokument. Das sind gesicherte Tatsachen. Die Behauptung eines Modells „Schritt eins abgeschlossen“ ist keine.

Meilensteingrenzen sind sachlich begründete Punkte zum Verdichten und Fortsetzen. Die Meilenstein-Markov-Eigenschaft besagt, dass nach dem Erreichen eines Meilensteins das Vorherige viel weniger wichtig ist. Das begründet Kontextverdichtung weit besser als „wir haben einen Token-Schwellenwert erreicht“. Dieselbe Grenze ist der natürliche Kontrollpunkt zum Fortsetzen nach einem Fehler.

Auf zwei Ebenen prüfen, nicht auf einer. Diese Ablation würden wir für alle hervorheben, die Agentenabläufe bauen: Entfernt man das Signal auf Trajektorienebene, fällt ALFWorld von 91.4% auf 23.4%. Mit ausschließlich segmentbezogenem Feedback verstärkt die Strategie Verhalten, das Zwischenmeilensteine erreicht, sich aber vom eigentlichen Ziel entfernt — jede Teilaufgabe hervorragend ausgeführt, das Endergebnis falsch. Die Abnahme von Teilaufgaben und die Abnahme des Endergebnisses ersetzen einander nicht. Bemerkenswert ist, dass die nötige Gewichtung je nach Aufgabe variiert: WebShop erreicht ohne Trajektorienebene noch 67.9%, weil seine Meilensteine eng mit dem Enderfolg übereinstimmen; ALFWorld bricht zusammen.

Ehrlich benannte Grenzen

Die größte Einschränkung ist, ob Φ überhaupt ermittelt werden kann. Alle drei Benchmarks leiten Meilensteine aus Regeln ab — Mustervergleich bei Umgebungsantworten, Seitenwechsel, explizite Teilzielsignale. Offene Aufgaben wie Browserautomatisierung, Refactoring einer Codebasis oder tiefgehende Recherche haben keine solchen fertigen, überprüfbaren Übergänge. Die Autoren nennen die automatische Erkennung von Meilensteinen als offenes Problem. Das ist ein in strukturierten Umgebungen validiertes Paradigma, kein unverändert übernehmbares Entwicklungsrezept.

Auch die Granularität der Meilensteine ist empfindlich: Sind sie zu selten, nähert sich die Methode GRPO; sind sie zu dicht, werden die Segment-Advantages verrauscht. Die Markov-Eigenschaft gilt nur näherungsweise, und die Varianzisolation beruht darauf. Die Experimente enden bei 7B mit diskreten Textaktionsräumen — kontinuierliche Steuerung und Mehragentenszenarien sind ungetestet.

Dennoch lässt sich die Kernaussage aus unserer Sicht kaum bestreiten: Lange Aufgaben haben eine nutzbare kompositionelle Struktur. Diese als vollwertiges Objekt zu behandeln ist besser, als zu hoffen, dass ein Modell sie im Kontext verfolgt. Wir wenden diesen Gedanken auf die Unterstützung langfristiger Aufgaben in Orkas an und werden mehr über den Entwurf berichten, sobald er umgesetzt wird.