Orkas Orkas
블로그 조사
조사

BEACON: 마일스톤으로 이끄는 장기 작업 에이전트

저장대학교 ZJU-REAL 연구실의 BEACON을 자세히 읽었습니다. 장기 에이전트가 강화학습에서 무너지는 이유를 진단하고, 기여도 귀속을 마일스톤에 연결해 해결합니다. 또한 수식을 따라가 보기 전에는 자체 설계와 모순되어 보이는 지표 하나를 보고합니다.

Title page of the paper Milestone-Guided Policy Learning for Long-Horizon Language Agents by Zixuan Wang and colleagues at Zhejiang University
장기 언어 에이전트를 위한 마일스톤 유도 정책 학습 — Wang 외, 저장대학교(ZJU-REAL), arXiv:2605.06078.

장기 에이전트, 즉 검증 가능한 완료에 도달하기까지 수십 단계를 실행하는 에이전트는 단기 에이전트와 다른 방식으로 실패합니다. 작업이 길어질수록 성능이 완만하게 떨어지는 것이 아닙니다. 절벽처럼 추락합니다.

저장대학교 ZJU-REAL 연구실의 최근 논문인 장기 언어 에이전트를 위한 마일스톤 유도 정책 학습은 직접 정책을 학습시키지 않더라도 유용할 만큼 그 추락을 정확히 진단합니다. 방법의 이름은 BEACON이며 코드는 오픈 소스입니다.

논문에서 설명하는 문제가 제품 개발 측면에서 우리가 계속 마주치는 문제와 같아 자세히 읽었습니다. 아래에서는 논문의 논지, 결과를 이해하기 위해 수식을 직접 풀어봐야 했던 부분, 에이전트 아키텍처에 적용할 수 있다고 생각하는 내용을 다룹니다.

핵심 요약 마일스톤은 긴 실행이 정직하게 진행되도록 합니다 Orkas는 이를 제품에 반영합니다. 긴 작업에서 어떤 마일스톤을 통과했고 어떤 것은 통과하지 못했는지 보고하며, 보여줄 수 없는 진척을 주장하지 않습니다.
Orkas 무료 다운로드

측정 가능한 두 가지 실패 유형

특히 인상적인 점은 논문이 방법 소개로 시작하지 않는다는 것입니다. 실패 원인 분석으로 시작합니다. ALFWorld에서 GRPO로 학습한 Qwen2.5-1.5B의 붕괴를 두 가지 정량화된 원인으로 나눕니다.

기여도의 잘못된 귀속

궤적 수준 강화학습은 실행을 평면적인 행동 시퀀스로 취급합니다. 모든 행동이 하나의 최종 점수를 공유합니다. 따라서 같은 올바른 행동도 성공한 실행에서는 양의 기울기를, 실패한 실행에서는 음의 기울기를 받습니다. 그 행동이 "옳았는지"는 그 이후에 일어난 일에 따라 달라집니다.

저자들은 이를 모순 행동 비율로 정량화합니다. 동일한 상태에서 실행되었는데도 궤적에 따라 부호가 반대인 어드밴티지를 받는 행동의 비율입니다. 최고치는 40%를 넘습니다. 이 기울기들이 상쇄되고 나면 유효 학습 신호는 20% 미만으로 떨어집니다.

비효율적인 샘플 활용

궤적을 완전 성공, 부분 성공(하위 목표를 적어도 하나 완료했지만 전체 작업은 실패), 완전 실패의 세 부류로 나눠 보세요.

  • 부분 성공은 학습 내내 샘플의 39–47%를 꾸준히 차지합니다.
  • 완전 성공은 27% 미만에 머뭅니다.

GRPO에서는 부분 성공과 완전 실패 모두 0점을 받습니다. 샘플의 73% 이상이 학습 신호를 전혀 만들지 못합니다.

실행 길이가 늘수록 두 문제가 함께 커집니다. 긴 작업은 성공 빈도가 낮아지고 부분 성공은 늘어나며, 뒤쪽의 무작위성이 기여도 귀속을 오염시킬 기회도 많아집니다. ALFWorld의 구체적 수치는 짧은 작업 76.7%, 긴 작업 53.5%입니다.

핵심 통찰: 긴 작업에는 이미 구조가 있습니다

장기 작업은 마일스톤을 경계로 여러 단계로 나뉩니다. 마일스톤은 하위 목표 완료를 나타내는 검증 가능한 상태 전이입니다. 평면적인 최적화는 이 구조를 그냥 버립니다.

저자들은 이를 마일스톤 마르코프 성질로 정식화합니다. 마일스톤 상태에 도달하면 나머지 궤적의 분포는 그곳에 도달한 전체 이력보다 남아 있는 하위 목표에 주로 의존한다는 것입니다.

열쇠를 얻고 나면 다음에 일어나는 일은 열쇠를 어떻게 찾았는지가 아니라 그것으로 무엇을 하는지에 달려 있습니다.

이 근사적 마르코프 성질 덕분에 구간별 기여도 귀속을 분리할 수 있습니다.

세 단계로 보는 방법

1. 마일스톤에서 분할

탐지기 Φ가 마일스톤 시점을 표시하고 궤적을 구간으로 나눕니다. 우리가 저평가되었다고 생각하는 설계 결정은 다음과 같습니다. Φ에는 학습된 모델도 사람의 주석도 필요하지 않습니다. 환경 피드백에서 관측 가능한 상태 변화를 직접 읽습니다. ALFWorld의 객체 상태 전이, WebShop의 페이지 전환, ScienceWorld의 명시적 하위 목표 신호입니다.

추가 모델도, 추가 롤아웃도 0개입니다. 이것이 과정 보상 모델 및 몬테카를로 가치 추정 대비 비용상 이점의 전부입니다.

2. 각 구간 내부의 시간적 보상 설계

r_t = R_ms * γ^(t_k − t)   if segment k ends in a completed milestone
    = 0                    otherwise

마일스톤으로 끝나는 구간만 보상을 받고, 그 구간 안에서는 마일스톤에 가까운 행동일수록 더 많은 보상을 받습니다. 이제 완료된 구간의 모든 행동이 신호를 지니므로 부분 성공을 더 이상 버리지 않습니다.

3. 이중 스케일 어드밴티지

궤적 수준에서는 최종 보상에 대한 표준 GRPO 정규화를 사용합니다. 핵심 아이디어는 구간 수준, 특히 비교 집단을 정의하는 방식에 있습니다.

G_k = { i : K_i ≥ k }          # only trajectories that ALSO reached milestone k

A_seg(i,t) = r_t − (1/|G_k|) · Σ_{j∈G_k}  R_k(j) / |Seg_k(j)|
                               └── group-average PER-STEP return ──┘

구간 k의 행동은 같은 마일스톤 k에 도달한 궤적하고만 비교합니다. 여기서 저자들은 분산 격리 성질을 도출합니다. 이후 구간의 성공 여부가 현재 구간의 기여도 귀속을 수학적으로 오염시킬 수 없다는 것입니다.

최종 어드밴티지는 A_traj + λ · A_seg이며 표준 PPO 클리핑 대리 목적함수로 최적화합니다. 하이퍼파라미터 γ=0.95, λ=1.0는 모든 벤치마크에서 고정하며 작업별로 조정하지 않습니다.

결과

ALFWorld, Qwen2.5-1.5B:

방법단기중기장기평균
GRPO76.773.953.572.8
GiGPO90.784.379.586.1
BEACON96.887.092.991.4

나머지 두 환경의 성공률:

방법ScienceWorldWebShop
GRPO21.156.8
GiGPO25.865.0
BEACON45.375.6

1.5B 모델은 ALFWorld(91.4 대 48.0)와 WebShop(75.6 대 23.7)에서 GPT-4o보다 높고, ScienceWorld(45.3 대 45.4)에서는 비슷한 성능을 보입니다. 공정하게 덧붙이자면 비공개 모델은 학습하지 않고 ReAct 프롬프트를 사용했습니다. 샘플 활용률은 23.7%에서 82.0%로 오르고 수렴도 빨라집니다. GRPO가 반복 120회에 도달하는 성공률 60%에 반복 50회 만에 도달합니다.

가장 설득력 있는 결과는 실행 길이에 따라 개선 폭도 커진다는 점입니다. 7B에서 GRPO 대비 상대 개선율은 짧은 작업의 +13%에서 긴 작업의 +39%로 늘지만 GiGPO는 +11%에서 +22%로만 늘어납니다. 그 이유가 중요합니다. GiGPO는 반복되는 상태로 단계 수준 비교 집단을 구성합니다. 정책이 개선되고 궤적이 다양해지면 상태 재등장이 드물어져 자신의 신호원이 약해집니다. 마일스톤 기준점은 정책이 강해져도 약해지지 않습니다.

문제가 어려워질수록 효과가 커지는 방법이라는 주장은 단순히 평균 점수가 높다는 주장보다 훨씬 강력합니다.

모순처럼 보이는 지표

논문은 기여도 집중 비율을 정의합니다. 마일스톤 행동의 평균 어드밴티지 크기를 비마일스톤 행동의 평균 크기로 나눈 값입니다. 1보다 크면 기여도가 마일스톤에 집중된다는 뜻입니다.

방법CCR
GiGPO2.36
GRPO1.37
BEACON0.84

결국 성능이 가장 좋은 방법이 핵심 단계에 기여도를 가장 적게 집중시키는 방법입니다. 이는 "마일스톤에 가까운 행동일수록 더 많은 보상을 받는다"는 설명과 정면으로 모순되는 듯합니다. 하지만 그렇지 않습니다. 두 설명은 서로 다른 양을 측정하며, 그 사이에 두 번의 변환이 있습니다.

변환 1 — 설계된 보상. 구간 안에서 보상은 실제로 마일스톤에 가까워질수록 단조 증가합니다. γ=0.95이고 구간 길이가 5라면 다섯 행동은 0.8145, 0.857, 0.9025, 0.95, 1.0을 받습니다. 하지만 이것은 보상이지 기울기에 전달되는 기여도가 아닙니다.

변환 2 — 집단 기준선 빼기. 기준선은 집단 평균 단계당 리턴(구간 리턴 ÷ 구간 길이)입니다. 구간 길이가 L이면 단계당 리턴은 (1−γ^L) / (L(1−γ))입니다.

구간 길이35810
단계당 리턴0.9510.9050.8420.803

자신의 구간은 8단계가 걸리고 집단 평균은 5단계라면 자신의 단계당 리턴은 기준선보다 낮아져 전체 구간의 어드밴티지가 음수 쪽으로 기웁니다. 의미를 잘 보세요. 헤매는 행동에 대한 페널티는 감쇠 자체에서 나오지 않고 감쇠가 단계당 기준선을 통해 작용하면서 나옵니다. 감쇠만으로는 구간 내부의 행동에 순서를 매길 뿐입니다. 이 시점에서도 완료된 구간 내부의 CCR은 여전히 1보다 큽니다.

변환 3 — 궤적 수준 항 더하기. 여기서 두 가지 비대칭 효과로 CCR이 1 아래로 떨어집니다. 첫째, 실패한 궤적의 마지막 구간은 어떤 비교 집단에도 들어가지 않습니다. G_k = {i : K_i ≥ k}이고 미완료 마지막 구간의 인덱스가 K_i + 1 > K_i이므로 해당 궤적이 제외됩니다. 마지막 구간은 구간 수준 어드밴티지를 받지 않고 온전한 크기의 궤적 수준 항만 받습니다. 그 행동들은 모두 비마일스톤 행동이므로 분모를 키웁니다. 둘째, 실패한 궤적에서는 음의 궤적 수준 항이 마일스톤 행동의 양의 구간 수준 기여도와 상쇄되어 그 크기를 0에 가깝게 줄입니다.

논문의 그림 8이 이를 확인해 줍니다. 마일스톤 S3와 S4를 완료했지만 실패한 궤적의 값은 다음과 같습니다.

변기로 이동비누 놓기 (S3✓)조리대로 이동 (S4✓)조리대로 이동거치대로 이동
GRPO−2.50−2.50−2.50−2.50−2.50
BEACON−0.92+0.51+0.32−2.20−2.20

마지막 두 값은 동일합니다 . "마지막 구간은 궤적 수준 항만 받는다"는 흔적이며, 여기서 A_traj ≈ −2.20을 바로 읽을 수 있습니다. 두 마일스톤 행동은 양수이지만 크기가 ~0.5에 불과합니다. 음의 궤적 항이 구간 수준 기여도의 대부분을 상쇄했기 때문입니다. 이 궤적의 CCR은 0.23, 성공한 궤적은 2.95입니다. 전체 값 0.84는 이들이 혼합된 결과입니다.

따라서 CCR이 측정하는 것은 기울기 크기의 집중도이지 누가 보상을 받았는지가 아닙니다. 낮은 CCR은 설계 목표가 아니라 구간 내 촘촘한 배분과 이중 스케일 중첩의 부산물입니다. 저자들의 결론은 여전히 타당하고 좋습니다. 핵심 단계에 기울기 에너지를 몰아넣지 말라는 것입니다. GiGPO의 2.36은 사이의 준비 행동이 거의 신호를 받지 못한다는 뜻이며, 바로 그 행동들이 마일스톤 도달을 가능하게 합니다.

논문이 명시하지 않은 부분

제거 실험 표에 이상한 셀이 있습니다. γ=1로 설정해 각 구간 안에서 기여도를 균등하게 주면 점수가 71.8로, 보상 설계를 전혀 하지 않은 경우(γ=0, 81.2)보다 낮고 GRPO의 72.8보다도 낮습니다. 논문은 이를 "잘못된 방향의 기울기" 탓으로 설명합니다.

수식을 풀어보면 답은 더 명확합니다. γ=1이면 완료된 구간의 모든 행동이 같은 보상을 받으므로 모든 완료 구간의 단계당 리턴은 길이에 관계없이 정확히 R_ms가 됩니다. 기준선도 이 값과 같으므로 다음이 성립합니다.

A_seg(i,t) ≡ R_ms − R_ms = 0    for every action

구간 수준 채널이 잘못된 방향을 가리키는 것이 아닙니다. 그 채널은 항등적으로 사라집니다. 따라서 이 방법은 정확히 GRPO로 환원됩니다. 표와 비교해 보세요. 71.8과 GRPO의 72.8은 1점 차이이며 실행 간 잡음 수준입니다.

이는 감쇠의 역할을 새롭게 보게 합니다. 단순히 구간 안의 행동을 구분하기 위한 것이 아니라 구간 수준 신호가 존재하기 위한 필수 조건입니다. 감쇠가 없으면 단계당 기준선이 신호를 즉시 상쇄합니다.

예상되는 반론을 해소하는 세 가지 실험

저자들이 잘한 점은 인정해야 합니다. 회의적인 독자가 던질 세 질문에 미리 답합니다.

  • 단순한 행동 복제 아닌가요? 오라클 궤적으로 SFT를 하면 43%, BEACON은 91.4%에 도달합니다. 정책이 오라클보다 나은 실행 전략을 찾으므로 모방이 아닙니다.
  • 단순히 나누기만 해서 얻는 효과 아닌가요? 무작위 분할은 74.2%로 GRPO보다 1.4점 높을 뿐입니다. 실제 마일스톤은 91.4%로 17.2점 차이입니다. 이점은 작업 고유의 구조에서 나옵니다.
  • 탐지기가 신뢰할 수 없으면 어떻게 되나요? 마일스톤의 50%를 무작위로 누락해도 82.8%로 GRPO보다 10점 높습니다. 성능은 완만하게 저하됩니다.

에이전트 설계에 적용할 수 있는 것

BEACON은 학습 방법이지만 우리 제품을 포함한 대부분의 제품은 모델을 학습시키기보다 조율합니다. 공식을 그대로 옮길 수는 없습니다. 하지만 진단은 옮길 수 있으며 놀라울 정도로 직접 아키텍처에 대응합니다.

부분 진척은 핵심적인 영속 상태로 다뤄야 합니다. 논문에서 가장 날카로운 수치는 실행의 39–47%가 실제 하위 목표를 완료하고도 아무것도 하지 않은 실행과 같은 점수를 받는다는 것입니다. 하위 목표 세 개를 완료한 뒤 정체된 장기 에이전트 세션도 같은 문제가 있습니다. 시스템이 "실행 중"과 "완료"만 기록한다면 진척은 버려지고 재시도는 0에서 시작합니다. 마일스톤은 이를 기록할 표현 수단을 줍니다.

마일스톤은 자기 보고가 아니라 관측 가능한 부수 효과에서 나와야 합니다. 탐지기 Φ의 비용이 낮은 이유는 정책에 진척 여부를 묻는 대신 검증 가능한 상태 전이를 읽기 때문입니다. 에이전트 런타임에도 같은 자원이 있지만 종종 무시합니다. 작성된 파일, 종료 코드 0의 테스트, 성공을 반환한 커넥터 호출, 지식 베이스에 저장된 문서가 그것입니다. 이것들이 객관적 사실입니다. 모델이 "1단계 완료"라고 주장하는 것은 그렇지 않습니다.

마일스톤 경계는 타당한 맥락 압축 및 재개 지점입니다. 마일스톤 마르코프 성질에 따르면 마일스톤 도달 후에는 그 이전의 중요도가 훨씬 낮아집니다. 이는 "토큰 임계값에 도달했다"보다 훨씬 나은 맥락 압축 근거이며, 같은 경계가 실패 후 재개하기에 자연스러운 체크포인트이기도 합니다.

하나가 아닌 두 수준에서 검증하세요. 에이전트 워크플로를 만드는 사람에게 특히 강조하고 싶은 제거 실험입니다. 궤적 수준 신호를 없애면 ALFWorld 성능이 91.4%에서 23.4%로 떨어집니다. 구간 수준 피드백만 있으면 정책은 중간 마일스톤을 달성하면서도 실제 목표에서 벗어나는 행동을 강화합니다. 모든 하위 작업은 훌륭히 실행했는데 결과물이 틀린 상황입니다. 하위 작업 승인과 최종 결과물 승인은 서로 대체할 수 없습니다. 필요한 가중치도 작업마다 다릅니다. WebShop은 마일스톤이 최종 성공과 밀접하게 맞물려 궤적 수준 없이도 67.9%를 유지하지만 ALFWorld는 무너집니다.

솔직하게 밝히는 한계

가장 큰 제약은 Φ를 애초에 확보할 수 있느냐입니다. 세 벤치마크 모두 환경 응답의 패턴 일치, 페이지 전환, 명시적 하위 목표 신호 같은 규칙에서 마일스톤을 도출합니다. 브라우저 자동화, 코드베이스 리팩터링, 심층 리서치처럼 개방형 환경에는 이렇게 미리 준비된 검증 가능 전이가 없으며, 저자들은 자동 마일스톤 발견을 미해결 문제로 꼽습니다. 그대로 가져다 쓸 공학적 해법보다는 구조화된 환경에서 검증된 패러다임으로 읽어야 합니다.

마일스톤의 세분화 수준에도 민감합니다. 너무 드물면 GRPO에 가까워지고 너무 촘촘하면 구간 어드밴티지에 잡음이 늘어납니다. 마르코프 성질은 근사치이며 분산 격리는 그에 의존합니다. 실험은 이산 텍스트 행동 공간의 7B에서 끝나며, 연속 제어와 멀티 에이전트 환경은 검증하지 않았습니다.

그래도 핵심 주장은 반박하기 어렵다고 봅니다. 긴 작업에는 활용 가능한 조합적 구조가 있으며, 모델이 맥락 속에서 이를 추적하길 기대하는 것보다 그 구조를 핵심 객체로 다루는 편이 낫습니다. 우리는 이 사고방식을 Orkas의 장기 작업 지원에 적용하고 있으며 구현이 진행되는 대로 설계를 더 공유하겠습니다.