원문 정보

Liming Pu, Xiaoxia Li, Yifu Liu, Teng Cao, Bin Yang, "Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents", arXiv:2609.01245 [cs.LG], 2026-09-01 제출, DOI 10.48550/arXiv.2609.01245. 학습 코드는 공개 예정(github.com/AlibabaResearch/SignalCoverageRL, 논문 제출 시점 기준 저장소 미공개).

동료심사를 거치지 않은 프리프린트이며 cs.LG로 분류돼 있습니다. 논문 본문에는 저자 소속이 명시돼 있지 않습니다. GitHub 조직명(AlibabaResearch)으로 미루어 알리바바 소속일 가능성이 있으나 확인할 방법이 없고, 자금 출처·이해상충을 밝히는 절 자체가 없습니다. 실험에 쓰인 두 백본(Qwen3-14B, Qwen3.5-9B)이 모두 알리바바가 개발한 Qwen 계열이라는 점은, 소속이 사실이라면 자사 모델 성능을 부각하는 유인으로 작용할 수 있는 대목이지만 현재로선 추정에 그칩니다. 원문 전문은 세션 egress 장애로 WebFetch 대신 2026-09-04T22:03:39Z 기준 스냅숏(docs/research-authoring/snapshots/2026-09-05/2609.01245.txt)으로 대조했습니다.

연구 개요

장기 실행 에이전트를 강화학습으로 훈련할 때 결과만 보고 보상을 주는 방식(outcome-only RL)은 작은 오픈 모델에서 곧 한계에 부딪힌다는 통념이 있습니다. 최근 연구들은 이 한계를 우회하려고 단계별 보상, SFT 사전학습, 스킬 라이브러리, 다중 에이전트 오케스트레이션 같은 장치를 훈련 주변에 덧붙였습니다. 저자들은 이 한계가 RL 자체의 한계가 아니라 훈련 방식이 만들어낸 인위적 결과라고 주장하며 두 가지 실패 원인을 짚습니다. 첫째는 신호 희소성(signal starvation) — 그룹 상대 보상 방식은 같은 과제를 여러 번 굴린 그룹 안에 성공과 실패가 섞여야 학습 신호가 나오는데, 탐색 규모가 작으면 가장 어려운(가장 유익한) 과제일수록 신호가 죽습니다. 둘째는 정책 표류(policy drift) — 한정된 과제 풀을 반복 학습하다 보면 앵커 없는 목적함수가 샘플링 분포를 무너뜨려, 신호가 희소해지는 시점에 정책 자체가 망가집니다.

제안 방법 CANOPY(Coverage-ANchored On-PolicY RL)는 두 원인에 각각 대응합니다. 탐색 확대는 롤아웃 그룹 크기를 32로 키우고 라운드당 생성 길이 상한을 없애 가장 어려운 과제까지 신호가 살아있게 하고, 표류 억제는 가벼운 KL 앵커·엄격한 온폴리시 업데이트(수집한 롤아웃을 그 스텝에서만 사용)·에이전트 자신의 행동 토큰에만 적용하는 토큰 단위 손실로 구성됩니다. 여기에 테스트 시점에는 학습 때보다 큰 상호작용 예산(턴 수·컨텍스트)으로 바꾸는 "예산 전이"를 더합니다. 평가는 장기 실행 코딩 벤치마크 AppWorld(공식 리더보드 제출)와 전이 성능 확인을 위한 SWE-bench Verified(실제 저장소 버그 수정) 두 곳에서 이뤄졌습니다.

핵심 결과

AppWorld 리더보드에서 Qwen3-14B에 CANOPY를 적용한 정책은 Test-Normal TGC 86.9, Test-Challenge TGC 67.6으로 학습된 정책(trained-policy) 부문 1위를 기록했습니다. 차순위 ESAT(Qwen3-14B, mean@8)보다 Test-Normal 11.7점, Test-Challenge 9.1점 앞섭니다. 폐쇄형 모델에 스킬 라이브러리·검색·디버깅을 두른 "학습 없는" 시스템(HCL-GP, ASSAY 등)은 더 높은 점수를 내지만, 저자들은 HCL-GP가 비표준 프로토콜이고 나머지도 훨씬 큰 백본에 기댄 결과라 직접 비교 대상이 아니라고 스스로 밝힙니다.

정책(학습됨)백본Test-Normal TGCTest-Challenge TGC
CANOPY(제안)Qwen3-14B86.967.6
ESATQwen3-14B75.258.5
LOOPQwen2.5-32B72.647.2
GVPOQwen2.5-32B72.649.4
SAGEQwen2.5-32B72.050.1

기준(훈련 예산 vs 확장 예산)이 다른 수치도 섞여 있어 구분이 필요합니다. 같은 90스텝 체크포인트를 훈련 때 예산(50턴/32k 토큰)과 확장 예산(100턴/61k 토큰)으로 각각 평가한 결과, CANOPY는 Test-Normal mean@4가 79.5에서 83.2로 올랐고, 기반 모델(Base)은 확장 예산에서도 32.4(본문 기준 훈련 예산에서는 22.8)에 그쳐 CANOPY보다 47점 넘게 낮습니다. 저자들은 이를 두고 "예산 확장이 아니라 훈련 자체가 능력을 만든다"고 해석합니다.

조건Test-Normal mean@4 / best@4Test-Challenge mean@4 / best@4
Base, 확장예산(100턴/61k)32.4 / 58.919.7 / 37.7
CANOPY, 훈련예산(50턴/32k)79.5 / 89.254.6 / 67.7
CANOPY, 확장예산(100턴/61k)83.2 / 93.566.1 / 82.5

어블레이션(구성 요소를 하나씩 원상복구)에서 진단이 실제로 맞아떨어집니다. 90스텝 재학습 기준 Test-Normal mean@4 79.5에서, 그룹 크기를 32에서 8로 줄이면 16.4점, 그레디언트 미니배치를 롤아웃 배치의 절반으로 쪼개면(두 번째 업데이트가 이전 정책이 만든 데이터를 학습) 17.4점 떨어져 가장 큰 손실을 냅니다. KL 앵커 제거 7.0점, 토큰 단위 손실 제거 5.4점, 최고난도 구간 배제 6.0점인 반면, 보상을 촘촘히 나누는 방식은 1.8점으로 가장 작았습니다. 저자들은 4회 평가 평균의 표준오차를 약 0.5점으로 추산해 16.4·17.4점은 노이즈 밖이지만 1.8점은 노이즈 경계에 가깝다고 스스로 단서를 답니다. SWE-bench Verified 전이 실험에서도 같은 방향이 재현됐습니다 — Qwen3.5-9B 해결률이 31.3%에서 47.9%(mean@4), 확장 예산에서는 50.2%까지 올랐습니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 첫째, 핵심 결과가 비공개 자체 지표가 아니라 AppWorld 공식 리더보드 제출 기록으로 외부 검증이 가능합니다. 둘째, 어블레이션 순서가 저자들이 세운 진단(신호 희소성·정책 표류)과 정확히 일치하고, 노이즈 추정치까지 함께 제시해 어느 하락폭을 믿어도 되는지 스스로 구분해 줍니다. 셋째, AppWorld에서 검증한 원칙(그룹 확대·KL 앵커·온폴리시·토큰 단위 손실)을 하이퍼파라미터는 손대면서도 원칙은 그대로 SWE-bench Verified에 옮겨 같은 방향의 개선을 재현했습니다.

감안할 점도 뚜렷합니다. 학습 코드는 "공개 예정"일 뿐 아직 저장소가 비어 있어 당장 외부 재현은 어렵습니다. 저자 소속과 자금 출처가 본문에 없어 확인할 수 없고, 백본이 저자 추정 소속사의 자체 모델이라는 점은 확인되면 이해상충 요인이 됩니다. AppWorld 학습 과제 풀이 90개뿐이라는 한계는 저자들도 향후 과제로 인정하며, 어블레이션도 변형마다 1회 학습만 수행해(반복 시드 없음) 큰 하락폭 외의 세부 순위는 신중히 읽어야 합니다. 논문 스스로도 적용 범위를 코드·터미널처럼 "프로그램으로 자동 검증 가능한" 과제로 한정하고 GUI 조작이나 개방형 과제에는 보장하지 않는다고 명시합니다.

리뷰어 판단

첫째, 이 논문에서 가장 값진 기여는 86.9라는 리더보드 순위 자체가 아니라 어블레이션이 진단과 정확히 들어맞는다는 점이라고 판단합니다. 그룹 크기·미니배치 분할처럼 저자들이 "핵심 원인"으로 지목한 두 요소가 실제로 가장 큰 하락(16.4점, 17.4점)을 냈고, 부차적이라고 주장한 보상 조밀화는 가장 작은 변화(1.8점, 노이즈 경계)에 그쳤습니다. 주장과 근거가 같은 방향으로 정렬된 드문 사례입니다.

둘째, "예산 전이가 아니라 훈련이 능력을 만든다"는 해석은 설득력 있지만 과장 소지도 있다고 봅니다. 기반 모델도 확장 예산에서 22.8에서 32.4로 40% 넘게 개선됐다는 사실은 예산 확장 자체도 무시할 수 없는 레버라는 뜻입니다. CANOPY의 우위가 "예산 전이 효과 + 훈련 효과"의 합이라는 점을 감안하면, 훈련만으로 얻는 순수 기여도는 표에 나온 격차보다 좁게 잡는 편이 안전합니다.

셋째, 적용 범위를 코드 실행·터미널 같은 "자동 검증 가능한" 도메인으로 스스로 좁힌 점(부록 J)은 이 논문을 신뢰하게 만드는 요소이자 도입 판단의 핵심 필터라고 봅니다. 검증기가 없는 개방형 과제나 사람이 결과를 봐야 하는 GUI 조작에는 신호 희소성 진단은 성립해도 "신호를 인위적으로 늘린다"는 해법 자체를 적용할 수 없습니다.

실무 적용

  • 롤아웃 그룹 크기부터 점검 — 그룹 크기를 8에서 32로 늘리는 것만으로 16점 이상의 성능 차이가 났습니다. 자체 RL 파이프라인의 그룹 크기가 이 논문 기준으로 작다면 가장 먼저 늘려볼 레버입니다.
  • 온폴리시 유지가 KL 앵커보다 우선 — 그레디언트 미니배치를 롤아웃 배치보다 작게 쪼개 오프폴리시 성격을 섞는 관행이 KL 앵커 제거보다 더 큰 손실(17.4 대 7.0)을 냈습니다. 배치 구성을 먼저 점검하는 편이 비용 대비 효과가 큽니다.
  • 보상 설계에 과투자하지 않기 — 보상을 촘촘히 나누는 작업은 이 논문에서 가장 적은 개선(1.8점, 저자도 노이즈 경계로 인정)만 냈습니다. 탐색·표류 문제를 먼저 해결한 뒤에도 남는 병목일 때만 투자할 항목입니다.
  • 도입 전 검증 가능 도메인인지 확인 — 자동 검증기(유닛 테스트, 상태 비교)가 있는 코드·터미널형 과제에만 이 원칙이 검증됐습니다. 사람 평가가 필요한 과제에는 그대로 옮기지 않습니다.
  • 공개 리더보드로 자체 성과를 교차 검증 — 비공개 벤치마크보다 AppWorld·SWE-bench Verified처럼 외부에서 재현 가능한 공식 리더보드에 결과를 올려 비교하는 편이 이 논문처럼 신뢰를 얻기 쉽습니다.

결론

CANOPY의 기여는 새로운 알고리즘이 아니라 "결과만 보는 RL이 안 되는 이유"를 재진단한 데 있습니다. 신호 희소성과 정책 표류라는 두 실패를 그룹 확대와 온폴리시·KL 앵커로 정면 대응했더니, 14B급 오픈 모델이 훨씬 큰 폐쇄형 백본을 두른 학습 없는 시스템들 사이에서 학습된 정책 중 1위에 올랐고, 같은 원칙이 소프트웨어 저장소 수정 과제로도 옮겨갔습니다. 다만 코드는 아직 공개되지 않았고 저자 소속·이해상충은 확인할 수 없으며, 적용 범위는 스스로 인정하듯 자동 검증 가능한 도메인으로 한정됩니다. 에이전트에게 얼마나 많은 상호작용 예산을 줄지 운영 관점에서 다루는 논의는 메모리형 에이전틱 RAG 실전 도입 체크리스트에서 이어집니다.

참고 링크