원문 정보

AIMAE Team(알리바바 클라우드 AI Model Application & Engineering Team, End-User Intelligent Computing BU), Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma 외, "Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents", arXiv:2608.17319 [cs.AI], 2026-08-18 제출, 라이선스 CC BY-NC-SA 4.0, DOI 10.48550/arXiv.2608.17319. 소속: 알리바바 클라우드.

동료심사를 거치지 않은 프리프린트입니다. 원문 전문은 2026-08-20T21:48:51Z 기준 1차 출처 스냅숏(GitHub Actions 수집)으로 대조했습니다 — 세션 자체의 원문 접근(WebFetch)이 10분 간격 3회 재시도에도 전면 차단(EGRESS_BLOCKED)돼 스냅숏 폴백 절차를 따랐습니다. 저자 전원이 알리바바 클라우드 소속이고 평가 대상 모델(Wuying-Browser-Agent)도 자사 제품이라는 이해상충이 명확합니다. 다만 4B·9B·27B 세 규모의 모델 가중치를 공개한다고 밝혀, 외부 재현 가능성 쪽으로는 가산 요인입니다.

연구 개요

연구 질문은 "브라우저 에이전트를 실전 배포 조건에 맞추려면 무엇을 함께 바꿔야 하는가"입니다. 저자들은 짧고 깨끗한 시연 데이터로 학습한 에이전트가, 실수 복구까지 포함해 수십 번의 판단을 버텨야 하는 실제 배포 상황과 크게 어긋난다고 지적하며, 실행·지도학습·강화학습·평가 네 층위를 동시에 손보는 파이프라인으로 접근합니다.

구조화된 브라우저 하니스가 24종의 원자적 동작(탐색·상호작용·추출·파일·흐름제어)으로 실행 계층을 표준화하고, Reflection·UI 특화 커리큘럼 SFT(RUIC-SFT)는 성공 궤적만이 아니라 복구 궤적과 복잡한 UI 상호작용 데이터를 3단계 커리큘럼으로 학습시킵니다. Divergence-Aware Online GRPO(DAO-GRPO)는 잠재함수 기반 보상 성형과 분기 인지형 스텝 가중치로 장기 과제의 신용 할당 문제를 완화합니다. 평가에는 저자들이 직접 구축한 BrowserBench(중국어·영어 실제 웹사이트 350개 과제, 평균 37.9스텝, 254개 사이트)를 새로 도입해, 기존 벤치마크가 과소대표하는 장기·이중언어 조건을 채웠습니다.

핵심 결과

WebVoyager·Online-Mind2Web·BrowserBench(모두 최대 100스텝 예산) 기준 주요 모델의 성공률은 다음과 같습니다.

모델WebVoyagerOnline-Mind2WebBrowserBench평균
GPT-5.5(폐쇄형 최고)85.1%74.7%67.4%75.7%
GPT-580.1%67.1%61.7%69.6%
Qwen3.8-Max(기존 오픈소스 1위)77.8%68.9%64.3%70.3%
Qwen3.5-397B-A17B(베이스 계열 최대)70.8%54.4%44.3%56.5%
Wuying-Browser-Agent-27B80.6%66.7%65.1%70.8%
Wuying-Browser-Agent-9B64.0%45.5%42.9%50.8%

Wuying-Browser-Agent-27B는 오픈소스 모델 중 평균 70.8%로 1위이며, 기존 최고 오픈소스 모델 Qwen3.8-Max(70.3%)를 근소하게 앞서고 폐쇄형 GPT-5(69.6%)에도 근접합니다. 다만 가장 강한 폐쇄형 모델 GPT-5.5(75.7%)에는 미치지 못합니다. 세 벤치마크 중 평균 스텝 수가 가장 긴 BrowserBench에서는 GPT-5.5조차 67.4%에 그쳐, 100%p에서 이 값을 뺀 32.6%p, 즉 대략 셋 중 하나의 과제를 완주하지 못합니다 — 논문이 "가장 강한 폐쇄형 에이전트도 대략 3분의 1의 과제에서 실패한다"고 명시한 대목과 일치합니다.

과제가 어렵고 길수록 온라인 강화학습(DAO-GRPO)의 기여가 커지는 패턴도 확인됩니다. 9B 백본·BrowserBench 기준으로, 원문에 명시된 개선폭을 단계별로 더하면 다음과 같습니다.

난이도Qwen3.5-9B(기반)+RUIC-SFT+DAO-GRPO(최종)
쉬움38.1%51.4%52.4%(+1.0%p)
보통17.9%42.9%45.0%(+2.1%p)
어려움14.3%18.1%30.5%(+12.4%p)

괄호 안 수치는 RUIC-SFT 대비 DAO-GRPO가 추가로 기여한 폭이며, 원문에 그대로 명시돼 있습니다. 과제 길이 기준으로도 같은 패턴이 나타나 15~25스텝 구간은 DAO-GRPO 기여가 +1.1%p에 그친 반면(이 구간은 RUIC-SFT만으로 이미 +22.2%p를 얻음), 50스텝을 초과하는 구간에서는 13.3%→26.7%로 +13.4%p가 더해져 전체 구간 중 가장 큰 폭을 기록했습니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 첫째, 영어 중심의 WebVoyager, 시간에 따라 페이지가 바뀌는 Online-Mind2Web, 이중언어 실전 웹인 BrowserBench까지 성격이 다른 세 벤치마크에서 순위 방향이 일관됩니다. 둘째, 난이도·과제 길이별로 세분화한 결과를 함께 제시해, 평균 점수 뒤에 숨은 편차를 드러냅니다. 셋째, 보상 성형에 쓰인 LLM 기반 판정기(분기 추정기·진행도 추정기)와 평가 판정기의 신뢰도를 각각 인간 라벨(100~500건 표본)과 대조해 수치(정확 일치 61%, ±1스텝 78%, 진행도 판정 인간-모델 상관 0.81 등)로 공개했습니다.

감안할 점도 뚜렷합니다. 저자 전원이 알리바바 클라우드 소속이고 평가 대상 모델도 자사 제품이라는 상업적 이해관계가 명확합니다. 주 신규 벤치마크(BrowserBench)를 같은 저자들이 직접 설계·채점해, 저자들의 모델에 유리하게 구성됐을 가능성을 완전히 배제할 수 없습니다(다만 외부 제작 벤치마크인 WebVoyager·Online-Mind2Web에서도 유사한 상위권 순위가 재현됩니다). 위 세 신뢰도 검증(판정기 정확도, 인간-모델 상관)도 모두 저자 자체 수행으로, 외부 재현은 아직 없습니다. 상반 증거로는 논문 스스로 밝히듯 폐쇄형 GPT-5.5가 평균 75.7%로 27B 모델(70.8%)보다 여전히 높아, "오픈소스 신기록"이라는 주장이 폐쇄형 모델까지 포함하면 성립하지 않는다는 점을 들 수 있습니다. 시행 횟수·분산 보고는 없어, 표에 적힌 차이가 실행 간 변동을 얼마나 넘어서는지는 판단하기 어렵습니다.

리뷰어 판단

첫째, "오픈소스 1위"라는 헤드라인보다 실무적으로 더 중요한 수치는 BrowserBench의 절대 성공률 65.1%라고 판단합니다. 열 번 중 여섯 번만 완료된다는 뜻이며, 사람 없이 장기 브라우저 작업을 전면 위임하기엔 아직 이릅니다. 상대 순위(1위)와 절대 수준(65.1%)을 분리해서 읽어야 실제 배포 판단에 쓸 수 있습니다.

둘째, DAO-GRPO의 기여가 어려운 과제·긴 과제에 집중된다는 패턴(어려움 +12.4%p, 50스텝 초과 +13.4%p)은 온라인 강화학습이 "이미 잘하는 부분을 더 잘하게" 만드는 것이 아니라 실제로 취약점을 보완하는 방향으로 작동한다는 유의미한 신호로 봅니다. 쉬운 과제에서 기여가 +1.0%p에 그친 것은 천장 효과이기도 하지만, 동시에 이 방법이 어디에 예산을 쓰는지 보여주는 근거이기도 합니다.

셋째, 자체 제작 벤치마크에서 자사 모델이 1위를 차지하는 구조는 경계할 지점이지만, 이 논문은 그 위험을 상당 부분 완화하는 설계를 갖췄다고 판단합니다. 제3자가 만든 WebVoyager·Online-Mind2Web에서도 순위가 크게 어긋나지 않았고, 판정기 신뢰도를 인간 라벨과 대조한 수치까지 공개했기 때문입니다. 다만 이 완화는 "무죄 증명"이 아니라 "혐의 감경" 수준이므로, 벤치마크 설계자가 최상위 모델의 저자와 같다는 사실 자체는 계속 주의해서 읽어야 합니다.

실무 적용

  • 평균 대신 구간별로 평가 — 브라우저 에이전트를 도입·비교할 때 전체 평균이 아니라 과제 길이 구간(예: 25스텝 이하 / 50스텝 초과)별로 성공률을 나눠 봅니다. 짧은 과제 성적만 보면 긴 과제의 취약점을 놓칩니다.
  • 복구 데이터는 커리큘럼 후반에 — 복구·리플렉션 학습 데이터를 초반부터 공격적으로 섞으면 오히려 성능이 떨어진다는 어블레이션(35.1% vs 커리큘럼 38.0%) 결과가 있습니다. 자체 파인튜닝 데이터 구성 시 순서를 실험 변수로 취급합니다.
  • LLM 판정기는 신뢰도를 별도 감사 — 보상·진행도 판정에 LLM을 쓴다면, 이 논문처럼 소규모 인간 라벨 표본과 대조해 일치율·상관계수를 수치로 남깁니다. "그럴듯해 보인다"가 아니라 검증된 수치로 판단 근거를 만듭니다.
  • 예산 초과는 실패로 명확히 카운트 — 100스텝 예산 내 미완료를 실패로 처리하는 평가 규칙은 실제 배포의 상호작용 비용을 반영합니다. 자체 평가 프로토콜에도 명시적 예산 상한을 두고 초과 시 실패로 집계합니다.
  • 자체 벤치마크는 제3자 벤치마크와 병기 — 새 평가 지표를 직접 만들었다면, 그 지표만으로 우위를 주장하지 말고 외부에서 만든 벤치마크에서도 같은 순위가 재현되는지 함께 보고합니다.

결론

Wuying-Browser-Agent의 성과는 하니스·SFT·온라인RL·평가를 하나의 파이프라인으로 엮어 오픈소스 브라우저 에이전트의 평균 성적을 끌어올렸다는 데 있습니다. 다만 그 개선은 절대 수준에서 여전히 부족합니다 — 자체 개발한 장기 벤치마크에서는 최상위 모델도 셋 중 하나를 놓치고, 폐쇄형 GPT-5.5보다 아직 낮습니다. 저자 전원이 평가 대상 모델의 소속사라는 이해상충과 자체 벤치마크 설계라는 두 조건을 감안하면, 이 수치는 "장기 과제일수록 격차가 커진다"는 방향 신호로 받아들이고 도입 전 자체 과제로 재확인하는 편이 안전합니다. 브라우저 에이전트를 실제 서비스에 얹을 때의 이관·폐기 리스크는 OpenAI Atlas 종료가 요구하는 브라우저 에이전트 이관 체크리스트에서 이어집니다.

참고 링크