원문 정보
Xing Han Lù, Dheeraj Vattikonda, Sina Hajimiri, Fatemeh Pesaran Zadeh, Parishad BehnamGhader, Ghazwa Darwiche, Amirhossein Kazemnejad, Christopher Pal, Alexandre Drouin, Siva Reddy, "AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks", arXiv:2610.11050 [cs.AI], 2026-10-08 제출, DOI 10.48550/arXiv.2610.11050. 소속: ServiceNow Research, McGill University, Mila – Quebec AI Institute, ÉTS Montréal, 서울대학교, Université Laval, Polytechnique Montréal, Canada CIFAR AI Chair. 벤치마크·결과 전체 공개(github.com/ServiceNow/agenthorizon).
학회·저널 동료심사를 거치지 않은 arXiv 프리프린트입니다. 자금 출처는 캐나다 NSERC, Canada CIFAR AI Chair 프로그램, ServiceNow–Mitacs Accelerate 프로그램, RBC Borealis AI 펠로우십이 섞여 있어, 기업 자금(ServiceNow)과 공공 연구비가 함께 들어간 구조입니다. 저자 다수가 ServiceNow Research 소속이라는 점은 이해상충으로 밝혀 둘 필요가 있지만, 이번 벤치마크가 평가하는 판정자는 GPT·Gemini·Claude·Qwen·Gemma 등 전부 제3자 모델이고 ServiceNow 자체 에이전트·판정자는 포함되지 않아 자사 제품을 유리하게 평가할 직접적 유인은 약합니다. 세션 egress가 차단돼 원문 전문은 WebFetch로 직접 열람하지 못했고, GitHub Actions가 2026-10-09T22:11:46Z에 받아 둔 arXiv HTML 전문 스냅숏(2610.11050v1)으로 표·수치를 대조했습니다.
연구 개요
연구 질문은 두 가지입니다 — (1) 컴퓨터 사용 에이전트의 긴 작업 궤적에서 겉보기엔 완료된 것 같지만 실제로는 지시를 위반했거나 원치 않는 부작용을 낸 경우를, LLM 판정자가 걸러낼 수 있는가. (2) 판정자에게 도구(코드 실행·스크린샷 열람)를 주는 '에이전틱 판정'이 궤적 전체를 한 번에 보여주는 '직접판정'보다 나은가.
저자들은 3개 운영체제에서 166시간 분량의 사람 시연을 녹화한 뒤, 서로 비슷하지만 양립할 수 없는 지시문 쌍을 만들어(원래 지시문의 궤적에 '교체된' 지시문을 붙이면 실패가 되도록) 1,373건의 지시문-궤적 쌍을 구성했습니다. 품질검토·증거검토·조정을 거쳐 긍정 523건, 적대적 부정 850건으로 확정했고, 난이도에 따라 평가용 분할 AgentHorizon(AH, 528건)·AgentHorizon-Simple(AH-S, 683건), 개발용 AgentHorizon-Development(AH-D, 162건)로 나눴습니다(각 분할의 긍정+부정 합계가 표기된 전체 건수와 정확히 일치함을 확인했습니다). 11개 판정자 모델(비공개 6개, 오픈웨이트 5개)을 Claude Code·Codex·Gemini CLI·OpenHands·OpenCode 5개 하니스로 돌리는 에이전틱 판정과, 고정 스크린샷 표현을 한 번의 챗 호출로 판단하는 직접판정, 두 방식으로 각각 평가했습니다.
핵심 결과
판정 정확도는 양성(실제 성공)과 음성(적대적 실패) 각각을 동일 가중한 균형정확도로 매깁니다. 가장 어려운 분할(AH)에서 GPT-5.5+Codex가 80.9%로 11개 판정자 중 최고 성적이었고, Gemini 3.1 Pro+Gemini CLI(77.7%), Claude Opus 4.7+Claude Code(76.0%)가 뒤를 이었습니다. 오픈웨이트 중 최고는 Qwen3.6 27B+OpenCode의 70.4%입니다. 하지만 같은 모델도 도구 접근 방식(하니스)을 바꾸면 성적이 크게 흔들립니다.
| 모델 | 인터페이스 | AH 균형정확도 | AH Pos | AH Neg | AH-S 균형정확도 |
|---|---|---|---|---|---|
| GPT-5.5 | Codex(주 보고) | 80.9 | 71.8 | 90.0 | 92.6 |
| GPT-5.5 | OpenCode | 77.2 | 70.9 | 83.4 | 92.2 |
| Qwen3.6 27B | Codex | 71.6 | 70.5 | 72.8 | 94.5 |
| Qwen3.6 27B | OpenCode(주 보고) | 70.4 | 75.3 | 65.4 | 93.6 |
| Qwen3.6 27B | OpenHands | 51.2 | 58.1 | 44.2 | 89.0 |
GPT-5.5는 직접판정(68.6%)보다 Codex 하니스(80.9%)에서 12.3%p 올랐지만, Qwen3.6 27B는 반대로 직접판정(77.6%)이 OpenCode 하니스(70.4%)보다 7.2%p 높았습니다 — '도구를 주면 좋아진다'는 가정이 모델마다 반대로 작동한다는 뜻입니다. 같은 모델을 세 하니스로 비교해도(위 표의 Qwen3.6 27B) 하니스 선택 하나로 20.4%p까지 차이가 났습니다.
균형정확도보다 더 걱정스러운 수치는 실수 유형별 재현율입니다(전체 1,373건 기준). '치명적 실수'(주 목표 자체를 달성하지 못함)와 '오해'(피해 없는 그릇된 해석)는 그나마 60~90%대로 잡아내지만, '나쁜 부작용'(의도한 목표는 달성했지만 피해·위험·원치 않는 결과를 수반)의 재현율은 최고 성적인 GPT-5.5+Codex도 24.1%에 그치고, 오픈웨이트 2개 모델은 0.0%였습니다.
| 모델 | 인터페이스 | 치명적 실수 재현율 | 나쁜 부작용 재현율 | 오해 재현율 |
|---|---|---|---|---|
| GPT-5.5 | Codex | 77.7 | 24.1 | 72.9 |
| Claude Opus 4.7 | Claude Code | 75.8 | 12.1 | 71.4 |
| Gemini 3.1 Pro | Gemini CLI | 57.5 | 7.3 | 87.3 |
| Qwen3.6 27B | OpenCode | 60.4 | 5.6 | 74.3 |
| Gemma4 26B-A4B | OpenCode | 47.6 | 0.0 | 18.6 |
즉 균형정확도 80.9%라는 헤드라인 수치는 '부작용이 있는 성공'을 걸러내는 능력과는 거의 무관합니다. 저자들은 스크린샷·지시문·행동로그 중 무엇이 판정에 필요한지도 분리해 검증했습니다. 스크린샷을 빼고 텍스트 행동 로그만 남기면 균형정확도가 57.7%로 떨어지고, 지시문 자체를 제거해(이론상 판별이 불가능하도록 만든 대조군) 판정하게 하면 47.8~49.8%로 무작위 수준에 가까워집니다. 텍스트 로그만으로는 정보가 부족하며 스크린샷이 판정 신호의 핵심이라는 근거입니다. 비용 측면에서는 GPT-5.5+Codex가 궤적당 평균 0.40달러, Claude Opus 4.7+Claude Code가 0.66달러인 반면, 오픈웨이트를 자체 호스팅한 Qwen3.6 27B+OpenCode는 추가 API 비용 없이 70.4%의 균형정확도를 냈습니다(평균 입력 토큰 24만3천개로 비공개 모델 상당수의 절반 이하).
신뢰도 평가
믿을 근거는 셋입니다. 평가 설계가 지시문만 바꿔 긍정·부정 쌍을 만드는 구조라 과제 자체의 난이도 차이를 통제했고, 최종 긍정 523건은 1,700개 후보가 품질검토·증거검토·조정을 거쳐 걸러진 결과이며, 각 분할의 균형정확도 공식(양성 정확도와 음성 정확도의 평균)을 본문 수치로 직접 검산해도 모든 행에서 일치했습니다(예: GPT-5.5+Codex는 (71.8+90.0)/2=80.9, Qwen3.6 27B+OpenCode는 (75.3+65.4)/2=70.35≈70.4).
감안할 점도 뚜렷합니다. 동료심사를 거치지 않은 프리프린트이고, 앞서 밝힌 ServiceNow 자금·소속 이해상충이 있습니다. 저자들도 스스로 밝힌 한계로 — 독립적인 사람 간 평가자 일치도(inter-annotator agreement)를 따로 수집하지 않고 검토 단계 간 일치도만 쟀다는 점, 영어·3개 운영체제·스크린샷+행동로그로만 범위를 좁혔다는 점, 쌍대설계가 반복·멈춤·점진적 이탈 같은 '일반적인' 에이전트 실패는 다루지 않는다는 점을 꼽습니다. 상반 증거로 보면, 같은 1저자(Xing Han Lù)의 선행 연구 AgentRewardBench(아래 관련 연구)가 더 일반적인 웹 에이전트 궤적에서 '최고 판정자도 정밀도 70% 미만'이라고 보고한 것과 방향이 일치합니다 — 지표(정밀도 대 균형정확도)가 달라 숫자를 직접 비교할 수는 없지만, 두 벤치마크 모두 'LLM 판정자는 아직 자동화 신뢰 기준에 못 미친다'는 결론으로 수렴합니다.
관련 연구(학술 문헌 대조)
- Lù et al.(2025). AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories — 이번 논문 1저자의 선행 벤치마크로, 5개 벤치마크·4개 LLM에서 수집한 1,302개 웹 에이전트 궤적에 12개 LLM 판정자를 평가해 최고 판정자도 사람 전문가 대비 정밀도 70% 미만이라고 보고했습니다. 이번 논문은 같은 문제의식을 장기·멀티앱 컴퓨터 사용 과제로 확장하고 쌍대 적대적 설계로 '부작용' 실패 유형을 추가했습니다(선행 연구·확장).
- Zhuge et al.(2024). Agent-as-a-Judge: Evaluate Agents with Agents — 에이전트가 에이전트를 평가하는 '에이전틱 판정' 방법론을 처음 제안해, 55개 AI 개발 과제 벤치마크 DevAI에서 에이전틱 판정이 단순 LLM 판정보다 크게 낫다고 보고했습니다. 이번 논문의 '도구를 쓰는 판정자' 설계가 같은 방법론 계열이지만, 장기 컴퓨터 사용 과제에서는 도구 접근이 모델마다 반대 방향으로 작동함을 보여 전면적 우위를 부분적으로 반박합니다(선행 연구·부분 반박).
- Kuntz et al.(2025). OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents — 컴퓨터 사용 에이전트의 안전 측면(악용·프롬프트 주입·오작동)을 자동 LLM 판정자로 측정해, 그 판정자가 사람 주석과 F1 0.76~0.79로 일치한다고 보고했습니다. 이번 논문은 '성공 여부' 판정에 초점을 두고 더 어려운 쌍대설계를 쓰는데, 그 결과 부작용 탐지 재현율이 최고 24.1%까지 떨어져 같은 '판정자 신뢰성' 질문에 더 보수적인 결론을 냅니다(관련 연구·방법 대조).
세 문헌을 종합하면, LLM 판정자의 신뢰성 문제는 웹 에이전트(AgentRewardBench)·안전 판정(OS-Harm)·장기 컴퓨터 사용(이번 논문) 전반에서 반복적으로 확인되며, 평가 설계가 엄격해질수록(쌍대 적대적 구조) 판정자의 약점이 더 뚜렷하게 드러납니다.
리뷰어 판단
첫째, 이 논문에서 가장 중요한 수치는 80.9%가 아니라 '나쁜 부작용' 재현율 24.1%라고 판단합니다. 균형정확도는 양성과 음성을 동일 가중하지만, 실무에서 되돌리기 어려운 피해(잘못된 계정에 결제, 잘못된 기기 작동 등)는 '나쁜 부작용' 범주에 집중됩니다. 이 범주의 재현율이 최고 성적조차 24%대라는 것은, 현재의 LLM 판정자를 '자동 승인' 게이트로 쓰면 부작용이 있는 성공을 그대로 통과시킬 위험이 크다는 뜻이라고 봅니다.
둘째, 하니스 효과가 모델마다 반대 방향으로 나타난 현상(GPT-5.5는 도구 접근으로 개선, Qwen3.6 27B는 악화)은 '에이전틱 판정이 직접판정보다 우월하다'는 일반화를 반박하는 근거로 봅니다. 저자들도 이 비교가 하니스 전체(스크린샷 선택·컨텍스트 관리·도구 노출 방식)를 동시에 바꾸는 것이라 개별 요인을 분리하지 못한다고 인정하는데, 그렇다면 실무에서는 '모델만' 검증하기보다 '모델+하니스' 조합을 통째로 검증하는 것이 안전하다고 판단합니다.
셋째, 오픈웨이트 모델(Qwen3.6 27B)이 직접판정 방식에서 77.6%로 비공개 모델 상당수를 웃돌면서 추가 API 비용이 없다는 점은, 판정자 선택에서 '가장 비싼 모델'이 항상 최선은 아니라는 근거로 볼 수 있습니다. 다만 ablation이 보여주듯 스크린샷 전처리 방식에 따라 오픈웨이트 모델의 성적이 민감하게 바뀌므로, 비용만 보고 결정하기보다 전처리 방식까지 포함해 검증해야 한다고 봅니다.
실무 적용
- 모델이 아니라 '모델+하니스' 조합을 통째로 검증 — 같은 모델도 도구 접근 방식에 따라 최대 20%p 이상 균형정확도가 바뀌므로, 실제 배치할 조합 그대로 테스트합니다.
- 부작용 탐지는 별도 지표로 추적 — 균형정확도 하나로는 '나쁜 부작용' 재현율이 10%대인 것이 가려집니다. 되돌리기 어려운 작동이 걸린 파이프라인은 부작용 재현율을 따로 모니터링합니다.
- 판정 파이프라인에 시각 증거(스크린샷)를 반드시 포함 — 텍스트 행동 로그만으로는 균형정확도가 57.7%까지 떨어집니다.
- 오픈웨이트 자체 호스팅 판정자를 비용 대안으로 검토 — Qwen3.6 27B는 직접판정 77.6%·OpenCode 70.4%로 비공개 모델 상당수를 추가 비용 없이 따라잡습니다.
- 양성·음성 정확도를 분리해 보고 — 균형정확도 하나만 보면 과잉승인(거짓양성)과 과잉거부(거짓음성) 경향을 구분할 수 없습니다.
결론
이 논문의 기여는 새 판정 모델이 아니라 '지금의 LLM 판정자는 장기 컴퓨터 사용 궤적에서 신뢰 기준에 못 미친다'는 정량적 반증입니다. 최고 성적(GPT-5.5+Codex 80.9%)도 완벽과는 거리가 멀고, 더 중요하게는 실무적으로 가장 위험한 실패 유형(부작용 있는 성공)을 잡아내는 재현율이 24%대에 그칩니다. 도구 접근이 모델마다 다르게 작동한다는 점도 '에이전틱 판정이 항상 낫다'는 가정을 깹니다. 자동 판정을 에이전트 QA의 최종 게이트로 쓰기 전에, 배치할 모델+하니스 조합을 실제 과제로 직접 검증하고 부작용 탐지율을 따로 추적해야 한다는 것이 이 논문이 남기는 실무 교훈입니다. 에이전트 평가 설계에서 집계 점수가 실제 실패 패턴을 가리는 문제를 운영 체크리스트 각도로 다룬 글은 에이전트 평가셋 설계 체크리스트에서 볼 수 있습니다.
참고 링크
- AgentHorizon — arXiv 초록(원문)
- 같은 논문 HTML 전문 — 표·수치 대조에 사용
- AgentRewardBench(Lù et al., 2025) — 관련 연구 원문
- Agent-as-a-Judge(Zhuge et al., 2024) — 관련 연구 원문
- OS-Harm(Kuntz et al., 2025) — 관련 연구 원문
- 에이전트 평가셋 설계 체크리스트 — sunny34.com 블로그
이 리뷰에 대해 AI와 대화하기
AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…