원문 정보

Alexander Gill, Md Farhan Ishmam, Xuyen Nguyen, Neha Bhat, Parker Henry DeYoung, Fateme Hashemi Chaleshtori, Nathan Stringham, Kenneth Marino, Ana Marasović, "The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge", arXiv:2609.30604 [cs.CL], 2026-09-24 제출, DOI 10.48550/arXiv.2609.30604. 소속: 유타대학교(University of Utah).

동료심사를 거치지 않은 프리프린트입니다(cs.CL, 학회·저널 채택 표기 없음). 저자 전원이 유타대학교 소속으로 평가 대상 모델·하니스 제작사와 직접적 이해관계는 없습니다. 다만 자금 출처는 밝혀 둘 필요가 있습니다 — 벤치마크 구축 자체는 구글이 자금을 지원했고, 산출물 플랫폼도 구글 워크스페이스(Docs·Sheets·Slides)입니다. 저자들은 이 구조적 이점을 의식해 구글 자체 모델은 평가 대상에서 제외했다고 밝힙니다. 또한 Anthropic과 OpenAI가 벤치마킹용 API 크레딧을 후원했는데, 두 회사의 모델(Claude Opus 4.7, GPT-5.5)이 바로 평가 대상에 포함돼 있어 완전히 무관하다고 보기는 어렵습니다. 원문 전문은 세션 이그레스 장애로 직접 열람하지 못해, GitHub Actions가 2026-09-28T22:32:00Z에 받아 둔 1차 출처 HTML 전문 스냅숏(하루 전 수집분)으로 표·수치를 대조했습니다.

연구 개요

연구 질문은 하나로 모입니다. 웹에서 정보를 찾아 문서·시트·슬라이드 같은 완성된 산출물로 종합·정리·표현하는 것까지, 에이전트가 "비서" 역할을 온전히 해낼 수 있는가입니다. 기존 컴퓨터 사용 에이전트 벤치마크는 단순 검증 가능한 짧은 웹 탐색 과제나 텍스트 보고서 생성(딥리서치 벤치마크류)에 머물러, 실제 업무의 마지막 단계 — 시각·공간적 배치, 서식, 구조화 — 를 재지 않는다는 문제의식에서 출발합니다.

저자들은 KNOWS(Knowledge Navigation and Organized Web Synthesis)라는 벤치마크를 새로 만들었습니다. 과제는 110개, 실사용 시나리오를 모사한 자연어 지시문(평균 204.4단어)으로 시작해 라이브 웹 브라우저·시각언어모델(VLM)·구글 워크스페이스를 통해 문서(25개)·슬라이드(40개)·스프레드시트(45개) 산출물을 만들도록 요구합니다. 평가는 결정론적 검사(구조·서식·좌표)와 LLM/VLM 판정을 섞은 하이브리드 방식이며, 과제당 평균 5.9개 체크포인트·24.6개 세부 평가단계(전체 2,716단계)로 잘게 쪼갰습니다. 평가자 자체의 신뢰도도 검증했는데, 전문가 판정과의 일치도는 코헨의 카파 0.64(82% 일치), LLM/VLM 단독 판정 항목에서는 카파 0.69(89% 일치)였습니다.

핵심 결과

7개 모델·하니스 조합(텍스트 전용 3종, 멀티모달 2종, AI 브라우저 2종)을 평가한 결과, 완전 성공률(SR)은 최고 조합(퍼플렉시티 코멧+Claude Opus 4.7)만 2.7%(문서 유형에서 12.0%)를 기록했고 나머지 6개 조합은 전부 0%였습니다.

모델·하니스SR(전체)ASC(전체)ACF(전체)SF(전체)
GPT-5.5(텍스트만)0%20.6%41.9%38.0%
Claude Opus 4.7(텍스트만)0%6.4%17.0%13.6%
DeepSeek V4 Pro(텍스트만)0%12.6%31.1%26.4%
GPT-5.5(멀티모달)0%21.8%49.5%46.7%
Claude Opus 4.7(멀티모달)0%16.7%42.5%39.1%
ChatGPT 아틀라스(AI 브라우저)0%21.6%45.4%40.6%
퍼플렉시티 코멧(AI 브라우저)2.7%35.4%70.0%64.7%

지표 기준이 서로 다르므로 구분해 읽어야 합니다. SR은 과제 전체가 완전히 끝나야만 1점을 주는 엄격한 지표이고, ASC·ACF·SF는 체크포인트·세부단계 단위로 부분 점수를 인정하는 지표입니다. 코멧의 ACF 70.0%·SF 64.7%만 보면 준수해 보이지만, 논문이 제시한 대표 사례(그림3)는 ACF 0.54·SF 0.59를 받고도 체크포인트 완주율(ASC) 0.14에 그쳐 결과물이 "시각적으로 엉망"이라고 저자들이 직접 평가했습니다.

시각 입력의 효과도 확인됩니다. Claude Opus 4.7에 스크린샷을 더한 멀티모달 조건은 텍스트 전용 대비 ASC +10.3%p, ACF +25.5%p, SF +25.5%p 상승했습니다(검산: 16.7-6.4=10.3, 42.5-17.0=25.5, 39.1-13.6=25.5 — 표와 본문이 일치). 하니스 효과는 더 컸습니다. 같은 Claude Opus 4.7이 BrowserGym 하니스에서 코멧 하니스로 바뀌자 SR +2.7%p, ASC +18.7%p, ACF +27.5%p, SF +25.6%p 상승했습니다(검산: 35.4-16.7=18.7, 70.0-42.5=27.5, 64.7-39.1=25.6 — 일치). 모델보다 하니스(웹 탐색 인프라·행동 공간·도구 인터페이스)가 성능을 더 크게 가른다는 뜻입니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 첫째, 평가자(체크포인트·세부단계) 신뢰도를 전문가 판정과 별도로 검증(카파 0.64~0.69)했습니다. 둘째, 같은 모델을 두 하니스·두 입력 조건에 태워 비교하는 통제 구조를 갖춰 모델 효과와 하니스 효과를 어느 정도 분리했습니다. 셋째, 구글 워크스페이스 편향을 의식해 구글 자체 모델을 배제하고, 마이크로소프트 365에서 소규모 교차 플랫폼 검사(과제 5개)까지 수행했습니다.

감안할 점도 뚜렷합니다. 앞서 밝힌 대로 구글이 벤치마크 구축 자금을, Anthropic·OpenAI가 평가 대상 모델의 API 크레딧을 지원했습니다. 표본은 110개 과제로 크지 않고, 사람 기준선은 비용(과제당 약 3시간, 110개 기준 약 4,950달러 추정) 문제로 아예 보고하지 않아 "사람이라면 몇 %를 완주하는가"를 알 수 없습니다. 라이브 웹을 그대로 쓰는 설계라 평가 시점의 웹 상태에 따라 재현성이 흔들릴 수 있다는 한계도 저자들이 스스로 인정합니다. 시행 반복 없이 단일 실행 결과만 보고돼 통계적 변동 폭도 확인할 수 없습니다.

관련 연구(학술 문헌 대조)

이번 문헌의 Related Work·참고문헌 목록에 실린 서지사항을 근거로 정리했습니다. 세션 이그레스 차단으로 아래 문헌의 원문은 개별적으로 재확인하지 못했습니다.

세 문헌 모두 웹·오피스 에이전트 벤치마크의 계보를 이루지만, 검색과 산출물 종합·서식·배치를 동시에 요구하는 조합은 KNOWS가 처음이라는 저자들의 주장과 방향이 일치합니다. 장기 실행 과제의 완주율 문제를 다룬 장기 실행 브라우저 에이전트 배포 판단 기준과 함께 읽으면, "탐색은 되는데 완성은 안 되는" 문제가 벤치마크마다 반복해서 드러나고 있음을 알 수 있습니다.

리뷰어 판단

첫째, 이 논문에서 가장 실무적으로 중요한 결과는 2.7%라는 완전 성공률이 아니라 부분 점수와 실사용 가능성의 괴리라고 판단합니다. ACF·SF가 70%에 가까워도 체크포인트 완주율(ASC)이 0.14에 그친 사례가 나온다는 것은, 팀들이 부분 점수만 보고 "거의 다 됐다"고 오판하기 쉽다는 뜻입니다. 배포 판단 기준을 평균 지표 하나로 세우면 위험하고, ASC처럼 체크포인트 단위 완주를 요구하는 지표를 반드시 병행해야 한다고 봅니다.

둘째, 하니스가 모델보다 성능을 더 크게 좌우한다는 결과(같은 Opus 4.7에서 ASC +18.7%p)는 자체 에이전트 파이프라인을 구축하는 팀에 방향을 제시합니다. 최신 모델로 갈아타는 것보다 브라우징 인프라·행동 공간·도구 인터페이스에 투자하는 편이 더 큰 개선을 가져올 수 있다는 뜻이며, 모델 벤치마크 순위만 보고 하니스 개선을 뒤로 미루는 판단은 재고할 필요가 있습니다.

셋째, 사람 기준선을 아예 보고하지 않은 결정은 아쉽습니다. 과제당 약 3시간이라는 추정치만으로는 2.7%라는 완전 성공률이 사람과 비교해 얼마나 나쁜지 가늠하기 어렵고, 이는 독자가 수치의 심각성을 스스로 해석해야 하는 부담으로 남습니다.

실무 적용

  • 체크포인트 단위 완주율 지표 병행 — 평균 점수(ACF·SF) 대신 ASC처럼 부분 완주를 요구하는 지표를 함께 추적해 "거의 다 됐다"는 착시를 막습니다.
  • 하니스 투자 우선순위 재검토 — 모델 교체보다 브라우징 하니스·행동 공간·도구 인터페이스 개선이 더 큰 성능 이득을 낼 수 있음을 감안해 예산을 배분합니다.
  • 시각 입력 기본값화 — 텍스트 접근성 트리만으로는 시각·공간 판단이 필요한 과제에서 성능이 크게 떨어지므로, 스크린샷·VLM 경로를 기본으로 둡니다.
  • 산출물 유형별 개별 배포 기준 — 문서·시트·슬라이드마다 성공률·부분 점수 분포가 다르므로, 유형을 묶어 하나의 배포 기준을 세우지 않습니다.
  • 라이브 웹 의존 과제의 주기적 재검증 — 웹 상태가 바뀌면 평가 스크립트가 깨질 수 있으므로, 자체 평가셋에도 정기 점검·폐기 정책을 둡니다.

결론

KNOWS는 검색 이후 단계 — 정보를 종합해 문서·시트·슬라이드로 완성하는 일 — 가 지금의 프런티어 에이전트에게 여전히 열린 문제임을 수치로 보여줍니다. 최고 조합도 완전 성공은 2.7%에 그쳤고, 부분 점수가 높아 보이는 사례조차 실사용 불가능한 결과물을 내놓았습니다. 하니스가 모델보다 성능을 더 크게 가른다는 결과는 에이전트 파이프라인 투자 우선순위에 실질적 함의를 줍니다. 다만 구글·Anthropic·OpenAI의 자금·크레딧 지원, 사람 기준선 부재, 110개라는 표본 크기는 이 수치를 해석할 때 함께 고려해야 합니다. 장기 실행 과제의 완주율 문제는 장기 실행 브라우저 에이전트 배포 판단 기준에서 다른 벤치마크로 이어집니다.

참고 링크

이 리뷰에 대해 AI와 대화하기

AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.

대화창을 불러오는 중…