원문 정보

Austin Tudor David Andrews, Liam Wilkinson(공동 1저자), Jamie Heagerty, Harry Coppock, Jakob Nicolaus Foerster, Rui Ponte Costa, "CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI", arXiv:2609.02459 [cs.AI], 2026-09-02 제출. 소속: 옥스퍼드대학교, 토니 블레어 글로벌변화연구소, 구글 딥마인드, 영국 AI안보원(UK AISI)·임페리얼칼리지런던. NeurIPS 2026 Evaluations and Datasets Track에 투고돼 심사 중.

동료심사를 거치지 않은 프리프린트이며 결과가 확정되기 전 투고 단계입니다. 저자 소속에 상업 연구소(구글 딥마인드)와 정부기관(UK AISI)이 섞여 있는데, 딥마인드 소속 저자가 평가 대상 네 모델 중 하나인 제미나이의 개발사 소속이라는 점은 눈여겨볼 대목입니다. 다만 논문은 모델 순위를 매기지 않는다고 명시하고, 실제로 제미나이가 유독 유리하게 나오지도 않았습니다 — 반성-행동 격차 지표에서는 오히려 클로드가 세 모델 중 가장 낮았습니다. 별도의 자금 출처 disclosure 조항은 확인되지 않았습니다.

연구 개요

연구 질문은 두 가지입니다. 300턴 이상, 수천 회 툴 호출이 오가는 장기 호라이즌 환경에서 에이전트가 ① 전역적으로 중요한 상태를 스스로 조회하는지, ② 스스로 세운 계획을 실제로 실행하는지입니다. 저자들은 문명6(Civilization VI)을 MCP(Model Context Protocol)로 연결해 76개 툴과 29개 내레이션 함수를 노출하는 CivBench를 만들었습니다. 핵심 설계는 "정보의 존재"와 "조회 여부"를 분리한 것입니다 — 사람 플레이어에게는 화면에 저절로 보이는 정보(승리 진행도, 외교 관계 등)도 에이전트에게는 해당 툴을 직접 호출해야만 노출됩니다.

네 개 모델군(클로드 오퍼스 4.6, 제미나이 3.1 프로, GPT-5.4, Kimi-K2.5)이 23개 유효 게임(그라운드컨트롤 19, 스노우플레이크 4)을 치렀습니다. 표본이 작아 저자들도 "모델 순위가 아니라 파일럿"이라고 못박습니다. 대신 두 가지 행동 지표를 새로 정의했습니다 — 능동 모니터링율(PMR, 전략 상태 조회가 전체 툴콜에서 차지하는 비중)과 반성-행동 격차(RAG@10, 다이어리에 적은 계획이 10턴 안에 실행되는 비율)입니다.

핵심 결과

승패 집계로는 네 모델을 구분할 수 없습니다. 23게임 중 승리는 3건뿐이고 모두 그라운드컨트롤의 기술 승리였으며, 피셔 정확검정도 유의하지 않습니다(p=0.488).

모델시나리오게임 수승리패배
클로드 오퍼스 4.6그라운드컨트롤624
클로드 오퍼스 4.6스노우플레이크202
제미나이 3.1 프로그라운드컨트롤615
GPT-5.4그라운드컨트롤606
GPT-5.4스노우플레이크202
Kimi-K2.5그라운드컨트롤101
합계23320

13개 후보 지표의 급내상관계수(ICC) 분석에서도 대부분이 잡음 수준이었고, 100턴 시점 탐사율만 뚜렷이 구분력을 보였습니다(ICC=0.717, 크루스칼-왈리스 H=12.28, p=0.0065). 최종 점수·도시 수·경제 산출 등 나머지 대부분 지표는 ICC가 0에 가깝거나 음수였습니다.

집계 성과가 무력한 자리를 행동 지표가 메꿉니다. 아래 수치는 서로 기준(비율/횟수/평균)이 다르므로 나란히 비교하지 않도록 구분해 두었습니다.

지표수치기준·비고
능동 모니터링율(PMR)0.96~2.13%비-인프라 툴콜 대비 전략 모니터링 비중
승리 진행도 조회 비중0.05~0.29%
(게임당 3.7~10.0회)
플레이북 권고는 20턴마다, 실측은 30~75턴에 한 번
경고창 내 미조회 패배7 / 20건원문 프로즈 명시 수치(모델별 소계는 표 합계와 어긋나 미인용)
반성-행동 격차(RAG@10)48.2~65.8%클로드·제미나이·GPT 3개 모델, 10턴 내 계획 실행률
도시 수(T50 / T100)2.00~2.83개 / 3.00~4.67개플레이북 목표는 T50 3개 — 전 모델 미달

라벨링은 클로드 하이쿠 4.5가 맡았고, 사람 대조 50건 표본에서 일치율 92.0%(코헨 카파 0.879)로 검증했습니다.

신뢰도 평가

믿을 근거는 다음과 같습니다. 모니터링율은 게임 후반부에도 오르지 않아(부록 그림11) 일시적 컨텍스트 부족이 아니라 지속적 배분 습관임을 시사합니다. RAG 라벨링은 사람 대조로 검증됐고, 같은 계열 라벨러(클로드)가 자사 모델에 유리하게 편향됐다는 정황도 관찰되지 않았습니다. 승패·집계 점수와 행동 지표를 함께 제시해 "집계 지표의 한계"라는 주장을 스스로 증명합니다.

감안할 점도 뚜렷합니다. 표본이 23게임(모델당 1~8게임)으로 작아 저자 스스로 "대형 효과만 검출 가능한 검정력"이라고 밝힙니다. 공유 플레이북이 명시적 지침을 준 상태의 결과라 "능력 부재"가 아니라 "지침 하의 이탈"로 읽어야 하며, 플레이북 없이는 게임의 21%만 완주했다는 부연도 있습니다. 무작위·스크립트 기준선은 없고, 미조회 패배 표에서 모델별 소계 합이 총계와 1건씩 어긋나는 산술 불일치도 원문에 남아 있습니다. 이 결과는 BALROG(2025) 등 선행 연구가 보고한 "설명은 하지만 실행하지 못하는" 패턴과 수렴하며, 반박하는 선행 증거는 확인되지 않았습니다.

리뷰어 판단

집계 성과 지표가 무력화됐다는 사실 자체가 이 논문의 가장 실무적인 기여라고 판단합니다. 승률이나 정규화 점수로 벤치마크 리더보드를 매기는 관행이, 최소한 장기 호라이즌·툴 매개 과제에서는 프로덕션 신뢰도의 대리 지표로 부적합할 수 있다는 뜻이기 때문입니다.

센서리움 효과(정보는 있지만 조회하지 않는 문제)는 문명6 특유의 현상이 아니라 툴 매개 에이전트 일반에서 반복될 구조적 문제라고 봅니다. 근거는 모니터링율이 게임 후반부로 갈수록도 오르지 않았다는 관측입니다 — 이는 컨텍스트 소진이 아니라 배분 습관의 문제임을 시사합니다.

실무 적용

  • 강제 조회 스케줄러 — 전역 상태 점검을 에이전트 자율에 맡기지 말고 N턴·N호출마다 강제 호출하는 래퍼를 하니스에 넣습니다.
  • 커밋먼트 트래킹 큐 — 플래닝 리플렉션에서 나온 "다음에 할 일"을 별도 큐에 기록하고 정해진 창 안에서 실행 여부를 자동 대조합니다.
  • 집계 지표 단독 사용 금지 — 성공률·정규화 점수만으로 모델을 비교하지 말고, 통계적으로 구분력이 검증된 행동 지표를 함께 봅니다.
  • 동일 계열 라벨러 편향 점검 — 평가 파이프라인에 평가 대상과 같은 계열 모델을 채점자로 쓸 경우, 사람 대조 표본으로 편향 여부를 별도 확인합니다.
  • 파일럿 규모의 겸손 — 20여 건 남짓의 실행 결과는 순위가 아니라 패턴으로만 읽습니다.

결론

CivBench는 새로운 모델이나 알고리즘이 아니라 측정 방법을 제안합니다. 정보가 있어도 조회하지 않고, 계획을 세워도 실행하지 않는 두 가지 이탈은 승패 집계에서는 보이지 않다가 행동 지표를 도입하자 드러났습니다. 표본이 작고 산술 불일치도 일부 있어 수치를 확정적 순위로 읽기는 이르지만, "집계 성과만으로 장기 에이전트의 신뢰도를 판단할 수 없다"는 방향 신호로는 충분합니다. 행동 지표를 운영에 붙이는 문제는 장기 실행 에이전트의 행동 지표 운영 가이드에서 이어집니다.

참고 링크