원문 정보
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria, "ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step", arXiv:2608.02358 [cs.CL], 2026-08-03 제출, DOI 10.48550/arXiv.2608.02358. 소속: 난양이공대학교(NTU) DeCLaRe Lab · 싱가포르 A*STAR, 교신저자 Soujanya Poria.
동료심사를 거치지 않은 프리프린트이며, 1분류는 자연어처리(cs.CL)로 등록된 벤치마크 논문입니다. HTML 전문과 초록 페이지를 모두 확인했으나 자금 출처와 이해상충 고지는 찾지 못했습니다 — 벤치마크 논문에서 흔한 누락이지만, 평가 대상에 상용 모델 열다섯 종이 포함된 만큼 공백으로 기록해 둡니다. 문서 라이선스는 CC BY-SA 4.0으로 표기돼 있습니다.
연구 개요
이 벤치마크가 던지는 질문은 문서가 없는 시스템 앞에 놓인 에이전트가 상호작용만으로 도구의 동작을 알아낼 수 있는가, 그리고 알아낸 뒤 환경이 바뀌면 그 가설을 고칠 수 있는가입니다. 기존 도구 사용 벤치마크는 send_email 같은 의미 있는 스키마를 그대로 노출하기 때문에 모델이 사전지식으로 정답을 맞혀도 발견 능력을 측정한 것처럼 보입니다. 저자들은 터미널 환경에서 도구 식별자의 의미 단서를 전부 제거해 이 혼동을 끊었습니다.
측정 단위는 5개 과제로 이어지는 커리큘럼 1회(에피소드)이고, 조건마다 20에피소드를 돌립니다. 과제당 행동 예산은 추론 스텝 100회입니다. 조건은 다섯 가지로 분리돼 있습니다 — 의미 단서를 남긴 대조군(Unscrambled), 식별자만 익명화한 기본(Base), 에피소드 중간에 함수 매핑의 25%를 재배치하는 표류(+Drift, ρdrift=0.25), 확률 15%로 일시적 타임아웃을 주입하는 실패(+Failure, pfail=0.15), 10행동 안에 끝내야 하는 시간창(+Window, k=10), 그리고 셋을 동시에 거는 결합(+All)입니다. 평가 대상은 메모리 없는 모델 15종이며, 이 중 4종에는 지속 메모리를 붙인 변형을 추가로 돌렸습니다.
지표는 세 가지입니다. Pep는 5개 과제를 전부 푼 에피소드의 비율, Tavg는 평균 해결 과제 수(0~5), Aavg는 성공한 에피소드에 한정한 평균 총 행동 수입니다. Aavg가 성공 사례만 세는 지표라는 점은 해석에 중요합니다 — 실패한 폭주는 이 수치에 들어오지 않으므로 실제 낭비는 표에 보이는 것보다 큽니다.
핵심 결과
메모리 없는 15종의 조건별 평균(Table 2)은 다음과 같습니다. 왼쪽이 Pep, 오른쪽이 Tavg이며, 두 값은 기준이 다릅니다 — 앞은 전부 맞힌 에피소드의 비율이고 뒤는 부분 성공까지 반영한 진척도입니다.
| 조건 | Pep (완주율) | Tavg (평균 해결 과제, 5점 만점) |
|---|---|---|
| Unscrambled (대조군) | 0.93 | 4.88 |
| Base (식별자 익명화) | 0.32 | 2.31 |
| +Drift (매핑 25% 재배치) | 0.23 | 1.87 |
| +Failure (실패율 15%) | 0.26 | 2.09 |
| +Window (10행동 제한) | 0.19 | 1.87 |
| +All (셋 동시) | 0.03 | 0.84 |
평균만 보면 "이름을 지우니 다 무너졌다"로 읽히지만, 상위 모델의 행은 다른 이야기를 합니다. Claude Sonnet 5는 표류·실패를 각각 걸어도 완주율 1.00을 유지하다가 셋을 동시에 걸자 0.00으로 떨어졌습니다. 개별 교란에 강한 것과 교란이 겹쳤을 때 버티는 것은 별개 능력이라는 뜻입니다.
| 모델 (Pep/Tavg) | Base | +Drift | +Failure | +Window | +All |
|---|---|---|---|---|---|
| Claude Sonnet 5 | 1.00/5.00 | 1.00/5.00 | 1.00/5.00 | 0.70/4.70 | 0.00/2.85 |
| Gemini 3.1 Pro | 1.00/5.00 | 0.90/4.90 | 1.00/5.00 | 0.80/4.80 | 0.20/2.35 |
| Gemini 3.5 Flash | 1.00/5.00 | 0.90/4.90 | 0.85/4.85 | 0.65/4.65 | 0.25/4.05 |
| GPT-5.4 | 0.10/2.05 | 0.00/0.80 | 0.05/2.05 | 0.05/1.25 | 0.00/0.15 |
| Qwen 3.6 27B | 0.55/4.00 | 0.25/3.15 | 0.35/3.85 | 0.15/2.90 | 0.00/0.75 |
비용 축의 변화가 더 가파릅니다. 성공한 에피소드의 평균 행동 수(Table 3)는 Gemini 3.1 Pro가 대조군 25.1에서 Base 80.8, +Drift 152.4로 늘었고 Claude Sonnet 5는 25.6 → 115.8 → 193.6으로 늘었습니다. 성공 사례만 세도 여섯 배에서 여덟 배입니다.
논문의 제목이 가리키는 결과는 Table 4·5에 있습니다. 저자들은 표류가 일어난 뒤 이미 확보한 매핑을 순환 추적(cycle tracing)으로 되짚으면 사건당 평균 4.25행동이면 복구된다는 기댓값을 식으로 유도했습니다. 실제 관측된 복구 비용은 과제 2~5 평균으로 Gemini 3.1 Pro(높은 추론) 5.57배, Claude Sonnet 5는 추론 예산 저·중·고에서 각각 8.94배·7.38배·7.52배였습니다. 추론을 늘려도 복구는 싸지지 않았습니다. 그 이유는 Table 5가 설명합니다 — 복구 사슬의 다음 식별자를 3행동 안에 호출한 비율이 Gemini 3.1 Pro는 11.0%로 무작위 선택 기댓값 10.8%와 사실상 같았고(p=0.934), Claude Sonnet 5는 14.1% 대 10.6%로 통계적으로는 유의했지만(p=0.006) 차이는 3.5%p에 그쳤습니다.
메모리의 효과도 크지 않았습니다. 메모리를 붙인 4개 쌍의 평균 개선은 결합 조건에서 Pep +0.09, Tavg +0.59였습니다. 반면 실패 방식은 모델마다 극단적으로 갈렸습니다. Claude Sonnet 5의 실패는 97.5%가 예산 소진이고 조기 종료는 2.5%였던 반면, GPT-OSS 20B와 Gemma 4 31B는 실패의 100%가 조기 종료였습니다.
신뢰도 평가
설계상 믿을 만한 근거가 세 가지 있습니다. 의미 단서를 남긴 대조군을 함께 돌려 "사전지식으로 맞힌 몫"과 "상호작용으로 알아낸 몫"을 분리한 점, 교란을 표류·실패·시간창으로 나눠 각각 파라미터를 공개한 덕에 어느 요인이 무엇을 무너뜨렸는지 귀속이 가능한 점, 그리고 성공률뿐 아니라 행동 수·재시도율·낡은 호출 수 같은 행동 지표를 함께 보고하고 복구 사슬 추종률에는 무작위 기준선과 p값까지 붙인 점입니다.
감안할 점도 분명합니다. 조건당 20에피소드라는 표본은 Pep의 해상도를 0.05로 묶어 놓아, 0.20과 0.25의 차이는 에피소드 한 건 차이입니다. 모델 간 순위를 소수점으로 비교하는 것은 이 표본에서 무리입니다. 환경도 실제 도커 컨테이너가 아니라 파이썬 시뮬레이터이고, 표류는 일대일 대응이 유지되는 순열이라 인자·반환형까지 바뀌는 실제 API 변경보다 온건합니다. ρ=0.25, p=0.15, k=10이라는 값도 설계자의 선택이며 다른 값에서 같은 패턴이 나온다는 근거는 제시되지 않았습니다. 별도의 한계 절이 없고 자금·이해상충 고지도 확인되지 않는다는 점, 동료심사 전 초고라는 점은 그대로 감가 요인입니다.
리뷰어 판단
첫째, 이 논문에서 실무에 가장 값비싼 수치는 평균 0.03이 아니라 Claude Sonnet 5의 행이라고 판단합니다. 표류 단독 1.00, 실패 단독 1.00, 그런데 결합 0.00입니다. 결함을 하나씩 주입해 통과했다는 사실은 결함이 겹쳤을 때의 안전을 전혀 보증하지 않습니다. 장애가 단독으로 오는 경우는 드물다는 운영의 상식이 에이전트 평가에는 아직 반영돼 있지 않습니다.
둘째, 11.0% 대 10.8%는 이 시리즈가 본 가장 냉정한 수치 중 하나입니다. 모델은 표류를 겪은 뒤에도 이미 자기가 만든 매핑을 근거로 다음 후보를 좁히지 않고, 사실상 무작위와 구분되지 않는 순서로 도구를 훑었습니다. Claude Sonnet 5처럼 유의성이 잡힌 경우조차 3.5%p 차이라면, 이것은 "추론으로 복구한다"가 아니라 "가끔 운이 좋다"에 가깝습니다. 에이전트가 자기 상태를 기록한다는 사실과 그 기록을 추론에 쓴다는 사실은 다릅니다.
셋째, 그래서 위험은 정확도보다 지출에서 먼저 나타난다고 봅니다. Aavg가 25에서 152로 늘어난 구간은 성공한 에피소드입니다. 성공했는데 여섯 배를 썼다면, 실패한 에피소드는 예산 상한까지 쓰고 끝났다는 뜻입니다. 실제로 Claude Sonnet 5 실패의 97.5%가 예산 소진이었습니다. 도구 스키마가 조용히 바뀌는 날, 대시보드에 먼저 뜨는 것은 오답률이 아니라 토큰 청구서입니다.
넷째, 예산 소진형과 조기 종료형은 다른 사고이므로 다른 경보가 필요합니다. 전자는 비용 사고이자 지연 사고이고, 후자(GPT-OSS 20B·Gemma 4 31B는 실패의 100%)는 아무 소리 없이 미완료 결과를 반환하는 침묵 실패입니다. 완료율 하나로 두 실패를 같이 보는 모니터링은 후자를 놓칩니다.
실무 적용
- 결합 교란 회귀 세트 — 스테이징에서 스키마 표류·간헐 실패·시간 제한을 개별로도, 동시에도 거는 시나리오를 만듭니다. 단독 통과는 합격 기준이 아닙니다.
- 행동 예산 상한과 초과 경보 — 과제당 최대 행동·토큰을 상한으로 두고, 성공했지만 평소의 3배를 쓴 실행을 별도 이벤트로 남깁니다. 성공 경로의 비용 증가가 가장 빠른 이상 신호입니다.
- 실패 유형 분리 계측 — 예산 소진과 조기 종료를 다른 지표로 집계하고, 조기 종료에는 "미완료 반환" 알림을 붙여 침묵 실패를 막습니다.
- 낡은 호출 추적 — 이미 폐기·변경된 도구 식별자를 계속 호출한 횟수를 지표화하면 모델이 낡은 가설을 언제까지 붙들고 있는지 드러납니다.
- 모델 교체는 재측정 사건 — 같은 벤더의 상위 모델이라도 결합 조건 성적과 실패 유형이 다릅니다. 교체 전후로 같은 회귀 세트를 돌려 비교표를 남깁니다.
결론
ScrambleToolBench가 드러낸 것은 도구를 쓰는 능력과 도구가 바뀐 뒤 다시 알아내는 능력 사이의 간격입니다. 조건당 20에피소드라는 표본 탓에 절대 수치보다는 패턴 — 결합 교란에서의 붕괴, 무작위와 구분되지 않는 복구 탐색, 성공 경로에서도 여섯 배로 늘어나는 행동 비용 — 을 가져가는 편이 정확합니다. 평가 루브릭 쪽 설계는 AI 에이전트 평가 루브릭 설계에서 이어집니다.