원문 정보

Daksh Raghuvanshi, Ved Vedere, Yifan Wang, "StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents", arXiv:2610.10942 [cs.AI], 2026-10-07 제출, DOI 10.48550/arXiv.2610.10942. 라이선스 CC BY 4.0. 학습용 과제 5개, 샘플 궤적 10개, 채점·검증 코드를 익명화한 부록으로 공개했고, 벤치마크 오염을 막기 위해 평가용 시뮬레이션 엔진과 평가 과제 전체는 비공개로 남겼습니다.

동료심사를 거치지 않은 arXiv 프리프린트입니다. 저자 소속이나 연구비 출처를 밝히는 절이 원문에 없고, WebSearch로도 세 저자(Daksh Raghuvanshi, Ved Vedere, Yifan Wang)의 소속을 독립적으로 확인하지 못했습니다 — 신뢰도 평가에서 이 공백을 그대로 짚어 둡니다. 다만 평가에 참여한 사람 전문가 11명은 "기존 계약 전문가 풀에서 무작위 추출"했고 정당한 보수를 지급했다고 명시했습니다.

연구 개요

연구 질문은 하나로 압축됩니다 — 프런티어 LLM이 실제 운영 소프트웨어(오픈소스 커머스 플랫폼 Medusa v2) 위에서 가상 의류 쇼핑몰을 30일에서 365일까지 운영할 때, 스크립트로 짠 휴리스틱 정책과 사람 전문가를 넘어서는 수익성·신뢰성을 낼 수 있는가입니다.

환경(StoreBench)은 18개월치 거래 이력(주문 3,320건, 고객 약 2,500명, 반품률 14.7%)이 이미 쌓인 가게를 에이전트에게 넘기고, 29개 MCP 툴(카탈로그·가격·재고·배송·반품·소싱·리포트)만으로 조작하게 합니다. 시간은 추론 지연이 아니라 "쓴 작업 수"로만 흐르므로 느린 모델이 불리해지지 않습니다. 수요·공급업체 신뢰도·경쟁사 점유율은 에이전트가 자신의 판매 데이터로만 추론해야 하는 숨은 변수이고, 사건(수요 급변·공급 실패·품질 위기 등)은 사전 공지·소문·무공지 세 채널로 다르게 노출됩니다.

평가 축은 둘입니다. 짧은 지평(11개 과제×3시드×3회, 30~45일, goose 하니스)에서 7개 프런티어 모델(DeepSeek-V4-Pro, Claude Opus 4.8, Claude Fable 5, Qwen3.8-Max, Gemini 3.8 Flash, GPT-5.6 Sol, Muse Spark 1.2)을 겨루게 하고, 별도로 365일 마라톤 과제를 Claude Code 하니스로 돌립니다. 모든 통과 기준은 do-nothing·absentee·blast-list·rule-based·smart-triage·exploiter 6개 스크립트 정책을 똑같은 툴로 직접 실행해 측정한 값을 기준으로, 과제-시드 쌍마다 개별 보정했습니다.

핵심 결과

합성 점수는 사업성과(가중 0.7)·서비스신뢰성(0.2)·지속운영(0.1)의 가중합입니다. 11개 과제 × 3시드 × 3회 시행 평균을 기준으로, 어떤 모델도 체크리스트형 스크립트 정책(smart-triage)의 평균을 넘지 못했습니다.

정책/모델종합점수통과율사업성과신뢰성지속운영
Smart-triage(휴리스틱)0.76497%–––
DeepSeek-V4-Pro0.70049%0.6140.8521.000
Claude Opus 4.80.66836%0.5730.8341.000
사람 전문가(11명)0.70839%0.5990.9441.000
Muse Spark 1.20.3878%0.2260.6441.000

최고 모델 DeepSeek-V4-Pro(0.700, 통과율 49%)는 smart-triage(0.764, 97%)에 크게 못 미쳤고, 사람 전문가 평균(0.708)에도 근소하게 뒤졌습니다. 다만 사람은 서비스 쪽(정시배송 96%·반품처리 93% → 신뢰성 0.944)에서 어떤 모델보다 앞섰을 뿐, 사업성과(0.599)는 DeepSeek(0.614)보다 낮았습니다 — "사람이 이겼다"는 결론은 신뢰성 항목에서만 성립하고 사업성과 항목에서는 성립하지 않으므로, 기준이 다른 두 수치를 섞어 읽으면 안 됩니다.

365일 마라톤에서는 순위가 뒤집힙니다. DeepSeek(0.976)·Qwen3.8-Max(0.974)·Claude Opus 4.8(0.971)·Claude Fable 5(0.966)가 smart-triage(0.764)를 멀찍이 앞섰습니다. 단 이 비교는 짧은 지평(goose 하니스)과 하니스 자체가 다른 설정(Claude Code, 컨텍스트 압축·확장 사고 포함)이라 저자들도 "직접 비교 대상이 아니다"라고 명시했습니다 — "장기에선 모델이 역전했다"고 단정하기보다 하니스 교체 자체가 결과에 미치는 영향으로 읽어야 합니다. Gemini 3.8 Flash만 유일하게 하락(0.552→0.496)했는데, 9회 시행 중 4회는 "백그라운드 시뮬레이션이 돌고 있다"고 스스로 믿고 기다리기만 했습니다(해당 4회 평균 약 0.1).

후속학습 실험은 Qwen3.5-27B를 평가 과제와 겹치지 않는 5개 과제로 GRPO 학습시킨 뒤 held-out 11개 과제에 평가했습니다.

정책종합점수통과사업성과신뢰성정시배송반품처리
베이스0.1360/990.0050.4010.650.16
GRPO 학습 후0.3733/990.2360.6690.890.45

종합점수는 0.136→0.373(+0.237/셀, 부트스트랩 95% CI [+0.19, +0.29])로 33개 셀 중 31개에서 개선됐고, 이익을 낸 에피소드 비율은 3%→72%로 뛰었습니다. 그래도 통과 셀은 99개 중 3개뿐이고, rule-based 체크리스트조차 전 과제에서 넘지 못했습니다 — 개선은 정시배송·반품처리 같은 운영 기본기에서만 왔고 가격·소싱 판단은 거의 바뀌지 않았습니다.

실패 유형 중 가장 넓게 퍼진 것은 재고 소진입니다. 전체 693회 시행의 26%(178회)에서 재입고가 너무 적거나 늦었고, 60회는 구매주문을 단 한 번도 넣지 않았습니다(그중 41회가 Gemini). 두 번째는 하니스 경유 방식의 차이입니다 — 네이티브 툴콜과 셸 스크립트를 똑같이 쓸 수 있는데, Claude Opus 4.8·Claude Fable 5·GPT-5.6 Sol·Gemini 3.8 Flash는 거의 모든 시행에서 셸을 거쳤고, Muse는 셸 경유 시 0.34점(네이티브 0.43)으로, Gemini는 네이티브 두 시행 평균 0.89 대 셸 경유 0.55로 갈렸습니다(이 비교는 모델별 시행 수가 적어 참고치로만 읽어야 합니다).

신뢰도 평가

믿을 근거는 세 가지입니다. 첫째, 모든 보정이 과제-시드 쌍마다 6개 스크립트 정책을 실제 툴 서피스로 직접 실행해 측정한 값이고, 4개 게이트(정책 순서·판단 격차·노이즈 마진·착취 억제)를 통과해야만 과제로 채택됩니다 — 36개 보고 셀과 비공개 2개 시드의 24개 셀 전부가 이 게이트를 통과했다고 명시했습니다. 둘째, Table 1의 합성점수를 공식(0.7×사업성과+0.2×신뢰성+0.1×지속운영)으로 직접 검산하면 DeepSeek(0.7×0.614+0.2×0.852+0.1×1.0=0.700), 사람 전문가(0.7×0.599+0.2×0.944+0.1×1.0=0.708) 등 보고된 값과 소수점 셋째 자리까지 일치합니다. 셋째, 보상 착취 756건을 사전 감사해 폐쇄형 회귀 테스트로 고정했고, 착취 정책의 평균 점수(0.039)가 모든 정직 정책보다 낮다는 조건을 매 보정마다 재확인합니다.

감안할 점도 뚜렷합니다. 동료심사 전 프리프린트이고, 저자 소속·자금 출처·이해상충 선언이 원문에 없어 확인이 불가능합니다(위 '원문 정보' 참고). 환경은 가상의 단일 의류 쇼핑몰이고 경쟁사·수요 모두 스크립트로 짜여 있어, 결과가 다른 업종·실제 시장으로 일반화된다고 보기는 어렵습니다 — 저자들도 한계로 명시했습니다. 사람 전문가 비교는 과제-시드당 선택된 결과 1개만 쓰고 재시도 1회를 허용한 반면 모델은 평균 3회 시행인데다, 사람은 평소 쓰는 매장 도구가 아니라 에이전트와 같은 제한된 MCP 인터페이스로 평가받아 사람 쪽에 불리하게도, 선택 편향으로 유리하게도 작용할 수 있는 비대칭이 있습니다. 365일 결과에서 하니스가 다른 설정이라는 점을 저자가 스스로 밝힌 것은 투명성 신호이지만, 동시에 "장기에선 모델이 이긴다"는 결론을 성급히 내리면 안 되는 이유이기도 합니다.

관련 연구(학술 문헌 대조)

  • Backlund & Petersson(2025). Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents — 자판기 사업을 장기간 운영시켜 에이전트의 장기 일관성을 재는 선행 벤치마크입니다. StoreBench는 이 문헌이 과제별로 보정된 척도·통과 기준을 갖추지 못했다는 점을 보완 대상으로 직접 인용하며 확장했습니다(선행 연구·확장).
  • Froger et al.(2026, ICLR). Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments — 에이전트와 무관하게 사건이 진행되는 동적 환경을 도입했지만, Time 시나리오가 5분으로 제한돼 있고 StoreBench 원문이 직접 인용한 바에 따르면 생성 지연을 제거하면 GPT-5의 점수가 0%에서 34.4%로 뛴다고 보고했습니다. StoreBench는 시간을 추론 지연이 아니라 행동 수로만 흐르게 설계해 이 교란 변수를 구조적으로 제거했습니다(선행 연구·방법 대조, 수치는 StoreBench 원문에서 직접 확인).
  • Shi et al.(2026). MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations — 365일 커머스 운영을 평가하는 또 다른 벤치마크로, WebSearch로 독립 확인한 바로는 최고 모델 구성이 사람 참가자 평균 순자산의 27.3%에 그쳤다고 보고합니다(세션 egress 차단으로 원문 전문은 재열람하지 못해 이 수치는 관계 서술에만 쓰고 핵심 결과에는 포함하지 않습니다). StoreBench의 짧은 지평 결과(최고 모델이 사람 평균의 약 99%)와 나란히 두면 사람-모델 격차가 벤치마크 설계에 따라 크게 달라진다는 뜻이고, 한 벤치마크의 격차 수치를 업종 전반의 결론으로 일반화하면 안 된다는 경고로 읽힙니다(관련 연구·수치 대조, 벤치마크 원천).

세 문헌을 종합하면, "에이전트가 장기 운영을 사람만큼 할 수 있는가"라는 질문은 2025년 Vending-Bench 이후 반복적으로 던져지고 있고, 답은 환경 설계(시간 계측 방식·보정 절차·사람 비교 조건)에 따라 상당히 달라집니다. StoreBench는 이 계열에서 가장 엄격한 보정·착취 방지 절차를 갖췄다고 볼 수 있지만, 그만큼 "장기에서는 모델이 역전한다"는 Table 2의 결과를 하니스 차이 없이 재현한 후속 연구가 필요합니다.

리뷰어 판단

첫째, 이 논문에서 가장 중요한 수치는 49%라는 통과율이 아니라 하니스 효과라고 판단합니다. 같은 모델이 짧은 지평에서는 체크리스트 정책에도 못 미치다가, 하니스를 Claude Code로 바꾸자 스크립트 최고치를 멀찍이 넘습니다. 저자들이 "두 설정은 하니스와 지평이 동시에 바뀌어 비교 대상이 아니다"라고 먼저 밝혔다는 점은 드문 정직함이지만, 동시에 이는 벤치마크 리더보드에 하니스 표기 없이 "모델 X가 Y점"이라고만 적는 관행이 얼마나 위험한지를 보여주는 근거라고 봅니다.

둘째, GRPO 후속학습 결과(0.136→0.373)를 "학습이 자율 운영을 해결한다"는 근거로 과대해석해서는 안 된다고 판단합니다. 통과 셀이 99개 중 3개뿐이고 rule-based 체크리스트조차 넘지 못했으며, 개선이 가격·소싱 같은 상업적 판단이 아니라 정시배송·반품처리 같은 운영 기본기에서만 나왔습니다. 다섯 개 과제만으로 held-out에 전이되는 신호 자체는 샘플 효율성 연구로서 흥미롭지만, 제품화 판단의 근거로 쓰기엔 아직 이릅니다.

셋째, 네이티브 툴콜 대신 셸을 선호하는 모델이 네 개 중 셋이라는 관찰은 "MCP 툴을 제공했다"와 "모델이 그 툴을 실제로 쓴다"가 다른 문제라는 점을 보여줍니다. 셸 경유 운영이 오래된 상태를 보고 일괄 처리를 내리는 패턴과 엮여 있다는 저자들의 관찰은, 에이전트 운영 시스템을 설계할 때 셸 접근을 열어 두는 선택 자체에 비용이 있을 수 있음을 시사한다고 봅니다.

실무 적용

  • 휴리스틱 대비 벤치마킹 — 운영 자동화 에이전트를 배치하기 전에, 체크리스트 수준의 스크립트 정책 대비 성능을 먼저 측정합니다. 이 논문 기준으로는 프런티어 모델도 그 선을 못 넘습니다.
  • 하니스 고정 평가 — 같은 모델이라도 하니스(도구 노출 방식·컨텍스트 관리)에 따라 점수가 크게 갈리므로, 실제 배치할 하니스 그대로 재평가합니다.
  • 재고·환불 실패를 별도 KPI로 — 재고 소진이 전체 시행의 26%에서 나타난 지배적 실패 유형이므로, 구매주문 누락·환불 미달을 운영 대시보드에서 따로 추적합니다.
  • 네이티브 툴콜 사용률 점검 — 에이전트가 제공된 도구를 실제로 호출하는지, 셸을 거쳐 상태를 놓치는지 로그로 확인합니다.
  • 소규모 RL 파인튜닝은 보조 수단으로 — 몇 개 과제만으로도 운영 기본기는 개선되지만 상업적 판단력까지 옮겨지지는 않으므로, 가격·소싱 결정은 별도 검증 없이 학습된 정책에 맡기지 않습니다.

결론

StoreBench의 기여는 "에이전트가 가게를 운영할 수 있는가"라는 질문에 처음으로 보정된 척도와 착취 방지 장치를 갖춘 답을 제시한 데 있습니다. 결과는 단순하지 않습니다 — 짧은 지평에서는 어떤 프런티어 모델도 스크립트 체크리스트를 넘지 못했지만, 하니스를 바꾸고 지평을 늘리면 순위 자체가 달라집니다. 이 비일관성 자체가 독자에게 주는 실무 교훈입니다: 에이전트 성능은 모델 하나의 속성이 아니라 모델·하니스·과제 지평의 조합에서 나오므로, 배치 전 검증은 그 조합 전체를 대상으로 해야 합니다. 에이전트 평가 환경을 운영할 때 이상 신호를 어떻게 감지·에스컬레이션하는지는 평가 환경 이상 신호 에스컬레이션 게이트에서 다룹니다.

참고 링크

이 리뷰에 대해 AI와 대화하기

AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.

대화창을 불러오는 중…