원문 정보

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li, "FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents", arXiv:2608.18423 [cs.AI], 2026-08-19 제출, DOI 10.48550/arXiv.2608.18423. 소속: AnalogyAI. 코드·엔진 공개(github.com/Analogy-AI/fm-bench).

동료심사를 거치지 않은 프리프린트입니다. 저자 전원이 이 벤치마크를 만든 스타트업 AnalogyAI 소속입니다. 평가 대상 15개 모델(Anthropic·OpenAI·Google·xAI·Meta 및 오픈소스 5종)은 전부 제3자 시스템이라 특정 벤더를 편애할 유인은 낮지만, 벤치마크 자체의 채택을 늘리려는 상업적 동기는 배제할 수 없습니다. 자금 출처는 논문에 별도로 명시돼 있지 않습니다. 원문 전문은 이 세션의 실시간 접근이 막혀 있어, 사이트 자동 수집 파이프라인이 2026-08-23T21:40:45Z에 받아 둔 arXiv HTML 전문 스냅숏으로 대조했습니다.

연구 개요

연구 질문은 두 가지입니다. 언어모델 에이전트가 단발성 임무를 넘어 장기간 조직을 운영할 수 있는가, 그리고 그 능력을 구성하는 행동은 무엇인가입니다. FM-Bench는 16개 구단 리그에서 한 구단을 20년(약 340~400회 의사결정 지점)간 운영하는 과제로 이를 측정합니다. 에이전트는 26개 도구로 이적·계약·시설투자·라인업·이사회 대응을 수행하고, 채점은 LLM 심판이나 사람 평가 없이 결정론적 엔진이 계산합니다. 평가는 두 트랙입니다 — 솔로 트랙은 15개 프론티어 모델 각각을 고정된 스크립트 상대와 겨루게 하고, 아레나는 같은 15개 모델과 스크립트 앵커 하나를 한 공유 세계에 넣어 경쟁시킵니다. 매 결정 지점은 대화 이력이 없는 새 세션으로 열리므로, 에이전트가 직접 쓰는 노트북만이 유일한 회차 간 기억이며 그 자체가 측정 대상입니다.

핵심 결과

솔로 트랙에서는 같은 스크립트 상대를 기준으로 절대 점수를 비교합니다. claude-fable-5가 오라클(참 상태를 읽는 특권 스크립트) 대비 약 95%(90.94/95.54)에 도달해 1위였고, 오픈소스 kimi-k2.6(88.49)이 gpt-5.6-terra(86.66)·gpt-5.6-sol(86.40)을 모두 앞서 규모·가격·벤더가 순위를 정하지 않음을 보였습니다.

솔로 트랙 시트S_final (3시드 평균)토큰
oracle (특권 스크립트)95.54 ± 4.68
claude-fable-5 (1위)90.94 ± 5.2024M
kimi-k2.6 (오픈소스 최고)88.49 ± 0.1587M
claude-haiku-4.5 (모델 중 최저)36.90 ± 22.7386M
heuristic (규율적 스크립트)17.05 ± 12.34
idle / random (앵커)-0.90 ± 1.86 / -17.21 ± 2.45

아레나(경쟁형 공유 세계)에서는 순위가 뒤바뀝니다. 스크립트 앵커가 3년차에 가장 먼저 탈락했고, 최약체 모델 둘(gemini-3.5-flash, claude-haiku-4.5)도 리바이벌을 모두 소진해 뒤따라 탈락했습니다. 반면 솔로 트랙 상위 4개 모델은 20년 내내 리그 1위를 지키는 "왕조"를 만들었는데, 아레나에서는 우승이 19번의 시즌 전환 중 단 2번만 방어돼 10개 모델이 돌아가며 우승을 차지했습니다 — 경쟁자가 적응하는 환경과 고정 상대를 겨루는 환경의 차이가 그대로 드러난 대목입니다.

아레나 순위모델S_final강제 이탈
1위claude-fable-576.26없음
2위muse-spark-1.162.47없음
14위claude-haiku-4.50.76해고(10.7년차)
15위gemini-3.5-flash0.21해고(5.8년차)
16위heuristic (앵커)0.13해고(2.6년차)

처음 플레이하는 인간 6명 중 4명은 파산·해고로 조기 종료됐습니다. 완주한 2명 중 성적이 나은 쪽(74.64)도 15개 모델 순위에서 claude-opus-4.8(75.02)과 gemini-3.5-flash(74.59) 사이, 즉 하위권에 자리했습니다. 논문은 최종 점수를 여섯 개 행동 지표로 분해했는데, 엔드게임 임박 시 저수익 투자 축소(스피어만 상관 r_s=-0.58, 세 시드 모두 음의 방향)와 유휴 현금 최소화(r_s=-0.50)가 점수와 가장 강하게 연동됐고 계약 조기 갱신(r_s=+0.45)이 뒤를 이었습니다. 반면 토큰 소비는 28M~194M로 약 7배 차이가 나지만 점수와 무상관이었습니다(r_s=-0.19, 세 시드 모두 p>0.38). 가격 발견도 취약해 전체 모델의 거래 성사 제안 횟수 중앙값이 30회(오라클은 1회)였고, 메모리 큐레이션은 노트북 유사도가 gpt-5.6-sol 0.91(누적 아카이브형)과 claude-sonnet-5 0.20(매번 재작성형) 양극단으로 갈렸으며 1위 모델은 0.39로 중간을 지켰습니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 첫째, LLM 심판이나 사람 채점 없이 결정론적 엔진이 점수를 계산해 판정 편향 여지가 적습니다. 둘째, 오라클·휴리스틱·아이들·랜덤 네 개의 스크립트 앵커로 척도의 순서 보존과 바닥·천장을 사전에 교정해, 채점 상수가 결과를 보고 나서 끼워 맞춰진 것이 아닙니다. 셋째, 엔진 커밋·파라미터 해시·점수 버전이 모든 결과 파일에 기록되고 HMAC 서명·서버 재생으로 검증돼 재현성이 높습니다.

감안할 점도 뚜렷합니다. 논문 스스로 밝히듯 솔로 트랙은 3개 시드 평균이라 인접 모델 간 우열을 통계적으로 단정하기엔 부족하고, 아레나는 시드 하나뿐이라 오차 범위가 없어 몇 점 차이는 동률로 읽어야 합니다. 여섯 행동 지표는 상관관계일 뿐 인과가 아니며, 저자들도 그중 하나는 다른 특성과 교란될 수 있음을 인정합니다. 저자 전원이 벤치마크 개발사 소속이라는 이해상충이 있고, 동료심사 전 초고이며 자금 출처도 명시돼 있지 않습니다. 스크립트 상대는 적응하지 않는 정형화된 상대이므로 절대 점수의 실세계 일반화는 검증되지 않았습니다. 논문이 인용한 YC-Bench·CoffeeBench·StockBench 등 선행 장기 벤치마크는 고정된 참조 에이전트나 반응하지 않는 시장을 썼는데, FM-Bench의 아레나 결과(적응형 경쟁에서의 우승 로테이션)는 이런 정적 설계가 놓치는 동학이 실재함을 보여 줘 선행 연구의 사각지대를 보완하는 방향입니다.

리뷰어 판단

첫째, 이 논문에서 가장 실무적으로 값진 결과는 90.94라는 1위 점수가 아니라 토큰 소비와 점수의 무상관(r_s=-0.19)이라고 판단합니다. 7배 차이 나는 컴퓨팅 예산이 순위를 가르지 못했다는 것은, 장기 실행 에이전트의 품질을 "얼마나 많이 생각했는가"가 아니라 "무엇을 했는가"로 평가해야 한다는 뜻으로 읽힙니다.

둘째, 메모리 큐레이션의 두 극단(누적 아카이브형·매번 재작성형)이 실무 에이전트 설계에 직접적인 경고라고 봅니다. 대화 이력을 압축 없이 계속 쌓는 방식과 매번 통째로 다시 쓰는 방식 모두 이 벤치마크에서는 실패로 이어졌고, 상태를 남기되 전략의 뼈대는 유지하는 중간 지대(1위 모델의 0.39)가 목표치로 삼을 만한 구간이라고 판단합니다.

셋째, 인간 6명 중 4명이 조기 해고됐다는 결과를 "모델이 사람보다 낫다"는 결론으로 단순화하는 것은 성급하다고 봅니다. 표본이 6명뿐이고 처음 플레이하는 조건이라 숙련된 관리자와의 비교가 아닙니다. 다만 인간의 실패 양상(현금을 쥐고 있다가 뒤늦게 청구서를 받는 패턴)이 모델의 신용 배분 취약점과 겹친다는 점은, 이 과제가 측정하는 능력이 실제로 어렵다는 방증으로 읽습니다.

실무 적용

  • 엔드게임 인지 점검 — 장기 실행 에이전트가 마감이 가까워질수록 저수익 투자를 스스로 줄이는지 확인합니다. 이 논문에서 가장 강한 신호(r_s=-0.58)였습니다.
  • 유휴 자원 감사 — 현금·크레딧·할당량이 쓰이지 않고 쌓이는 비율을 주기적으로 점검합니다. 두 번째로 강한 예측 변수(r_s=-0.50)였습니다.
  • 메모리 정책을 아카이브·재작성 중간으로 — 상태 기록을 무한히 누적하거나 매번 통째로 다시 쓰지 말고, 핵심 전략은 남기고 세부 상태만 갱신하는 정책을 설계합니다.
  • 토큰 예산이 아니라 행동 지표로 품질 관리 — 컴퓨팅 지출이 성과를 보장하지 않으므로, 엔드게임 대응·신용 배분·가격 발견 같은 행동 지표를 자체 평가 항목에 넣습니다.
  • 경쟁·적응 환경에서 재평가 — 정적 벤치마크에서 좋은 성적을 낸 에이전트도 경쟁자가 반응하는 환경에서는 순위가 뒤집힐 수 있으므로, 배포 전 상호 경쟁 시나리오를 별도로 테스트합니다.

결론

FM-Bench는 언어모델 에이전트의 "작업을 완수하는 능력"과 "조직을 오래 관리하는 능력"이 다르다는 것을 결정론적 채점과 여섯 축 행동 분해로 보여 줍니다. claude-fable-5가 오라클의 약 95%에 도달하며 두 트랙 모두 1위였지만, 경쟁자가 있는 아레나에서는 우승이 시즌마다 다른 모델에게 돌아갔고, 처음 플레이하는 인간은 대부분 조기 해고됐습니다. 저자 전원이 벤치마크 개발사 소속이라는 이해상충과 제한적인 시드 수는 안고 읽어야 하지만, 토큰 소비와 성과의 무상관·메모리 큐레이션의 두 실패 양식은 자체 에이전트 설계에 바로 적용해 볼 만한 신호입니다. 장기 실행 벤치마크에서 완주율 자체가 배포 판단의 핵심이라는 논의는 열 번 중 여섯 번만 끝낸다: 장기 실행 브라우저 에이전트 배포 판단 기준에서도 이어집니다.

참고 링크