원문 정보
Panagiotis Kasnesis, Christos Chatzigeorgiou, Lazaros Toumanidis, Amalia Contiero Syropoulou, "Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System", arXiv:2610.09021 [cs.AI], 2026-10-06 제출, DOI 10.48550/arXiv.2610.09021. 소속: University of West Attica(그리스 아테네), Waldiez PC, ThinGenious PC. NeurIPS 2026 워크숍(SLMs for Agentic Systems, 파리) 발표 논문. 벤치마크·하니스·2520개 기록 전부 공개(github.com/waldiez/slm-callsite-eval).
학회 본선 심사를 거친 논문이 아니라 NeurIPS 2026 워크숍 발표 논문으로, 대개 본선보다 심사 기준이 느슨합니다. 세션 egress가 차단돼 원문 전문은 GitHub Actions가 2026-10-08T22:09:49Z에 받아 둔 arXiv HTML 전문 스냅숏으로 대조했습니다. 이해상충도 뚜렷합니다 — 저자 4명 중 3명이 이번 논문이 평가하는 오픈소스 프레임워크 Wactorz를 만든 회사 Waldiez PC 소속이고, 나머지 1명도 ThinGenious PC 소속입니다. 자사가 만들고 배치한 시스템을 자사가 평가한 구조이며, 자금 출처는 NVIDIA Academic Grant Program(DGX Spark 2대 하드웨어 후원)으로 로컬 추론의 경제성을 강조하는 결론과 공급자 이해가 겹칠 수 있습니다.
연구 개요
연구 질문은 단순합니다 — 한 에이전트가 쓰는 LLM 콜이 전부 같은 난이도가 아닌데도, 가장 어려운 콜에 맞춰 고른 모델 하나로 전부를 처리하는 관행이 맞는가입니다. 저자들은 시뮬레이션이 아니라 실제 배치된 오픈소스 홈오토메이션 멀티에이전트 프레임워크 Wactorz(MQTT로 감독되는 장기 실행 에이전트)를 대상으로, 콜사이트마다 모델을 따로 배정하는 것을 런타임 라우터가 아닌 '설정값'으로 다룹니다.
다섯 콜사이트는 (1) 의도 분류(10토큰 예산의 4지선다), (2) Home Assistant 액션 분류, (3) 기기 레지스트리 대상 액추에이터(자연어→JSON 서비스 호출), (4) 파이프라인 플래너, (5) 그 플랜을 실행하는 코드생성입니다. 앞 세 곳은 운영 중인 시스템 프롬프트 그대로, 뒤 두 곳(생성형)은 출력 계약만 보존한 축약판으로 평가했습니다. 9개 모델(Qwen3.5 0.8B/2B/4B, Gemma4 E2B/E4B/12B/26B, Claude Haiku 4.5, Claude Sonnet 5)을 두 설치(가정·사무실)에 걸친 280개 사례·2520개 채점 콜에서 비교했습니다.
핵심 결과
아래 표는 전체 벤치마크(n=280)에서 콜사이트별 정확도와 호스팅 비용입니다(로컬 모델은 호출당 비용 0). 콜사이트 사이 순서가 모델마다 다르고 크기에 단조적이지 않다는 점이 먼저 드러납니다 — Qwen3.5 4B는 액추에이터에서 2B보다 낮고(50.9% vs 62.1%), Gemma4 26B는 코드생성에서 12B보다 낮습니다(80.0% vs 84.0%).
| 모델 | Intent | HA action | Actuator | Planner | Codegen | All | Cost($) |
|---|---|---|---|---|---|---|---|
| Qwen3.5 0.8B | 50.0 | 71.4 | 33.6 | 8.0 | 24.0 | 33.2 | 0 |
| Qwen3.5 4B | 91.7 | 92.9 | 50.9 | 52.0 | 38.0 | 58.2 | 0 |
| Gemma4 26B | 91.7 | 96.4 | 94.8 | 88.0 | 80.0 | 90.7 | 0 |
| Claude Haiku 4.5 | 80.6 | 92.9 | 93.1 | 82.0 | 94.0 | 89.6 | 3.06 |
| Claude Sonnet 5 | 94.4 | 92.9 | 99.1 | 84.0 | 100.0 | 95.4 | 12.13 |
같은 사례로 수행한 McNemar 쌍대검정에서 가장 성적이 좋은 로컬 모델(Gemma4 26B)은 다섯 콜사이트 중 네 곳에서 두 호스팅 모델과 통계적으로 구분되지 않았습니다. 코드생성만 예외로, 소형 호스팅 모델(Haiku 4.5) 대비 p=0.039, 프런티어 모델(Sonnet 5) 대비 p=0.002로 유의한 차이가 났습니다 — 작은 호스팅 모델에서도 격차가 재현된다는 점이 '프런티어 규모의 문제'가 아니라 '콜사이트 자체의 문제'로 읽는 근거입니다. 액추에이터는 Sonnet 5 대비 p=0.062로 유의성에 못 미쳤지만 불일치 사례 5건이 전부 같은 방향이라, 저자들은 검정력 부족으로 해석합니다.
이를 라우팅 정책으로 바꾸면, 콜사이트별 최적 로컬 모델로 전부 라우팅할 때 전체 정확도 91.8%를 호출당 비용 0원으로 얻습니다(Sonnet 5 단독 95.4% 대비 -3.6%p). 생성형 두 곳(플래너·코드생성)만 호스팅 모델에 맡기는 절충안은 정확도 93.9%(-1.4%p)에 비용은 12.13달러→2.15달러로 82% 줄어듭니다. 호스팅 지출의 81%가 액추에이터 콜에 몰리는데(레지스트리 전체를 프롬프트에 싣는 탓에 평균 입력 토큰 28,122개), 이 콜사이트는 중간 크기 로컬 모델(Gemma4 12B, 95.7%)이 이미 가장 잘 처리합니다 — 지출이 가장 많은 콜사이트가 꼭 가장 어려운 콜사이트는 아니라는 뜻입니다.
실거주 배치 비교(46건 중 43건을 세 설정 모두에서 채점, 3건은 프레임워크 버그 등 모델과 무관한 제약으로 제외)에서도 같은 절충안이 재현됩니다.
| 구성 | Direct(26건) | Pipeline(20건) | 지출($) |
|---|---|---|---|
| 전체 호스팅(Sonnet 5) | 25/26 | 15/20 | 2.47 |
| 생성형만 호스팅 | 24/26 | 15/20 | 0.70 |
| 전체 로컬 | 24/26 | 12/20 | 0.00 |
생성형만 호스팅한 구성은 전체 호스팅과 동일하게 39/43을 성공시켰고 지출은 전체 호스팅 2.47달러의 28%인 0.70달러였습니다. 반면 안전 측면은 집계 정확도가 가려냅니다 — 액추에이터에서 Gemma4 E2B는 그 설치가 소유하지 않은 기기 요청의 87.2%에 서비스 호출을 내보냈고, 반대로 Qwen3.5 0.8B는 모든 요청에 빈 배열을 반환해 '거부'처럼 보이는 116개 사례 전체가 사실은 아무것도 인식하지 못한 결과였습니다.
신뢰도 평가
믿을 근거는 셋입니다. 핵심 비교가 같은 280개 사례에 9개 모델을 동일 조건(temperature 0, 4-bit 양자화, 동일 호스트)으로 통과시킨 통제 설계이고, 오프라인 벤치마크의 예측(액추에이터에서 Sonnet5→Gemma4 26B 전환 시 -4.3%p)이 실거주 배치의 실제 격차(26건 중 1건, -4%p)와 거의 일치해 외부 정합성을 보였으며, 수정한 레이블 3건과 그로 인한 점수 변화(호스팅 모델 +0.08, 로컬 모델 -0.03 — 결론에 불리한 방향)를 숨기지 않고 공개했습니다.
감안할 점도 적지 않습니다. 가장 큰 것은 이해상충입니다 — 평가 대상 프레임워크를 만든 회사 소속 연구자가 자사 시스템을 평가했고 NVIDIA 하드웨어 후원도 받았습니다. 사례당 1회 패스만 수행해 분산을 보고하지 않았는데, 저자 스스로도 실거주 사례 1건이 설정에 따라 성패가 갈렸다고 인정하며, 실거주 평가자도 블라인드되지 않은 단일 평가자입니다. 두 설치 환경(가정·사무실)만 다뤄 다른 레이아웃·기기 구성에 대한 일반화도 미검증입니다. 상반 증거로 보면, 아래 관련 연구의 Belcak et al.이 내놓은 '소형 모델이 대부분 충분하다'는 포지션을 전반적으로 지지하지만 코드생성 콜사이트에서는 정확히 반박합니다 — 지지와 반박이 콜사이트에 따라 갈린다는 뜻입니다.
관련 연구(학술 문헌 대조)
- Belcak et al.(2025). Small Language Models are the Future of Agentic AI — "에이전틱 콜 대부분은 소형 모델로 충분하다"는 포지션 페이퍼로, 전환 절차만 제안했습니다. 이번 논문은 그 절차를 실제 배치 시스템에서 수행해 수치로 보여주지만, 코드생성 콜사이트는 예외로 남아 전면 지지는 아닙니다(선행 연구).
- Ong et al.(2024, ICLR 2025). RouteLLM: Learning to Route LLMs with Preference Data — 쿼리마다 강한/약한 모델을 고르는 학습된 라우터로 비용을 2배 이상 줄인다고 보고합니다. 이번 논문은 쿼리 단위가 아니라 콜사이트 단위(정적 설정값, 런타임 라우터 불필요)로 다르며, 저자들도 둘을 경쟁이 아닌 보완 관계로 둡니다(방법 대조).
- Li et al.(2025, ACL). HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions — 13개 LLM을 평가한 스마트홈 벤치마크로, GPT-4o가 무효한 다중기기 지시에서 0.0% 성공률을 보였다고 보고합니다. 이번 논문의 액추에이터 안전 실패와 같은 '유효/무효 구분' 실패 계열이되, 실제 하드웨어에 작동이 가해진다는 점에서 위험이 한 단계 구체적입니다(벤치마크 대조).
세 문헌을 종합하면, 소형 모델 전환은 포지션 페이퍼 단계를 지나 실제 배치 사례로 확인되는 단계에 들어섰지만, 유효·무효를 가리는 능력은 모델·벤치마크를 가리지 않고 반복해서 걸림돌이 됩니다.
리뷰어 판단
첫째, 이 논문의 가장 중요한 결과는 91.8%나 82%가 아니라 "집계 정확도는 안전 실패를 가린다"는 관찰이라고 판단합니다. Gemma4 E2B와 Qwen3.5 0.8B는 액추에이터에서 비슷한 전체 정확도를 내지만, 하나는 소유하지 않은 기기의 87.2%에 작동하고 다른 하나는 아무것도 인식하지 못한 채 전부 거부합니다. 잠금장치·난방처럼 되돌리기 어려운 작동이 걸린 콜사이트에는 작동률과 거부율을 분리한 지표가 평가 설계의 기본값이어야 한다고 봅니다.
둘째, "생성형만 호스팅"이 정확도 -1.4%p·비용 -82%로 가장 매력적인 절충안처럼 보이지만, Wactorz 한 프레임워크·두 설치 환경에서만 검증된 숫자이므로 그대로 들고 와 쓰면 안 된다고 판단합니다. 가져올 것은 숫자가 아니라 절차 — 콜사이트를 먼저 나누고 각 사이트를 독립적으로 측정한 뒤 라우팅을 설계하는 순서입니다.
실무 적용
- 콜사이트 단위로 모델을 쪼개 배정 — 런타임 라우터 없이, 어떤 콜인지 이미 아는 시점(정적 설정값)에서 모델을 고정합니다.
- 작동형 콜사이트는 작동률·거부율을 분리 측정 — 집계 정확도 하나로는 과잉작동과 전체거부를 구분할 수 없습니다.
- 토큰 단위로 지출처를 추적 — 레지스트리 전체를 담은 액추에이터 프롬프트가 지출의 81%를 차지했습니다. 비용이 가장 많이 나가는 콜사이트가 꼭 가장 어려운 콜사이트는 아닙니다.
- 프레임워크 고유 API 계약에 특화된 코드생성은 전환 후순위로 — 비동기 콜백·수명주기 규칙 같은 익숙하지 않은 API 패턴에서 로컬 모델 격차가 가장 늦게까지 남았습니다.
- 오프라인 집계를 실제 호출 빈도로 재가중 — 벤치마크는 카테고리를 동일 가중하지만 실배치는 호출 비중이 다르므로, 오프라인 점수를 그대로 배치 성능 예측치로 쓰지 않습니다.
결론
이 논문의 기여는 새 모델이 아니라 "모델 선택은 시스템 전체가 아니라 콜사이트 단위의 결정"이라는 재정의입니다. 다섯 콜사이트 중 네 곳에서 로컬 모델이 호스팅 모델과 통계적으로 구분되지 않았고, 생성형 두 곳만 호스팅에 맡기는 절충안은 실거주 배치에서도 비용 82%를 줄이면서 성공률을 거의 유지했습니다. 다만 평가 대상 시스템을 만든 회사가 평가를 수행한 이해상충, 분산 미보고, 두 설치 환경이라는 좁은 검증 범위는 남습니다. 숫자보다 절차 — 콜사이트를 쪼개 측정하고 안전이 걸린 사이트는 따로 채점하는 방식 — 를 가져가는 것이 맞다고 봅니다. 비용 효율화를 운영 관점에서 이어 다루는 글은 소형 모델 라우팅으로 비용을 10배 줄이기에서 볼 수 있습니다.
참고 링크
- Not Every Call Needs a Frontier Model — arXiv 초록(원문)
- 같은 논문 HTML 전문 — 표·수치 대조에 사용
- Small Language Models are the Future of Agentic AI(Belcak et al., 2025) — 관련 연구 원문
- RouteLLM(Ong et al., 2024) — 관련 연구 원문
- HomeBench(Li et al., 2025) — 관련 연구 원문
- 소형 모델 라우팅으로 비용을 10배 줄이기 — sunny34.com 블로그
이 리뷰에 대해 AI와 대화하기
AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…