원문 정보

Manoj N M, Vijayakrishna S, Manjunath Srinivas, Rohit Pahan, "A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation", arXiv:2608.18740 [cs.AI], 2026-08-19 제출, DOI 10.48550/arXiv.2608.18740. 소속: Rakuten India Enterprise Private Limited(인도 벵갈루루).

동료심사를 거치지 않은 프리프린트이며, 라쿠텐 인디아 소속 저자 4인이 전원 참여한 사내 연구입니다. 평가 데이터셋 중 하나는 두 이커머스 플랫폼에 걸친 프로덕션 경쟁사 가격 인텔리전스 데이터(일본어 콘텐츠 포함)로, 자사 데이터를 자사 시스템으로 평가한 구조입니다 — 독립 검증이 아니라는 점을 감안해야 합니다. 자금 출처는 별도로 명시돼 있지 않습니다. 다만 자동 기능 테스트·LLM-as-a-Judge·인간 전문가 대조를 겹쳐 쓰고 4개 LLM 백엔드로 교차 평가해, 벤더 자체 평가의 한계를 방법론으로 일부 보완하려 한 흔적이 있습니다. 원문 전문은 2026-08-22T21:41:08Z 기준 스냅숏(arXiv HTML 전문 사본)으로 대조했습니다 — 이 세션의 실시간 원문 접근이 막혀 있어 사이트 자동 수집 파이프라인이 받아 둔 사본을 썼습니다.

연구 개요

연구 질문은 두 가지입니다. 자연어 질의를 SQL 생성·데이터 분석·인사이트 정리로 나누는 대화형 BI를 다섯 개 전문화 에이전트로 쪼개면 단일 에이전트보다 실제로 나아지는가, 그 개선의 대가는 무엇인가입니다. CrewAI 기반 순차 파이프라인은 Data Retrieval(스키마 인식 SQL 생성), Data Analysis(패턴·이상 탐지, MCP 경유 차트 생성), Report Aggregation(다국어 리포트 합성), Follow-up Questions(후속 질문 제안), Chart Configuration(시각화 메타데이터 생성) 다섯 역할입니다.

평가는 BigQuery 위 합성 이커머스 데이터셋(4테이블, 1만 2,500레코드)과 프로덕션 가격 인텔리전스 데이터셋(약 56.9만 개 상품, 117만 개 가격 이력, 누적 88억 관측치)에서 진행했습니다. 300개 테스트케이스를 여덟 카테고리로 구성했고, 분석형 260개 중 100개는 인간 전문가 3인이 독립 채점했습니다. 비교축은 (1) 단일 에이전트 대비, (2) 에이전트별 제거 어블레이션, (3) GPT-4.1·Claude Sonnet 4·Gemini 2.5 Flash·Llama 3.1 70B 4개 백엔드 교차 평가입니다.

핵심 결과

기능 정확도는 카테고리 전반에서 멀티에이전트가 앞섰고, 격차는 복잡도가 높을수록 벌어졌습니다.

카테고리멀티에이전트단일 에이전트
단순 집계64/65 (98.5%)61/65 (93.8%)
필터 집계35/35 (100%)29/35 (82.9%)
시계열 분석39/40 (97.5%)34/40 (85.0%)
다중 테이블 조인33/35 (94.3%)26/35 (74.3%)
복합 분석26/30 (86.7%)15/30 (50.0%)
엣지 케이스28/30 (93.3%)23/30 (76.7%)
멀티턴 대화21/25 (84.0%)9/25 (36.0%)
보안 가드레일40/40 (100%)21/40 (52.5%)
합계286/300 (95.3%)218/300 (72.7%)

품질·환각·지연·비용은 서로 기준이 다른 지표이므로 나란히 두되 혼동하지 않아야 합니다. 품질은 LLM-as-a-Judge(평가자 Claude Sonnet 4.5)가 1~5점 척도로 매긴 값이고, 환각 없음 비율은 사실 주장을 원시 쿼리 결과와 대조한 결과이며, 토큰·비용은 쿼리당 평균치입니다.

지표 (기준)멀티에이전트단일 에이전트
전체 품질 (LLM judge 1~5점)4.523.76 (+20.2%)
환각 없음 비율93.0%72.8%
평균 지연시간23.8초15.2초
쿼리당 평균 토큰 수약 30,800약 10,200 (약 3.0배)
쿼리당 추정 비용 (GPT-4.1 요금 기준)약 $0.08약 $0.03 (약 2.7배)

토큰 배수(약 3.0배)와 논문이 명시한 비용 배수(2.7배)가 다른 이유는 GPT-4.1의 입력·출력 토큰 단가 차이 때문입니다($2.00/M 입력, $8.00/M 출력) — 두 수치를 같은 배수로 인용하면 안 됩니다. 4개 백엔드 교차 평가에서 GPT-4.1이 정확도·품질 모두 1위(95.3%, 4.52)였고, 오픈소스 Llama 3.1 70B는 자체 호스팅으로도 멀티에이전트 구조 안에서 79.7%를 기록해 단일 에이전트 GPT-4.1 기준선(72.7%)을 웃돌았습니다. Gemini 2.5 Flash는 정확도 86.3%로 낮지만 지연시간 17.4초·쿼리당 약 $0.01로 가장 저렴했습니다.

어블레이션에서는 다섯 에이전트의 기여가 균등하지 않았습니다. Data Analysis 제거 시 품질이 4.52→3.38로 1.14점 떨어져 낙폭이 가장 컸고, Report Aggregation 제거는 0.66점 하락(3.86)이 다음이었습니다. Follow-up Questions·Chart Configuration 두 에이전트를 함께 제거해도 품질은 4.50으로 0.02점만 떨어져, 병렬 실행으로 전환하면 지연시간만 23.8초→20.1초(15.5%↓)로 줄이면서 품질·정확도는 그대로 유지됐습니다. 보안 가드레일은 40개 적대적 입력을 전부 차단했고(정적 규칙 0.01초 이내, LLM 판정 6~7.5초), 인간 3인 채점(100건)과 LLM 판정의 상관은 r=0.89(p<0.001)·κ=0.82였으며 LLM 판정이 평균 0.14점(실행가능성 +0.24) 후한 편향이 확인됐습니다.

신뢰도 평가

믿을 근거는 세 가지입니다. 핵심 비교가 동일 모델(GPT-4.1)을 단일·멀티 두 아키텍처에 각각 태우는 통제 구조라 아키텍처 효과와 모델 효과가 섞이지 않고, 4개 LLM 백엔드 교차 평가로 이 통제를 한 번 더 검증해 오픈소스 모델에서도 같은 방향이 나왔으며, 인간 평가 100건과의 상관(r=0.89, κ=0.82)이 LLM-as-a-Judge 결과를 뒷받침합니다.

감안할 점도 뚜렷합니다. 저자 전원이 라쿠텐 인디아 소속이고 프로덕션 평가 데이터도 자사 것이라, 벤더가 자사 시스템을 자사 데이터로 채점한 사례에 가깝습니다. 논문이 인용한 LLM-as-a-Judge 방법론 문헌(Zheng et al. 2023)은 판정 모델의 편향 가능성을 지적하는데, 이 논문 스스로도 +0.14점의 긍정 편향을 확인해 그 우려와 같은 방향으로 나타났습니다. 인간 평가는 분석형 260건 중 100건(38%)에, 보안 가드레일 평가는 40건에 그쳐 표본이 작습니다. 프로덕션 데이터셋은 이커머스 가격 인텔리전스라는 단일 도메인에 국한돼 다른 업종 일반화는 논문도 한계로 명시했습니다. 다만 논문이 인용한 SiriusBI(93~96% SQL 정확도, Jiang et al. 2025)와 비교하면 이 시스템의 93.5% SQL 정확도는 유사 선행 사례 범위 안이라, 이례적으로 높은 수치를 홀로 주장하는 구조는 아닙니다. 실행 횟수별 분산·유의성 검정은 보고되지 않아 표의 차이가 우연한 변동을 얼마나 넘어서는지는 판단하기 어렵습니다.

리뷰어 판단

첫째, 이 논문에서 가장 실무적으로 값진 결과는 95.3%라는 최고 수치가 아니라 크로스모델 표의 Llama 3.1 70B(79.7%)라고 판단합니다. 오픈소스·자체 호스팅 모델이 멀티에이전트 구조 안에서 최고급 단일 에이전트(GPT-4.1, 72.7%)를 능가했다는 것은, 도입 우선순위를 "더 좋은 모델"이 아니라 "먼저 아키텍처를 분해할 것"에 두어야 한다는 근거로 읽힙니다.

둘째, 어블레이션이 보여준 비대칭이 도입 설계에 직접 영향을 준다고 봅니다. Data Analysis와 Report Aggregation 두 에이전트가 품질 개선의 대부분을 만드는 반면, Follow-up Questions·Chart Configuration은 품질 기여가 사실상 없고 참여도·UX 목적에 가깝습니다. 다섯 개를 전부 순차로 태우는 대신 핵심 두 에이전트만 고성능 모델에, 나머지는 경량 모델이나 병렬 실행에 배정하는 편이 합리적인 시작점이라고 봅니다.

셋째, 토큰 배수(약 3.0배)와 비용 배수(2.7배)가 다르다는 사실 자체를 실무 신호로 봅니다. 두 수치가 벌어지는 이유가 입력·출력 토큰 단가 차이라는 점은, 출력 비중이 큰 단계(리포트 생성·번역)가 많을수록 요금제 선택에 따라 실제 청구액이 크게 달라질 수 있다는 뜻입니다. 논문은 쿼리량이 수백만 건으로 늘었을 때의 누적 비용은 다루지 않았는데, 도입 전 자체 시산이 필요하다고 봅니다.

실무 적용

  • 모델보다 분해 우선 — 정확도가 부족하면 더 큰 모델로 바꾸기 전에 역할을 나누는 아키텍처 변경을 먼저 검토합니다. 오픈소스 70B 멀티에이전트가 최고급 단일 에이전트를 능가한 사례가 근거입니다.
  • 어블레이션으로 저비용 에이전트 가려내기 — 배포 전 자체 벤치마크로 에이전트별 제거 실험을 돌려, 품질 기여가 낮은 역할(이 논문에서는 후속질문·차트 설정)을 선택적 병렬화나 경량 모델로 전환합니다.
  • 토큰 배수와 비용 배수를 분리 회계 — 두 수치가 벌어지는 원인(입력·출력 단가 차이)을 파악해, 자사 쿼리량 기준으로 실제 청구액을 시산한 뒤 도입을 결정합니다.
  • 2단 보안 가드레일 — 정적 규칙(서브밀리초)과 LLM 기반 판정(수 초)을 함께 배치해, 지연 없는 차단과 정교한 판단을 모두 확보합니다.
  • LLM-judge 편향은 인간 표본으로 정기 감사 — 소규모 인간 평가로 상관계수·카파와 편향 방향(항목별)을 주기적으로 재확인해, 판정자가 후해지는 방향으로 표류하지 않는지 점검합니다.

결론

이 논문은 대화형 BI를 다섯 개 전문 에이전트로 쪼개면 단일 에이전트보다 정확도(+22.6%p)와 품질(+20.2%)이 함께 오른다는 것을 통제된 비교와 4개 백엔드 교차 검증으로 보여줍니다. 다만 그 대가는 토큰 약 3배, 비용 약 2.7배이며, 어블레이션은 이 개선의 대부분이 다섯 에이전트 중 둘(Data Analysis, Report Aggregation)에서 나온다는 사실도 함께 드러냅니다. 벤더가 자사 데이터로 자사 시스템을 평가한 프리프린트라는 한계는 안고 읽어야 하지만, 오픈소스 모델로도 재현되는 방향성과 인간 평가와의 상관은 "아키텍처 분해가 어디까지 값어치를 하는가"를 자체 데이터로 확인해 볼 근거로는 충분합니다. 정확도 지표 하나만으로 배포를 결정하는 위험은 정확도 너머의 성능 점검 설계에서 더 다룹니다.

참고 링크