원문 정보
Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng, "EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval", arXiv:2608.11584 [cs.AI], 2026-08-12 제출. 소속: Jiutian Research, China Mobile(중국 베이징). 라이선스 CC BY 4.0. 벤치마크·평가 프레임워크는 논문 공개 시점에 추가 공개 예정.
동료심사를 거치지 않은 프리프린트입니다. 저자 전원이 China Mobile 산하 연구조직 Jiutian Research 소속이고, 벤치마크의 원 질의 491건도 자사 프로덕션 RAG 운영 로그에서 가져왔습니다. 실제 배포 환경의 실패 양상을 반영한다는 강점이 있는 동시에, 원본 로그를 공개하지 않아 외부에서 표본 구성을 직접 검증할 수 없다는 제약도 함께 갖습니다. 도메인 중 하나인 '당건설(Party Building)'은 중국 국유기업 내부 규정·정책 해석 업무로, 다른 다섯 도메인(에너지·의료·법률·금융·웹검색)과 달리 국내 실무에 그대로 대응되는 영역은 아닙니다.
연구 개요
연구 질문은 두 가지입니다. 첫째, 검색 결과에 노이즈·지식 공백·사실 충돌이 섞인 상태에서 LLM이 복합 지시사항(형식·페르소나·근거 인용 등)을 얼마나 지키는가. 둘째, 개별 제약을 지키는 능력과 지시사항 전체를 동시에 지키는 능력이 같은 방향으로 움직이는가. 저자들은 기존 RAG 벤치마크가 검색 품질과 지시 준수를 따로 평가해 왔다고 지적하며, 둘을 함께 시험하는 EnterpriseRAG를 제안합니다.
데이터는 6개 도메인(에너지·의료·법률·금융·당건설·웹검색)에서 수집한 원 질의 491건에 하이브리드 검색(BM25+임베딩)으로 문서를 붙이고, 노이즈(주제는 비슷하나 무관한 문서)·지식 공백(근거 부족)·사실 충돌(모순되는 문서) 세 시나리오를 결합해 983개 인스턴스를 만들었습니다. 공백·충돌은 실제 로그에 드물어(각각 5.3%·8.7%만 자연 발생) 통제된 절차로 증강했다고 명시했습니다. 평가는 두 축입니다. Loose IAS는 개별 제약 충족 비율, Strict IAS는 모든 제약을 동시에 충족했는지의 이진 판정입니다. 지식 공백에는 거부 정확도, 사실 충돌에는 충돌 인지 정확도를 별도로 측정했습니다. 채점은 규칙 기반 검사(형식)와 LLM 심판(행동 프로토콜)을 병행했고, 사람 150건 표본과의 일치도(카파 0.77, 일치율 88%)로 심판의 신뢰도를 검증했습니다.
핵심 결과
13개 모델을 노이즈 섞인 검색 결과(447건) 위에서 평가한 표입니다. Loose IAS는 개별 제약 충족 비율, Strict IAS는 전 제약 동시 충족 비율로 기준이 다르므로 나란히 놓고 차이를 봐야 합니다.
| 모델 | 추론 방식 | 충실도 | Loose IAS | Strict IAS |
|---|---|---|---|---|
| Qwen3-8b | 추론형 | 64.8% | 75.5% | 12.3% |
| Qwen3-235B-Thinking | 추론형 | 67.1% | 83.8% | 26.8% |
| DeepSeek-R1 | 추론형 | 68.9% | 83.1% | 21.9% |
| Gemini-2.5-Pro | 추론형 | 73.5% | 83.7% | 26.5% |
| GPT-4.1 | 표준형 | 69.8% | 80.0% | 19.5% |
| Claude-Opus-4.5 | 추론형 | 76.4% | 83.3% | 25.3% |
| Claude-Sonnet-4 | 표준형 | 76.8% | 79.8% | 19.5% |
최고 성능인 Qwen3-235B-Thinking도 Loose IAS 83.8%에서 Strict IAS 26.8%로 57%p가 빠집니다. 개별 규칙은 거의 다 지키면서 지시사항 전체를 한 번에 만족시키는 비율은 4건 중 1건에 불과하다는 뜻입니다. 같은 계열 안에서 크기 효과도 뚜렷합니다 — Qwen3-Thinking은 8B에서 235B로 커지며 Strict IAS가 12.3%에서 26.8%로 두 배 넘게 오르지만, 충실도는 64.8%에서 67.1%로 거의 제자리입니다. 조합적 지시 준수가 사실적 정확도보다 훨씬 큰 규모를 요구하는 능력이라는 뜻으로 읽힙니다.
지식 공백·사실 충돌에서는 다른 문제가 드러납니다. 지식 공백 227건 중 정답이 없다고 밝혀야 하는 상황에서 Qwen3-30B-Instruct는 거부율 6.6%(즉 93.4%는 없는 답을 지어냄)에 그쳤고, 추론형 중 최고인 Claude-Opus-4.5도 42.7%로 절반을 넘지 못했습니다. 사실 충돌 309건에서 충돌을 알아챈 비율(Conflict Recognition)은 1위 DeepSeek-R1이 44.3%, GPT-4.1은 18.5%였습니다. 세 시나리오의 표본 구성은 노이즈 447건(45.5%)·지식 공백 227건(23.1%)·사실 충돌 309건(31.4%)으로 전체 983건과 합이 맞습니다.
신뢰도 평가
방법론 검증은 비교적 촘촘합니다. 심판을 세 개 LLM(Kimi-k2-thinking, Qwen3-235B-Thinking, GPT-4o)으로 교차 비교해 판정 신뢰도(ICC)가 Loose IAS 0.809, 거부·충돌 정확도는 0.99 이상으로 나왔고, 사람 150건 표본과의 일치도도 카파 0.77(일치율 88%)로 확인했습니다. 다만 이해상충은 뚜렷합니다 — 저자 전원 China Mobile 소속이고, 데이터 원천도 자사 운영 로그입니다. 프라이버시를 이유로 원본 로그는 비공개이며 탈식별화한 표본과 생성 파이프라인만 공개한다고 밝혀, 외부 연구자가 표본 편향 여부를 직접 재현·검증하기는 어렵습니다. 지식 공백·사실 충돌 표본의 91~95%가 자연 발생이 아니라 통제된 절차로 증강한 것이라는 점도 결과 해석에 영향을 줍니다 — 저자들은 부록에서 합성·자연 표본의 난이도가 핵심 지표에서 동등하다고 검증했다고 밝혔지만, 이 검증 자체도 같은 저자 그룹의 판단입니다. 상반되는 결론을 낸 선행 연구는 확인되지 않았습니다 — 오히려 이 논문이 지적하듯 CRAG·RAGBench·GaRaGe 등 기존 벤치마크는 노이즈·거부·충돌 중 한두 축만 다뤄, 개별 제약과 전체 준수의 괴리 자체를 드러낸 선행 사례가 드뭅니다. 원 데이터가 중국어 운영 로그 기반이라는 점도 다른 언어권 배포 환경에 그대로 일반화하기 전에 감안할 요소입니다.
리뷰어 판단
첫째, 이 논문의 핵심 가치는 개별 수치가 아니라 Loose·Strict IAS를 나란히 보여준 설계 자체라고 판단합니다. RAG 파이프라인을 낱개 제약 체크리스트로만 QA하면 실제 프로덕션에서 필요한 '지시사항 전부 동시 충족'과는 다른 숫자를 보게 됩니다. 조직 내부 평가 기준에 Strict 지표에 해당하는 항목을 최소 하나는 넣어야 한다고 봅니다.
둘째, Qwen3-30B-Instruct의 거부율 6.6%는 이 벤치마크에서 가장 위험한 수치라고 판단합니다. 지식 공백 상황에서 열에 아홉 넘게 없는 답을 지어낸다는 뜻이고, 추론형 모델로 바꿔도 최고가 42.7%에 그친다는 사실은 '추론 강화 = 안전'이라는 단순한 등식이 성립하지 않음을 보여줍니다. 지식 공백 대응은 모델 선택만으로 풀리지 않고 별도의 거부 로직·검증 단계가 필요하다는 근거로 읽힙니다.
셋째, 충돌 인지와 답변 커버리지의 상관관계가 추론형(ρ=+0.90)과 표준형(ρ=-0.50)에서 정반대 방향이라는 결과는 실무적으로 의미가 큽니다. 추론형 모델은 더 많은 근거를 담을수록 충돌도 더 잘 잡아내지만, 표준형 모델은 답을 길게 뽑을수록 오히려 충돌을 놓칠 위험이 있다는 뜻입니다. 같은 커버리지 목표를 두 계열 모델에 동일하게 적용하면 표준형에서 의도치 않은 위험이 커질 수 있습니다.
실무 적용
- Strict 지표를 배포 기준에 포함 — Loose IAS(개별 충족률)만으로 합격 판정하지 말고, 전체 지시 동시 충족 여부를 최종 게이트로 둡니다.
- 거부 로직 별도 검증 — 지식 공백 상황에서 모델이 '정보 없음'을 말하는지 별도 테스트셋으로 상시 점검합니다. 표준형 모델일수록 하락 폭이 큽니다.
- 충돌 인지 프로토콜 명시 — 근거 문서 간 모순 시 둘 다 인용하라는 식의 명시적 프로토콜을 프롬프트에 넣습니다. 이 논문은 명시적 프로토콜이 충돌 인지는 크게 올리지만 거부 정확도 개선은 제한적이라고 보고했습니다.
- 모델 계열별 커버리지 전략 분리 — 표준형 모델에는 답변 길이·커버리지를 무리하게 늘리지 않도록 하고, 추론형 모델 위주로 커버리지 확장을 검토합니다.
- 도메인별 제약 밀도 확인 — 법률·의료처럼 근거 인용·조건부 서술이 많은 도메인일수록 Strict IAS가 더 크게 떨어질 가능성이 높으므로, 도메인 단위로 별도 기준을 둡니다.
결론
EnterpriseRAG는 노이즈·지식 공백·사실 충돌이라는 세 가지 비이상적 조건에서 LLM의 복합 지시 준수를 측정해, 개별 제약은 최대 83.8%까지 지키면서 전체 동시 준수는 26.8%에 그치는 57%p 격차를 확인했습니다. 지식 공백에서의 거부 정확도(최고 42.7%)와 사실 충돌 인지율(최고 44.3%)도 프로덕션 기준에는 못 미칩니다. 저자 전원이 China Mobile 소속이고 원 데이터가 비공개라는 한계는 있지만, 심판 간 신뢰도 검증은 충실해 방법론 자체의 신빙성은 낮지 않습니다. RAG 시스템의 정답률 지표를 넘어서는 평가 기준이 필요하다는 논의는 RAG 에이전트 평가 기초: 정답률보다 중요한 지표에서 이어집니다.