정확도는 속인다: TriCalRAG 온프레미스 LLM 장애 원인 분석 벤치마크 리뷰
제로샷 프롬프트는 F1은 그럴듯해도 이상 예측 비율이 최대 100%까지 치솟는 붕괴 상태였고, RAG가 이를 안정화한 단일 GPU 온프레미스 벤치마크입니다.
- Mistral-Small 제로샷은 BGL·HDFS·OpenStack에서 이상 예측 비율이 98.7~100%까지 치솟았지만 F1은 0.67~0.72로 정상처럼 보였습니다.
- RAG 적용 시 8개 구성 중 7개가 캘리브레이션 정상 범위에 들었고(제로샷은 8개 중 2개), F1도 제로샷 대비 0.10~0.27 개선됐습니다.
- 단일 RTX PRO 6000에서 배치 크기만으로 처리량이 41배(48.3→1,991.0 tok/s) 늘었고, 4비트 양자화는 정확도 손실 없이 지연을 20% 줄였습니다.













































