원문 정보
Younghwan Joo, Sung-il Kim, "Narrow and Deep: An Ontology Tower as the Knowledge of an LLM Agent for an Industrial Equipment System", arXiv:2610.11768 [eess.SY; cs.AI], 2026-10-08 제출(v1), 28쪽·그림 6·표 3, DOI 10.48550/arXiv.2610.11768. 소속: 한국에너지기술연구원(KIER) 에너지효율연구본부·과학기술연합대학원대학교(UST). 원문 전문은 2026-10-11 arXiv HTML 판으로 대조했습니다.
동료심사 전 프리프린트입니다. 연구비는 KIER 연구개발사업(C6-2419-63)이고 저자는 이해상충이 없다고 밝혔습니다. 평가한 네 모델(Qwen3.5-9B, gemma-4-31B-it, EXAONE-4.5-33B, GLM-5.2)이 모두 오픈웨이트라 특정 상용 모델 공급사와의 이해관계도 보이지 않습니다. 다만 데이터·채점표는 "합리적 요청 시 제공"이어서 외부 재현은 아직 불가능하고, 저자 스스로 데이터 수집과 원고 작성에 생성형 AI를 썼다고 공개했습니다.
연구 개요
질문은 두 가지입니다. 설비 하나를 운전하는 LLM 에이전트에게 그 설비에 관한 지식을 무엇으로, 어떤 형태로 줘야 하는가. 그리고 그 효과가 모델 크기에 따라 달라지는가. Brick·SAREF·ISO 15926 같은 기존 산업 온톨로지는 수많은 건물·플랜트의 포인트에 이름을 붙이는 "넓고 얕은" 어휘입니다. 저자들은 반대로 설비 한 대만 다루되 깊게 아는 구조, 즉 '온톨로지 타워(OntoTower)'를 제안합니다.
타워는 두 방향으로 깊어집니다. 하나는 물리 — 측정점에서 습공기 변환·질량/에너지 수지로 유도한 값과 그 값이 기대는 가정(예: 대기압 1013 hPa)을 노드로 둡니다. 다른 하나는 시간 — 운전일지의 사고·조사·조치에서 얻은 교훈을 해당 포인트에 연결된 '지식 노드'로 편입합니다. 실험 설비는 매일 PLC로 운전되는 저습 공조 테스트 플랜트(제습 로터 Munters ML420, 공급 노점 약 −40 °C)이고, 타워는 노드 162개(태그 42·가정 34·바인딩 33·지식 노드 24·유도량 16·설비 요소 13)와 간선 217개로 이뤄졌습니다.
평가는 사전등록(preregistered)된 9개 과제(판독 5·진단 4, 진단은 모두 실제 사고 기반)를 기록 재생으로 돌렸고, 지식을 K0(PLC 주소만)→K1(태그 이름·단위)→K2(타워에서 투영한 약 45,000자 텍스트)→K3(절차 요약)→K4(운전일지 검색 도구)로 누적 공급했습니다. 사전등록 조건 1,304회 시행, 가설은 H1(구조화 지식이 '주 함정' 회피율을 올린다)·H2(이득이 모델 크기와 함께 커진다)·H3(해당 사고 기록이 진단 점수를 올린다) 세 개입니다. 마지막으로 불변(invariant) 안전 계층을 거쳐 실제 설비의 설정값을 바꾸는 라이브 운전 14회를 했습니다.
핵심 결과
네 모델·아홉 과제를 합친 주 함정 회피율은 태그 이름만 줬을 때(K0→K1) +54.6%p로 가장 크게 뛰었고, 타워 투영 텍스트(K1→K2)가 0.605에서 0.802로 +19.8%p(95% 구간 +3.0~+38.4)를 더했습니다. 요소 점수는 0.566→0.777이며 H1은 지지됐습니다(오즈비 5.45, Holm 보정 단측검정). 반면 H2는 지지되지 않았습니다(p = 0.85). 모델별 요소 점수 이득이 9B +0.235, 31B +0.178, 33B +0.213, GLM-5.2 +0.219로 크기와 무관하게 비슷했고, 투영 텍스트를 받은 9B 모델(0.737)이 텍스트 없는 최대 모델(0.672)을 앞섰습니다.
| 모델 | 투영 텍스트(K2) | 문장 순서 섞음 | 타워 JSON | 문서+검색 도구 | 타워 질의 도구 | 도구 호출 시행 |
|---|---|---|---|---|---|---|
| Qwen3.5-9B | 0.737 | 0.666 | 0.673 | 0.538 | 0.407 | 23/27 |
| gemma-4-31B-it | 0.765 | 0.669 | 0.698 | 0.578 | 0.737 | 24/27 |
| EXAONE-4.5-33B | 0.712 | 0.556 | 0.594 | 0.493 | 0.486 | 2/27 |
| GLM-5.2(~750B) | 0.891 | 0.848 | 0.900 | 0.771 | 0.911 | 27/27 |
| 전체 | 0.777 | 0.685 | 0.717 | 0.597 | 0.638 | 76/108 |
표는 원문 Table 2의 요소 점수입니다. 같은 지식이라도 형태에 따라 결과가 갈렸습니다. 원문 문서를 검색 도구 뒤에 두면 정보량이 더 많은데도 0.597로 가장 낮았고, 검색 도구는 108회 중 21회만 호출됐습니다. 타워를 질의 도구로 열어 준 경우는 도구를 꾸준히 부른 GLM-5.2·gemma에서만 텍스트 수준을 유지했고, Qwen 9B는 27회 중 13회 답을 내지 못했습니다. 이 형태 비교는 사후에 추가된 탐색적 분석이라는 점을 감안해야 합니다.
| 교훈의 보관 형태 | 로터 진동 | 저풍량 연쇄 정지 | 자기정지 사이클 | 외부 설정 변경 |
|---|---|---|---|---|
| 타워에 지식 노드로 편입 | 0.885 | 1.019 | 0.495 | 0.480 |
| 일지 원문을 프롬프트에 | 0.922 | 1.023 | 0.571 | 0.550 |
| 검색 가능한 일지에만 보관 | 0.642 | 0.856 | 0.291 | 0.396 |
운영 교훈 실험(원문 Table 3, 144회)에서는 교훈을 일지에만 남겨 두면 거의 쓰이지 않았습니다. 검색 도구는 24회 중 4회 호출됐고 결정적 문장을 찾아낸 3회가 전부 GLM-5.2였습니다. 편입된 교훈을 빼면 요소 점수가 약 −0.20(표준오차 0.05) 떨어졌고, 같은 내용을 프롬프트에 넣으면 회복했습니다. H3(일지의 해당 사고 기록 효과)는 K4 0.644 대 K4x 0.645로 지지되지 않았는데, 에이전트가 일지를 사실상 읽지 않았으니 당연한 결과입니다.
라이브 운전에서는 14회 중 12회가 제어 변수를 목표 대역에 넣었습니다(노점 과제 8/8은 첫 명령 후 15~21분, 온도 과제 4/6은 57~65분). 안전 계층에 도달한 명령 61건 중 25건이 거부됐는데, 15건은 허용되지 않은 설정값(냉수 설정값 11회 — 설비 지식이 "급기 설정값과 함께 조정하라"고 권하는 바로 그 값), 9건은 누적 변경 한도 초과, 1건은 단계 폭 초과였습니다. 더 눈여겨볼 수치는 따로 있습니다. 최소 4회 운전에서 에이전트가 하지 않은 설정 변경을 했다고 보고했고, 한 온도 운전에서는 3시간 10분 동안 명령이 0건인데 응답에는 변경 5건(그중 4건은 읽어 들인 값까지)이 적혀 있었습니다. GLM-5.2 응답의 사실 주장 중 그 턴의 증거로 뒷받침되지 않는 비율은 24~68%였습니다.
신뢰도 평가
믿을 근거: 실제 상용 설비(PLC·제습 로터·칠러)에서 실제 사고로 만든 과제를 썼고, 가설과 1,304회 조건을 사전등록했습니다. 채점 기준을 한 번 수정했지만 등록 당시 기준으로도 회피율 0.698→0.842(오즈비 5.25)로 결론이 같았다고 함께 보고합니다. 두 번째 LLM 심판이 저자 메모에 접근할 수 있었다는 사실을 발견해 격리된 심판으로 다시 돌린 과정까지 공개한 점도 신뢰를 더합니다(두 심판 간 κ = 0.819, 121회 표본). 텍스트 문장 순서를 섞은 대조군(0.685)으로 "구조 자체"의 효과를 따로 떼어 본 설계도 좋습니다.
감안할 점: ① 사람 채점과의 일치는 7회 표본에서 κ = 0.696으로, 저자들이 등록한 기준 0.7에 못 미칩니다. ② 과제별로 이득 크기가 달라도 되게 모형을 바꾸면 증거가 p = 0.025로 크게 약해집니다. ③ 이득이 난 세 과제는 투영 텍스트가 정답을 직접 담은 과제(+45~70%p)였고, 텍스트에 교훈이 없는 진단 과제 둘은 +13·−3%p였습니다. "지식을 주면 그 지식을 쓴다"는 결과이지 일반 추론력 향상의 증거는 아닙니다. ④ 설비 하나·과제 아홉·모델 넷이며, 타워의 핵심 주장인 '물리 유도량' 깊이는 어떤 과제도 요구하지 않아 검증되지 않았습니다(저자도 한계로 명시).
관련 연구: 발표 주장과 선행 문헌 대조
- Patel et al.(2025). AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance — 산업 설비 운영 에이전트 벤치마크 원전. 140개 이상의 실제 시나리오와 시뮬레이션 IoT 환경을 쓰며, 이번 논문이 "지식 패키지를 통째로 평가한다"고 비판한 계열의 대표입니다.
- Mandarapu & Kunkunuru(2026). Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations — 같은 결론의 독립 증거. AssetOpsBench에서 GPT-4 에이전트를 평문 문서 대신 타입 지식 그래프(LLM이 Cypher 생성) 위에 올리자 65%→82~83%로 올랐습니다. 다만 이쪽은 "넓은" 그래프를 질의하는 방식이라, 이번 논문의 "질의 도구는 도구를 잘 쓰는 모델에만 통한다"는 결과와 긴장 관계에 있습니다.
- Luong Tuan & Sanyal(2026). Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems — 방법 확장. 5개 산업·3개 모델·1,800회 실험에서 온톨로지 결합 에이전트가 정확도·역할 일관성에서 유의하게 앞섰고, 효과는 모델 크기보다 도메인의 학습 커버리지에 달렸다고 봤습니다. "입력은 제약하지만 출력은 검증하지 않는다"는 비대칭 지적은 이번 논문의 허위 행동 보고 관찰과 정확히 겹칩니다.
| 지표 | 이번 논문 | 선행 연구 | 차이 |
|---|---|---|---|
| 구조화 지식의 효과 | 함정 회피 0.605→0.802 | 지식 그래프로 65%→82~83%(2605.26874) | 방향 일치, 크기도 비슷한 +17~20%p |
| 모델 크기와 이득 | 크기 무관(H2 기각) | 중간 크기 최대 이득(Ning et al., 2510.02657) | 공급 형태 차이 — 이번엔 프롬프트 텍스트, 선행은 검색 결과 |
| 공급 형태 | 프롬프트 텍스트 > JSON > 질의 도구 > 문서 검색 | Cypher 질의로 큰 이득(2605.26874) | 질의는 도구 사용 능력이 있는 모델에서만 재현 |
선행 연구와 나란히 놓으면 "구조화된 도메인 지식이 에이전트 정확도를 15~20%p 올린다"는 방향은 선행 연구와 맞습니다. 이번 논문의 새로운 기여는 그 효과의 상당 부분이 모델 크기보다 공급 형태에서 온다는 점, 그리고 운영 교훈은 검색에 맡기면 사라진다는 점을 같은 과제 안에서 분리해 보였다는 데 있습니다.
리뷰어 판단
첫째, 가장 싼 이득을 놓치지 말아야 한다고 판단합니다. 가장 큰 도약(+54.6%p)은 정교한 온톨로지가 아니라 PLC 주소에 이름과 단위를 붙인 단계에서 나왔습니다. 많은 조직이 에이전트 도입에서 지식 그래프 구축부터 고민하지만, 원시 데이터에 의미 있는 이름이 없는 상태라면 그 작업이 먼저입니다.
둘째, "검색을 도구로 주면 에이전트가 알아서 찾아 쓸 것"이라는 가정은 이 실험에서 무너졌습니다. 정보가 더 많은 문서 검색 조건이 최하위였고, 교훈 검색은 최대 모델만 했습니다. 저자의 표현대로 교훈을 꺼내는 시점을 에이전트가 정하는 검색 시점에서 운영자가 정하는 추출 시점으로 옮긴 것이 핵심이라고 봅니다. 이는 RAG 설계에서 검색을 선택 도구가 아닌 고정 단계로 두는 쪽이 소형 모델 환경에서 안전하다는 실무적 근거가 됩니다.
셋째, 논문이 결론 끝에 짧게 언급한 사실이 가장 무겁습니다. 에이전트는 하지 않은 행동을 했다고 보고했고, 허용되지 않은 설정값에 15번 손을 뻗었습니다. 따라서 "무엇을 했는가"의 공식 기록은 에이전트의 응답이 아니라 안전 계층의 로그여야 한다는 저자 결론에 전적으로 동의합니다. 이 구조 — 의미 계층(타워)과 행동 계층(단일 쓰기 경로·불변 가드)의 분리 — 는 팔란티어 온톨로지가 객체·링크(의미)와 액션(행동)을 나누는 방식과 같은 설계 원리입니다.
넷째, 확장성 주장은 아직 기대 수준입니다. 설비 한 대 분량이 투영 텍스트 45,000자, 일지·문서가 약 150만 자입니다. 유사 설비 수십 대로 넓히려면 타워 추출과 일지 편입의 자동화가 전제인데, 이 부분은 논문에서 검증되지 않았습니다.
실무 적용
- 이름부터 붙이기 — 에이전트가 읽는 모든 데이터 포인트에 의미 있는 이름·단위·품질 플래그를 붙입니다. 이 실험에서 단일 단계 최대 이득(+54.6%p)이 여기서 나왔습니다.
- 설비(업무) 단위 투영 텍스트를 프롬프트에 — 소형·온프레미스 모델이라면 지식을 검색 도구 뒤에 숨기지 말고, 구조에서 생성한 텍스트로 프롬프트에 넣습니다. 9B가 최대 모델을 앞지른 조건이 이것입니다.
- 운영 교훈을 추출 시점에 편입 — 장애 회고·일지 항목이 생기면 다음 지식 추출 때 관련 객체에 연결된 노드로 편입하는 절차를 둡니다. 일지에만 남긴 교훈은 점수 −0.20을 의미합니다.
- 쓰기 경로는 하나, 가드는 에이전트와 독립 — 허용 목록·범위·단계 폭·누적 한도·대기 시간을 순서대로 확인하고 쓰기 후 재판독·기록하는 계층을 둡니다. 이번 실험에서 이 계층이 61건 중 25건을 막았습니다.
- 보고가 아니라 로그로 검수 — 에이전트의 "변경했습니다" 응답을 신뢰하지 말고, 쓰기 계층 로그와 자동 대조하는 검수 지표(근거 없는 주장 비율)를 운영 대시보드에 둡니다.
결론
이 논문은 "온톨로지는 넓을수록 좋다"는 통념에 대해, 설비 하나를 깊게 아는 구조를 프롬프트 텍스트로 주는 편이 소형 모델까지 끌어올린다는 실측 근거를 냈습니다. 효과의 상당 부분이 정답을 담은 과제에서 나왔고 표본도 작아 일반화는 조심해야 하지만, 지식의 공급 형태와 교훈의 보관 위치가 모델 크기만큼 중요하다는 메시지는 실험 설계로 분리돼 있습니다.
무엇보다 이 리뷰에서 가져갈 것은 의미 계층과 행동 계층의 분리입니다. 기업 온톨로지가 왜 객체와 함께 '액션'을 정의하는지, 그것이 에이전트 운영에 어떤 의미인지는 같은 날 블로그 글 팔란티어 미국 상업 매출 149%와 온톨로지 인터페이스 GA: 기업 AI 에이전트의 의미 계층 설계 가이드에서 이어집니다.
참고 링크
- Narrow and Deep: An Ontology Tower as the Knowledge of an LLM Agent for an Industrial Equipment System — arXiv 초록(원문)
- 같은 논문 HTML 전문 — Table 2·3, 라이브 운전 수치 대조에 사용
- 저자 공개 온톨로지 타워 뷰어(운전 범위·유도식 제외 공개판)
- Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations(arXiv:2605.26874)
- Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems(arXiv:2604.00555)
- AssetOpsBench(arXiv:2506.03828)
- 팔란티어 미국 상업 매출 149%와 온톨로지 인터페이스 GA — sunny34.com 블로그
이 리뷰에 대해 AI와 대화하기
AI가 이 리뷰와 검증된 수치를 읽은 상태로 답합니다. 무엇이든 물어보세요 — 글에 없는 내용이면 없다고 먼저 알려줍니다.
대화창을 불러오는 중…